ai-yucheng/dsh-audio-copilot1

dsh-audio-copilot

Audio Copilot for DeepSeek Harness: transcribe audio (ASR) and synthesize speech (TTS) — gives text-only agents ears and a voice. Windows-local SAPI TTS out of the box; OpenAI-compatible ASR/TTS endpoints configurable. Includes an in-composer voice-input (mic) button.

AI 분석

为纯文本智能体赋予语音输入和语音播报能力。适合需要与 DSH 进行语音交互、解放双手的用户。必要条件是需配置 ASR/TTS 兼容端点,Windows 用户可直接使用本地 SAPI。

패키지
dsh-audio-copilot
버전
0.1.0
라이선스
MIT
최근 업데이트
2026. 8. 20.

설치

$npx -p @deepseek-ai/dsh dsh plugin --profile web add github:ai-yucheng/dsh-audio-copilot

⚙️ 配置

在 profile 的 cordis.patch.yml 里覆盖(所有键都有默认值,不配也能用 TTS):

- id: audio-copilot
  config:
    # ASR:OpenAI 兼容 /audio/transcriptions 端点
    asrBaseUrl: https://open.bigmodel.cn/api/paas/v4
    asrModel: glm-4v-asr
    asrApiKeyEnv: ZHIPU_API_KEY
    # TTS 引擎:sapi | edge | openai
    ttsEngine: sapi
    ttsBaseUrl: https://open.bigmodel.cn/api/paas/v4
    ttsModel: glm-tts
    ttsApiKeyEnv: ZHIPU_API_KEY
    ttsVoice: Microsoft Huihui Desktop
默认说明
asrBaseUrlhttps://open.bigmodel.cn/api/paas/v4ASR 端点根(OpenAI 兼容)
asrModelglm-4v-asrASR 模型名
asrApiKeyEnvZHIPU_API_KEY持 key 的环境变量名
ttsEnginesapiTTS 引擎:sapi(本地)/ edge(在线)/ openai(兼容端点)
ttsBaseUrlhttps://open.bigmodel.cn/api/paas/v4openai 引擎端点
ttsModelglm-ttsopenai 引擎模型
ttsApiKeyEnvZHIPU_API_KEYopenai 引擎 key 环境变量
ttsVoiceMicrosoft Huihui Desktop默认音色
maxAudioBytes26214400转写文件大小上限
transcribeTimeoutMs120000ASR 超时
ttsTimeoutMs90000TTS 超时
maxSegments20audio_ask 返回的命中片段上限

🎯 使用示例

在会话里对模型说:

  • 「把这个录音转成文字:C:\meeting.wav
  • 「读一下这段总结的语音版」
  • 「这个会议录音里,3 分钟的时候说了什么?」
  • 「把这段代码用语音念出来」