maoyuching/dsh-voice-chat1

dsh-voice-chat

豆包式语音对话客户端插件:聊天框麦克风按钮(按住说话)→ 语音转文字发送 → 回复自动朗读。

包名
dsh-voice-chat
版本
0.3.0
许可证
MIT
最近更新
2026年9月5日

安装

$npx -p @deepseek-ai/dsh dsh plugin --profile web add github:maoyuching/dsh-voice-chat

配置(改配置文件即可)

在 profile 的 ~/.dsh/profiles/web/cordis.patch.yml 里按 id 覆盖 config(全部可选项,不改则用默认值):

- id: dsh-voice-chat
  name: 'dsh-voice-chat'
  config:
    # 语音识别设置
    asrEngine: siliconflow          # siliconflow | groq | mimo | custom(语音转文字)
    asrApiKey: sk-xxxx              # ASR 密钥(或环境变量 DSH_VOICE_ASR_KEY)
    asrBaseUrl: https://api.siliconflow.cn/v1   # mimo 请填完整端点 https://api.xiaomimimo.com/v1/chat/completions
    asrModel: FunAudioLLM/SenseVoiceSmall       # mimo 用 mimo-v2.5-asr
    llmModel: deepseek-v4-flash     # 转述模型(最低优先级 fallback):默认跟当前对话/主界面选中的 LLM 走;连 agentDefaultModel 都没有时才用这里
    silenceMs: 2500                 # 静音多少毫秒后自动结束录音
    # 朗读设置
    rewrite: true                   # 是否用 LLM 把长回复转述后再朗读(默认关闭,设置页可切换)
    ttsEngine: edge                 # edge(微软 Edge TTS,免费)| mimo(小米 MiMo TTS)| custom(自定义 OpenAI 兼容接口)
    voice: zh-CN-XiaoxiaoNeural     # 朗读音色(edge-tts 音色 id,也可在设置面板选)
    ttsBaseUrl: https://api.openai.com/v1  # 自定义 TTS 的 API 地址(ttsEngine=custom 时必填)
    ttsModel: tts-1                 # 自定义 TTS 的模型名称(留空用内置默认)
    ttsApiKey: sk-xxxx              # 自定义 TTS 的 API Key(留空则沿用 ASR 密钥)
    rate: '+10%'                    # 语速('+15%' 更快,'+0%' 原速)
    shortTextChars: 50              # 短于此字数的回复直接原样读、不转述

改完重启 dsh web 生效。

⚙️ 设置入口(DSH 自带设置弹窗里,优先级最高)

不用动配置文件:打开 DSH 的设置弹窗(左下角齿轮),左侧点「voice chat」,右侧即可改:

🎤 语音识别设置

  • ASR 的 Base URL / 模型名 / API Key
  • 识别后是否自动发送
  • 静音自动结束时长(秒)

🔊 朗读设置

  • 长回复转述朗读开关(默认关闭)
  • TTS 引擎选择(微软 Edge TTS 免费 / 自定义 TTS OpenAI 兼容接口)
  • 朗读音色(Edge TTS)
  • 自定义 TTS 的 Base URL / 模型名 / API Key

保存后写入插件根目录的 settings.local.json 并立即生效。优先级:设置弹窗 > cordis.patch.yml 行 config > 环境变量 > 默认值;某项留空即回落到下一层。