@gw/dsh-mimotts
MiMo TTS speech synthesis for DeepSeek Harness: a voice-synthesis settings page, a speak button under every finalized assistant message, and an inline player with a draggable progress bar 适合需要语音朗读回复的DSH用户,需DSH 0.1.7及以上版本。
インストール
$
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:1497105876/dsh-mimottsドキュメント
README 全文を読む ↗@gw/dsh-mimotts — MiMo TTS 语音合成插件(DeepSeek Harness 0.1.7)
把助手回复"读出来"的 DSH 插件:设置页里的"语音合成"配置页 + 每条已定稿助手回复动作行里的音量按钮 + 带可拖动进度条的内联播放器。语音由小米 MiMo TTS(mimo-v2.5-tts)合成,API Key 只存在于宿主侧,浏览器只发送文本、收到 WAV。
面向 deepseek-harness 0.1.7-rc.2(engines.dsh: ">=0.1.7-rc.2 ,体:
{
"model": "mimo-v2.5-tts",
"audio": { "format": "wav", "voice": "mimo_default" },
"messages": [{ "role": "assistant", "content": "开心要说的话" }]
}
音色克隆时 audio 换成 { "format": "wav", "voice_audio": { "format": "wav", "data": "" } };响应 choices[0].message.audio.data 为 base64 音频(RIFF 或裸 PCM,裸 PCM 由插件包成 24kHz/16bit/mono WAV)。
已知边界
- 按消息朗读:动作行属于该条已定稿回复,朗读其正文(不读思考块与工具调用);代码块以"代码略"代替。
- 文本超过"单次最大字符数"时朗读开头并在句末截断(动作行旁有提示)。
- Desktop(Electron)走 IPC 桥接 fetch,路由路径不变。
- 语音输入(麦克风)是官方
voice-input组合包的职责,与本插件互补不冲突。
验证记录
tsc全量类型检查通过(对着 0.1.7-rc.2 的真实 .d.ts)node --test:17/17 通过(请求形状/PCM 封装/Markdown 归一化/文本提取/错误码映射)scripts/stub-e2e.mjs:真实 HTTP 桩端到端通过(96,044 字节 WAV)- MiMo 实机协议探测通过(与官方
mimo-tts-wavskill 同一契约,115,244 字节 WAV);scripts/live-e2e.mjs可对真实 API 跑完整引擎链路