dsh-voice
Voice for DeepSeek Harness — give text-only DeepSeek ears and a mouth: browser-native speech input (STT) + read-aloud (TTS), plus Whisper/TTS agent tools.
安装
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:zhuiyueya/dsh-voice说明文档
阅读完整 README ↗🎤 🔊 dsh-voice
给 DeepSeek Harness 补上声音 —— 让纯文本的 DeepSeek 拥有「耳朵」和「嘴巴」。
DeepSeek 的对话 API 是纯文本的——既听不懂音频、也说不出话。dsh-voice 在输入/输出边界把声音桥接成文本,模型全程只看到文本,却获得完整的语音回路:
🎤 语音 → 文本 → DeepSeek(纯文本)→ 文本 → 🔊 语音
和
dsh-vision-bridge是同一思路(把图片在进模型前转成文本)——只是这次补的是听觉,这块 DeepSeek Harness 的多模态空白还没人填。
✨ 功能
| 层级 | 作用 | |
|---|---|---|
| 🎤 | 语音输入(STT)— Web UI | 输入框工具行里的麦克风按钮。点击说话,转写结果通过浏览器 Web Speech API 直接写入输入框。 |
| 🔊 | 朗读(TTS)— Web UI | 每条 assistant 回复上的朗读按钮。点击用 speechSynthesis 把这条回答读出来。 |
| 📄 | voice_transcribe 工具 | 把附件的音频文件(wav/mp3/m4a/ogg/webm/flac)转成文字,走任意 Whisper 兼容的 /audio/transcriptions 端点。 |
| 🗣️ | voice_speak 工具 | 把文本合成语音文件,走任意 OpenAI 兼容的 /audio/speech 端点。 |
- ✅ Web UI 零 API key —— 纯浏览器语音,开箱即用。
- ✅ 不换模型 —— DeepSeek 仍是纯文本,语音在边缘处理。
- ✅ 后端可配 —— 指向本地 whisper.cpp / Kokoro,即可做到完全免费、免 key。