jinhuoooo/dsh-voice-input ↗★ 0
dsh-voice-input
Voice-to-text for DSH, powered by Whisper. One click to record, speak, and text appears in the input box. Local-first (privacy), Simplified-Chinese output, anti-hallucination, works in China without a VPN. · DSH 语音输入插件:点一下麦克风说话,文字自动进输入框。本地优先、强制简体、防幻觉、国内网络直连可用。
安装
$
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:jinhuoooo/dsh-voice-input说明文档
阅读完整 README ↗首次使用(自动配置)
第一次点麦克风时,插件会自己干活,你什么都不用管:
- 自动检查 Python 依赖(faster-whisper、modelscope 等),缺了自动装
- 自动从 ModelScope 下载 Whisper 模型(默认 small,约 480MB,取决于网速)
- 装完就能用
下载期间界面会提示进度,耐心等一两分钟。之后再点就是秒开了。
使用
点击输入框右侧的麦克风图标,按钮下方会弹出一个小白卡片:
[🎤 音量条] [00:07] [■] [✕]
- 左边是麦克风图标和音量条,说话时它会跟着你声音起伏,能直观确认麦克风在收音
- 中间是录音时长
分钟:秒 - 右边两个小圆钮:红色方块 = 停止并出字,灰色 × = 取消(丢弃,不留痕)
- 录满 60 秒会自动停止并转写,不用一直按着
转写完成后文字直接进输入框,你可以改完再发送。取消就真的什么都不要了,不会把一段错误文字塞给你。
配置(可选)
不加配置文件也能用,默认本地 small 模型。想自定义就复制 config.example.json 为 config.json(放在插件目录下),改完重启 DSH。
切换本地模型
{
"local": {
"model": "medium",
"language": "zh",
"device": "cpu",
"computeType": "int8"
}
}
| 模型 | 大小 | 中文准确率 | 速度 | 内存 |
|---|---|---|---|---|
| tiny | ~75MB | 差 | 最快 | ~150MB |
| base | ~145MB | 一般 | 快 | ~250MB |
| small | ~480MB | 还行(默认) | 中等 | ~500MB |
| medium | ~1.5GB | 好 | 较慢 | ~1.5GB |
| large-v3 | ~3GB | 最好 | 最慢 | ~3GB |
模型只下载一次,换模型不用重新下载别的(除了第一次)。内存不够就 small,想更准就 medium。
用云端 API(更快,可选)
本地模型对老电脑可能偏慢,想要更快更准可以接云端,配置 API Key 即可:
- Groq(免费,Whisper Large v3):去 console.groq.com 注册拿 Key
- SiliconFlow(SenseVoice,中文优化,有免费额度):去 siliconflow.cn 注册
{
"api": {
"provider": "groq",
"apiKey": "gsk_your_key_here"
}
}