jinhuoooo/dsh-voice-input0

dsh-voice-input

Voice-to-text for DSH, powered by Whisper. One click to record, speak, and text appears in the input box. Local-first (privacy), Simplified-Chinese output, anti-hallucination, works in China without a VPN. · DSH 语音输入插件:点一下麦克风说话,文字自动进输入框。本地优先、强制简体、防幻觉、国内网络直连可用。

包名
dsh-voice-input
版本
2.3.0
许可证
MIT
最近更新
2026年8月17日

安装

$npx -p @deepseek-ai/dsh dsh plugin --profile web add github:jinhuoooo/dsh-voice-input

首次使用(自动配置)

第一次点麦克风时,插件会自己干活,你什么都不用管:

  1. 自动检查 Python 依赖(faster-whisper、modelscope 等),缺了自动装
  2. 自动从 ModelScope 下载 Whisper 模型(默认 small,约 480MB,取决于网速)
  3. 装完就能用

下载期间界面会提示进度,耐心等一两分钟。之后再点就是秒开了。

使用

点击输入框右侧的麦克风图标,按钮下方会弹出一个小白卡片:

[🎤 音量条]  [00:07]  [■] [✕]
  • 左边是麦克风图标和音量条,说话时它会跟着你声音起伏,能直观确认麦克风在收音
  • 中间是录音时长 分钟:秒
  • 右边两个小圆钮:红色方块 = 停止并出字灰色 × = 取消(丢弃,不留痕)
  • 录满 60 秒会自动停止并转写,不用一直按着

转写完成后文字直接进输入框,你可以改完再发送。取消就真的什么都不要了,不会把一段错误文字塞给你。

配置(可选)

不加配置文件也能用,默认本地 small 模型。想自定义就复制 config.example.jsonconfig.json(放在插件目录下),改完重启 DSH。

切换本地模型

{
  "local": {
    "model": "medium",
    "language": "zh",
    "device": "cpu",
    "computeType": "int8"
  }
}
模型大小中文准确率速度内存
tiny~75MB最快~150MB
base~145MB一般~250MB
small~480MB还行(默认)中等~500MB
medium~1.5GB较慢~1.5GB
large-v3~3GB最好最慢~3GB

模型只下载一次,换模型不用重新下载别的(除了第一次)。内存不够就 small,想更准就 medium。

用云端 API(更快,可选)

本地模型对老电脑可能偏慢,想要更快更准可以接云端,配置 API Key 即可:

  • Groq(免费,Whisper Large v3):去 console.groq.com 注册拿 Key
  • SiliconFlow(SenseVoice,中文优化,有免费额度):去 siliconflow.cn 注册
{
  "api": {
    "provider": "groq",
    "apiKey": "gsk_your_key_here"
  }
}