3274375092/dsh-voice0

dsh-voice

DeepSeek Harness 语音输入插件:麦克风 → 本地/浏览器识别 → 文本进会话(纯输入,与 agent preset 解耦)

AI 分析

适合习惯语音输入的用户。支持本地原生识别与浏览器 Web Speech 双引擎,提供边说边看的流式定稿体验,通过快捷键或图标触发。

パッケージ
dsh-voice
バージョン
0.1.0
ライセンス
MIT
最終更新
2026/08/14

インストール

$npx -p @deepseek-ai/dsh dsh plugin --profile web add github:3274375092/dsh-voice

ドキュメント

README 全文を読む ↗

可选: 配置(编辑 ~/.dsh/profiles/web/cordis.patch.yml)


```yaml
- id: voice
  config:
    modelDir: './dsh-voice-models'   # 原生识别模型目录
    hotkey: 'ctrl+space'             # 全局快捷键
    vadThreshold: 0.3                # 越低越不吞句首尾
    tailPadSeconds: 0.6              # 尾音补偿时长
dsh web   # 输入框左侧 🎤 或 Ctrl+Space

详见 USAGE.mdINSTALL.md

工作原理

浏览器采麦(自动重采样 16k)
   → PCM base64 分块(256ms)→ /voice RPC 通道(loopback)
   → host: silero VAD + zipformer2 流式解码
   → partial 逐块回传(边说边看)/ final 定稿(精确句首 + 0.6s 尾音补偿)
   → conversation 服务提交(与打字同路)

双引擎:客户端 ping /voice 探测 host 原生能力;不可用自动降级浏览器 Web Speech。

开发

pnpm install --ignore-workspace   # 独立依赖(不依赖 DSH monorepo)
pnpm test                         # 单测(含真实模型冒烟)
pnpm typecheck && pnpm build      # 构建(tsc host 半 + tsdown client 半)

结构:src/index.ts(host 半)/ src/client/(浏览器半)/ src/core/(识别核心)/ tools/(线协议冒烟 + 模型下载)。

License

MIT