lgquan/dsh-voco--packages-voice-local0

@lgquan/dsh-voice-local

Cross-platform local ONNX VAD and ASR with Edge TTS for dsh-voice

包名
@lgquan/dsh-voice-local
版本
0.1.0
最近更新
2026年8月27日

安装

此插件尚未提供可验证的 bundle,或兼容性检查未通过。请先阅读仓库说明。 阅读完整 README ↗

dsh-voco

English | 中文

像 ChatGPT 高级语音那样,用自然的语音和你的 dsh 编码 Agent 对话——而且不止是聊天,它能真正把活干完。

你开口说一句需求,dsh 立刻用自然口语回应。当你要的是一份「任务」(查代码、跑构建、改文件……),语音前端会把它派给持续复用的后台 Agent Session;完整报告留在任务界面,语音只说专门生成的口语版结果,不朗读报告。

交互

  • 实时语音对话:浏览器采集音频,经本地 Silero VAD、流式 Paraformer ONNX 识别,回复使用 Edge TTS 的 Xiaoxiao 中文音色,支持边说边听和打断。
  • 按需派活:本地 ASR 后先由轻量前台模型判断意图;寒暄和无需工具的问题直接回答,只有读取或修改项目、运行命令等工作才通过 realtime_delegation 进入固定后台 Agent。
  • 连续任务上下文:同一语音会话的多次委派复用一个后台 Agent Session,每次任务仍有独立 delegation id。
  • 独立口语化结果:后台 Agent 用 progress | result | warning | error | question 事件和唯一的 detail 字段提交完整事实;语音层结合用户原话调用独立模型重写,并把整段回复作为一条页面消息和一次 TTS 响应。Edge TTS 内部仍按句合成,但不会拆成多个气泡。
  • 可恢复的双会话记忆:停止再启动语音或重启 DSH 后,会恢复来源 Session 的最近对话及其固定后台 Agent Session 绑定;中断任务会告知上次进度,但不会自动重放。
  • 不中断的体验:浏览器切走、断线重连,正在跑的语音会话和后台任务都不会停。

安装

pnpm install
pnpm build
$repo = (Resolve-Path .).Path
dsh plugin --profile web add "$repo\packages\voice-app" "$repo\packages\voice" "$repo\packages\voice-local" "$repo\packages\voice-assistant" "$repo\packages\voice-web" "$repo\packages\ui-voice"

项目名是 dsh-voco,内部包统一使用 @lgquan/* 命名空间。

dsh 命令来自 npm install -g @deepseek-ai/dsh。启动 web(voice 界面随之加载):

dsh web

本地语音环境

pnpm install 会自动运行跨平台模型安装器,把 Silero VAD 和中文/英文流式 Paraformer 权重下载到 speech/models。语音回复使用 Edge TTS 网络服务和 zh-CN-XiaoxiaoNeural 音色;dsh web 启动时只加载本地 ASR/VAD 模型。安装器可重复执行:pnpm run setup:voice-local

语音运行时完全使用 TypeScript/Node 与预编译 ONNX 原生包,不要求 Python、pip、虚拟环境或 PyTorch。支持 Windows x64,以及 macOS Intel 和 Apple Silicon。

限制

  • 浏览器麦克风与播放界面面向 dsh Web UI:它由复制而来的 dsh client tsdown 预设构建,并通过 dsh web 运行时的 window.__ModuleLoader__ 契约加载,因此不是框架无关的浏览器插件。
  • Voice Session 记录按「读取时必需」处理的持久 voice/* 事件;不带本插件的 dsh 构建加载它们会被拒绝。