zfu691531-hash/dsh-realtime-voice ↗★ 0
dsh-realtime-voice
轻量级实时语音对讲插件,支持千问和 OpenAI 接口,具备声纹验证、VAD 语段合并及多种播报风格设置。
AI 分析
核心用途是提供低延迟的实时语音交互。适合需要与 AI 进行口语对话、语音助手交互的用户,需自备相应 API 密钥。
安装
$
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:zfu691531-hash/dsh-realtime-voice说明文档
阅读完整 README ↗配置
在 Harness 的凭据配置中提供所选线路的引用:
- 千问:
DASHSCOPE_API_KEY,并在插件设置里填写同区域的百炼 Workspace ID。 - OpenAI:
OPENAI_API_KEY。 - 可选声纹:
TENCENT_SECRET_ID与TENCENT_SECRET_KEY。声纹音频会按用户显式启用发送到腾讯云说话人验证服务;插件只持久化腾讯云返回的不透明 VoicePrintId,不持久化录音或声纹特征。
插件设置只保存 provider、Workspace ID、ASR/TTS 模型、TTS 音色、VAD/语段合并/草稿停留参数、声纹开关/阈值和播报风格;不保存 Key。声纹 ID 只存 Host 设置且不会返回浏览器,原始 PCM 仅在当前 utterance 的内存中短暂存在。千问默认使用北京区、qwen3-asr-flash-realtime、qwen3-tts-flash-realtime 和 Chelsie;OpenAI 默认使用 gpt-realtime-2.1 和 marin。Tina 是 Omni 专属音色,独立 TTS 不支持;Chelsie 是专用 TTS 中更接近其软糯亲昵风格的选择。