zfu691531-hash/dsh-realtime-voice0

dsh-realtime-voice

Lightweight realtime speech-to-speech for DeepSeek Harness with Qwen and OpenAI providers.

AI 分析

核心用途是提供低延迟的实时语音交互。适合需要与 AI 进行口语对话、语音助手交互的用户,需自备相应 API 密钥。

パッケージ
dsh-realtime-voice
バージョン
0.12.0
ライセンス
MIT
最終更新
2026/08/16

インストール

$npx -p @deepseek-ai/dsh dsh plugin --profile web add github:zfu691531-hash/dsh-realtime-voice

ドキュメント

README 全文を読む ↗

配置

在 Harness 的凭据配置中提供所选线路的引用:

  • 千问:DASHSCOPE_API_KEY,并在插件设置里填写同区域的百炼 Workspace ID。
  • OpenAI:OPENAI_API_KEY
  • 可选声纹:TENCENT_SECRET_IDTENCENT_SECRET_KEY。声纹音频会按用户显式启用发送到腾讯云说话人验证服务;插件只持久化腾讯云返回的不透明 VoicePrintId,不持久化录音或声纹特征。

插件设置只保存 provider、Workspace ID、ASR/TTS 模型、TTS 音色、VAD/语段合并/草稿停留参数、声纹开关/阈值和播报风格;不保存 Key。声纹 ID 只存 Host 设置且不会返回浏览器,原始 PCM 仅在当前 utterance 的内存中短暂存在。千问默认使用北京区、qwen3-asr-flash-realtimeqwen3-tts-flash-realtimeChelsie;OpenAI 默认使用 gpt-realtime-2.1marinTina 是 Omni 专属音色,独立 TTS 不支持;Chelsie 是专用 TTS 中更接近其软糯亲昵风格的选择。