SnowfallC/dsh-mobile-voice-call ↗★ 1
dsh-mobile-voice-call
App-free mobile voice calls with existing DeepSeek Harness sessions
安装
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:SnowfallC/dsh-mobile-voice-call说明文档
阅读完整 README ↗本地语音配置
默认配置适用于 Windows x64。whisperExecutablePath 和 whisperModelPath 为 auto 时自动安装;也可改为已有的 whisper-cli 与 GGML 模型路径。whisperThreads 控制转写线程数,默认值为 8。
语音合成默认使用 Hojo-TTS-Light 80M,并通过随插件提供的合成参考音频克隆一条偏可爱、略带傲娇感的中文声线。首次启动会在 DSH 缓存目录建立隔离的 Python 3.12 环境,并下载约 348 MB 的模型及 CPU 推理依赖;无需手动配置系统 Python。可通过 hojoReferenceAudioPath 和 hojoReferenceText 使用自己的参考音频与逐字稿,通过 hojoThreads 调整 CPU 线程数,也可用 hojoModelDirectory 或 hojoPythonPath 指向现有环境。Hojo 尚未就绪或合成失败时会回退到 Windows 系统语音。自动下载的模型与官方推理源码均固定版本、体积与 SHA-256 校验。
80M 引擎采用按需加载:启动 DSH 时只准备轻量后备语音,打开“手机通话”面板后才在后台预热 Hojo。模型只在本次 DSH 进程中加载一次,关闭面板不会反复占用初始化时间。朗读前还会移除中英文圆括号及其中内容,避免动作、语气或角色扮演说明被念出;会话中显示的原始回复不受影响。
朗读按句号、问号和感叹号分段。插件每 250 毫秒读取 DSH 原生 assistant/chunk,完整句子一出现便提交合成并开始播放,无需等待整轮回复结束;Hojo 单模型仍按安全队列生成后续句子。Hojo 当前不提供逐帧音频流,因此这里实现的是句级流式播放。回复文字会随对应语音开始播放而显示,默认使用 8 个 CPU 线程。
每次接通会话后,插件只在第一条语音消息前加入一次通话说明,要求后续回复采用自然、简短、适合朗读的表达,并避免自行添加括号动作、角色扮演旁白或舞台说明;连续通话不会重复注入同一段文字。Markdown 清理只发生在本地朗读前,不会改写会话中的原始回复。
[!WARNING] 本功能属于实验性功能,流量经 Cloudflare 中转,临时隧道不提供固定地址或服务等级保证。请勿处理敏感任务,使用后立即撤销链接。