121103qwq/dsh-vision-sidecar ↗★ 0
dsh-vision-sidecar
Add no-key hosted or OpenAI-compatible vision to DeepSeek Harness while keeping DeepSeek as the reasoning model
安装
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:121103qwq/dsh-vision-sidecar说明文档
阅读完整 README ↗dsh-vision-sidecar
给 DeepSeek Harness 的纯文本模型外挂“托管视觉眼睛”,同时保留 DeepSeek 作为推理大脑。图片先交给免费或自定义的 OpenAI 兼容视觉 API,VLM 实际生成并交给 DeepSeek 的描述会写入 DSH Session,之后按普通文本重放。
默认使用 OVHcloud AI Endpoints 的匿名 Qwen2.5-VL-72B-Instruct。默认每个 IP、每个模型每分钟 2 次,不需要注册账号或视觉 API Key;也不需要本地 VLM、GPU 或下载数 GB 模型。
和已有插件的不同点
- 默认就是免注册托管视觉。 在已可用的 DSH 文本模型之上,默认 OVHcloud 视觉端点无需账号或 Key;匿名额度为每个 IP、每个模型每分钟 2 次,也可选用自己的 OVH Key 提高认证限额。
- 可持久重放。 VLM 输出是正式的 DSH Session 消息,不是只存在于单次请求改写或进程内缓存里的隐藏文本。
- 纯文本零额外开销。 对话里没有尚未描述的图片时,完全不会访问视觉提供商。
- 主模型可替换。 默认与 DeepSeek 路由一起测试;不依赖专有 replay state 的其他 DSH 文本路由也可通过
targetProvider与targetModel指定。 - 失败不伪装成功。 缺凭据、超时、限流和服务端错误都会明确报错,不会把原图静默转交给纯文本模型。
- Git 安装无需构建授权。 仓库直接交付原生 ESM JavaScript,没有
prepare构建脚本。
要求 DSH 0.1.0-rc.6 或同一 0.1.x 线上的更高版本,以及 Node.js 22.19+ 或 24+。
三步即用:免注册托管视觉
开始前,你需要一个已能正常调用文本模型的 DSH Web profile。默认主路由是 deepseek-official/deepseek-v4-flash,因此还需要你自己的 DEEPSEEK_API_KEY;这一主模型调用按其原有规则计费。
- 确认 DSH Web profile 已能正常调用文本模型。
- 安装插件并启动 Web profile;默认 OVHcloud 视觉层不需要注册或视觉 Key。
$env:DEEPSEEK_API_KEY = ''
dsh plugin --profile web add github:121103qwq/dsh-vision-sidecar#v0.1.2
dsh --profile web
POSIX shell 只需使用 export DEEPSEEK_API_KEY='...'。插件会新增并默认选择 deepseek-vision/deepseek-with-vision。如果你的 profile 有优先级更高的用户 patch,请在模型选择器中手动选择 DeepSeek + Hosted Vision。
“免注册”只指默认的视觉预处理端点。匿名层的额度、价格和地区限制仍以 OVHcloud 当前条款为准;主推理路由仍沿用它原有的凭据、额度和计费规则,默认的 deepseek-official/deepseek-v4-flash 仍需要 DEEPSEEK_API_KEY。
插件刻意不内置“大家共用的免费 Key”。默认使用 OVHcloud 按 IP/模型限制的匿名层;如需认证限额,请使用你自己的 Key,插件不会保存或收集它。
图片处理流程
- 从 DSH 已校验的 Attachment Store 读取图片。
- 以有限批次发送到配置的 OpenAI 兼容
/chat/completions端点。 - 所有批次都成功后,才把完整视觉描述和附件 SHA-256 ID 写为持久 Session notice。
- 调用纯文本主模型前,把图片替换成确定性的描述引用。
- 后续轮次(包括 DSH 重启后)复用已记录描述,不会再次消耗免费 VLM 配额。
图片中的文字会被明确标记为“不可信视觉证据”,提醒主模型只当数据处理。这属于提示注入加固,不代表能从模型层面彻底消除提示注入。