ruby1304/dsh-vision-subagent ↗★ 0
dsh-vision-subagent
Vision for text-only DeepSeek Harness agents: delegate image reading to a one-shot subagent on a configurable vision route (MiniMax / Kimi / any OpenAI-compatible provider), keeping image bytes and the vision model's context out of the main session.
安装
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:ruby1304/dsh-vision-subagent说明文档
阅读完整 README ↗dsh-vision-subagent
给纯文本模型的 DeepSeek Harness 装上眼睛:把读图任务交给一个跑在独立视觉路由(MiniMax / Kimi / 任意 OpenAI 兼容供应商)上的一次性子代理。图片字节和视觉模型的中间上下文不会进入主会话,主模型只收到最终的文字结论。
为什么是子代理
- 上下文隔离:大图 / 多图对比不再占用主模型窗口,只有蒸馏后的文本返回
- 多轮视觉推理:子代理可以自己调用 read_image 看更多工作区文件、反复比对后再给结论
- 成本与路由分离:视觉调用走 MiniMax/Kimi 路由单独结算,主模型只负责推理
快速开始
`sh
1. 安装到 web profile(本地 checkout / npm 包均可)
dsh plugin --profile web add /path/to/dsh-vision-subagent
或发布后:dsh plugin --profile web add dsh-vision-subagent
2. 配置视觉路由(编辑 ~/.dsh/profiles/web/cordis.patch.yml)
`
`yaml
- insert:
- id: vision-subagent name: 'dsh-vision-subagent' config: provider: kimi-coding # 或 minimax-cn / 自定义路由 model: k3 # 或 MiniMax-M3 / MiniMax-VL-01 `
`sh
3. 重启 dsh web,开新会话后对模型说:
'看下 ~/Desktop/error.png 是什么报错'
模型会自主调用 vision_agent(images=[...], question=...)
`
输入框直接粘贴图片(Codex 式)
安装后,Web 输入框原生支持粘贴/拖入图片。发送时,client 插件会先把图片上传给插件的主机端点:
- 主机校验会话、把图片存成持久附件(大小/类型受部署限额约束)
- 视觉路由在独立上下文完成一次分析(图片字节不进主会话)
- 只有分析文本随你的消息一起发给主模型——主模型直接回答,不需要再调工具
分析失败(超时/路由故障)时消息不会发送,输入框草稿原样保留。这个通道与 vision_agent 工具互补:粘贴图片走自动分析,工作区已有文件由模型自主调用工具读取。
MiniMax / Kimi 视觉模型速查
| 供应商 | baseURL | 视觉模型 | key 环境变量 |
|---|---|---|---|
| Kimi(月之暗面) | https://api.moonshot.cn/v1 | k3 / kimi-k3 / moonshot-v1-8k-vision-preview | MOONSHOT_API_KEY |
| MiniMax | https://api.minimaxi.com/v1 | MiniMax-VL-01 | MINIMAX_API_KEY |
| MiniMax 国内 | (llm-pi-ai 内置 minimax-cn 路由) | MiniMax-M3 | MINIMAX_CN_API_KEY |
两条路线:
- (推荐):在 Settings/Models 里已有 kimi-coding 或 minimax-cn 时,插件配置只需 provider + model,key 走该路由的凭据引用,插件自身永远不接触密钥。