dsh-vision-mix
A DeepSeek Harness Mix plugin for vision routing plus GPT Image generation and editing.
安装
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:haiziyao/dsh-vision-mix说明文档
阅读完整 README ↗Vision Mix
Vision Mix 是 DeepSeek Harness 的视觉增强插件。它把文本模型、视觉模型和可选的图片生成 API 组合成一个 Mix 模型,让原本不支持图片的 Agent 能识别上传图片、理解网页截图、持续追问图片内容,并生成或编辑图片。
模型的 Base URL、协议和 API Key 仍由 DSH 的“设置 → 模型”统一管理。Vision Mix 只引用已经配置好的 Provider,不复制凭据。
三分钟上手
1. 安装
在 DeepSeek Harness 仓库目录执行:
pnpm dsh plugin --profile web add dsh-vision-mix
启动 Web:
pnpm dsh web
安装后的正常启动不需要 --patch。
2. 配置准备使用的模型
打开“设置 → 模型”,配置至少两个模型:
| 用途 | 要求 | 示例 |
|---|---|---|
| 基础模型 | 能处理文本、推理和工具调用 | deepseek-chat、deepseek-v4-pro |
| 识图模型 | 中转站实际支持 OpenAI/Anthropic 图片消息 | gpt-5.6-sol、其他视觉模型 |
识图和基础模型可以来自同一个 Provider,也可以分别使用不同中转站。
如果还要生成或编辑图片,再配置一个支持 OpenAI-compatible /images/generations 和 /images/edits 的 Provider。它可以使用与识图模型完全不同的 Base URL 和 API Key。
3. 一键接入中转站识图模型
打开“设置 → Vision Mix”,在“识图模型接入”中:
- 从“待接入模型”选择刚才配置的视觉模型。
- 点击“一键测试并配置”。
- Vision Mix 会临时授予该模型
image能力,发送一张红色测试图。 - 模型正确识别红色后,Vision Mix 才会保存能力声明并把它设为图片模型;失败会自动回滚。
测试会产生一次很小的模型调用,但不会出现在聊天会话中。
4. 选择基础模型和可选能力
继续在“设置 → Vision Mix”完成:
- 选择基础模型。
- 确认图片模型是刚才测试通过的模型。
- 根据需要选择意图识别模型,用于判断“再详细一点”等模糊的跨轮图片追问。
- 根据需要开启“自动识别 Agent 工具返回的截图或图片”。
- 点击“保存路由”。
5. 开始使用
新建对话,在模型选择器中选择 Mix,然后尝试:
上传一张图片:这张图里是什么?
下一轮追问:右下角还有什么?
让 Agent 截图:检查当前网页有没有布局问题。
Mix 是 Vision Mix 注册的固定模型入口,不是一个需要单独填写 API Key 的模型服务。
中转站识图模型接入说明
很多中转站的 只返回模型 id,不会声明模型能否接受图片。DSH 会安全地把这类自定义模型视为纯文本模型;如果直接发送图片,请求会在本地被拒绝,并不会到达中转站。

