woyeshishen/dsh-vision-plugin ↗★ 0
dsh-vision-plugin
为 DeepSeek Harness 提供外部视觉模型能力:纯文本主模型通过 describe_image 工具调用外部视觉模型看图,拿到纯文字描述(多模态补全)。
安装
此插件尚未提供可验证的 bundle,或兼容性检查未通过。请先阅读仓库说明。 阅读完整 README ↗
说明文档
阅读完整 README ↗dsh-vision-plugin
为 DeepSeek Harness(DSH)提供外部视觉模型 / 多模态能力的动态 Cordis 插件:给纯文本主模型(如 deepseek)配一个 OpenAI 兼容的外部视觉模型,主模型通过 describe_image 工具把图片交给副模型、拿到纯文字描述,从而补齐「看图」能力。
核心设计:图像只发给副模型(外部视觉模型);主模型本质上始终只处理文字。
特性
- ✍️ 注册
describe_image工具:主模型需要看图时调用它,返回纯文字描述。 - ⚙️ 设置页「多模态视觉」:输入 URL / API key / 从 endpoint 拉取模型列表选择,保存即生效。
- 🔐 凭据持久化:API key 存于
.credentials.yaml(密文,界面不回显);配置存于settings.yaml。 - 🌐 复用 DSH 内置
dsh-llm-pi-ai适配器发起请求,无需自建网络代码。 - 🔄 模型列表经
ctx.llm.discoverModels('llm-pi-ai', …)从 endpoint 的GET /models拉取。
快速开始
1. 加载插件(动态插件)
这是 DSH 动态 Cordis 插件。将 host.js 函数体填入 code.host、client.js 函数体填入 code.client,通过 cordis_define + cordis_run 挂载(或在 DSH 会话中让 agent 按本仓库加载)。
动态插件是进程局部的:DSH 重启后需重新挂载。如需随启动自动加载,可改造为静态插件接入部署配置。
2. 配置外部视觉模型
打开 设置 → 多模态视觉:
| 字段 | 说明 |
|---|---|
| URL(Base URL) | OpenAI 兼容 endpoint,如 https://api.example.com/v1 |
| API key | 外部模型的密钥(存凭据库,不回显) |
| 模型 | 点「加载模型」拉取列表并选择 |
点「保存」。
3. 使用
在对话中让主模型看图,例如:
看一下
D:\path\to\image.png,描述里面的内容
主模型会自动调用 describe_image,返回外部视觉模型生成的文字描述。
工具参数
describe_image
| 参数 | 必填 | 说明 |
|---|---|---|
path | ✅ | 图片文件路径(绝对或相对工作区路径);支持 png / jpg / jpeg / webp / gif |
prompt | ❌ | 针对图片的具体问题;省略时默认「详细描述图片内容」 |
文件结构
dsh-vision-plugin/
├── host.js Host 半:配置 RPC + describe_image 工具
├── client.js Client 半:设置页「多模态视觉」表单
├── docs/
│ └── architecture.md 架构与数据流说明
├── scripts/
│ └── check.mjs 语法检查(node scripts/check.mjs)
├── AGENTS.md 给 AI agent 的开发指引
├── CONTRIBUTING.md 贡献指南
├── LICENSE Apache-2.0
└── package.json 包元数据