whitelonng/dsh-plugin-describe-image ↗★ 5
@deepseek-ai/dsh-tool-describe-image
Model-facing describe_image tool: asks a vision-language model at an OpenAI-compatible endpoint to describe an image file or URL
安装
此插件尚未提供可验证的 bundle,或兼容性检查未通过。请先阅读仓库说明。 阅读完整 README ↗
说明文档
阅读完整 README ↗dsh-plugin-describe-image
English | 中文
DeepSeek Harness 图片理解插件 —— 面向模型的 describe_image 识图工具,让纯文本模型(DeepSeek V4 等)也能看懂图片。
一个 DeepSeek Harness 插件:面向模型的 describe_image 工具。它加载一张图片——本地文件路径、http(s) URL 或持久附件引用——并请求 OpenAI 兼容端点上的视觉语言模型(VLM)(Qwen-VL、GLM-4V、GPT-4o 或本地 Ollama 端点)描述它。只有返回的文本跨入对话,图片本身从不进入会话日志。关键词:DeepSeek Harness 插件、describe_image 工具、图片理解、图像描述、多模态、视觉语言模型、VLM、纯文本模型、Qwen-VL、GLM-4V、GPT-4o、Ollama。
安装
dsh plugin --profile web add github:whitelonng/dsh-plugin-describe-image
桌面应用的插件列表安装框可直接粘贴同一条 spec(github:whitelonng/dsh-plugin-describe-image),插件在应用重启后加载。
特性
- 三种输入形式:本地路径、http(s) URL,或
[image attachment …]注记里的 JSON(经 harness 附件服务解析——把注记原样复制进image即可)。 - 实时配置卡片:Web GUI「设置 → 插件 → 图像理解」卡片可直接改
baseURL、model与 API Key(走凭据缝),保存立即生效、无需重启。 - 逐调用 API Key 解析:内联
apiKey→ 凭据缝(apiKeyEnv,默认VISION_API_KEY)→ 启动环境。 - 安全与边界:每次请求拒绝重定向,
maxBytes/maxOutputTokens/timeoutMs上界,魔数媒体类型闸门,错误摘要有界,密钥绝不入日志。 - 配套 harness 改动(随 harness 仓库发布,不在本子树内):DeepSeek 纯文本路由把图片块压平为可复制的
[image attachment …]注记,宿主在纯文本路由上接受图片提示——两者一起闭环「把图片发给纯文本模型」。
快速开始(在 DeepSeek Harness 检出内)
# cordis.yml
- id: describe-image
name: '@deepseek-ai/dsh-tool-describe-image'
config:
baseURL: https://dashscope.aliyuncs.com/compatible-mode/v1
model: qwen-vl-max
apiKey: !!js process.env.VISION_API_KEY
常见问题
这个插件是干什么的?
给 DeepSeek Harness 增加 describe_image 工具:Agent(或用户)把一张图交给工具,工具让配置好的视觉语言模型描述它,只有描述文本回到对话里。
支持哪些视觉模型?
任何 OpenAI 兼容的视觉端点:Qwen-VL(https://dashscope.aliyuncs.com/compatible-mode/v1)、GLM-4V、GPT-4o,或本地 Ollama 端点。在「设置 → 插件 → 图像理解」里配好 baseURL 与 model 即可。
图片本身会进入对话或会话日志吗? 不会。图片被加载、校验后只发给视觉端点;会话日志与模型只看到返回的描述文本。
怎么安装? 执行 ,或把同一条 spec 粘贴进桌面应用的插件安装框,随后重启应用。