sala003/dsh-tool-describe-image ↗★ 0
dsh-tool-describe-image
DSH plugin: describe_image tool + paste-image-to-text browser half, bridging image understanding to text-only models via DashScope qwen-vl
安装
$
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:sala003/dsh-tool-describe-image说明文档
阅读完整 README ↗dsh-tool-describe-image
让 DeepSeek 看懂图片的 DSH 插件 —— 通过阿里云百炼(DashScope)qwen-vl 视觉模型,把图片转成文字描述,纯文本模型也能"看见"图片。
项目特点
- 粘贴即识别(Web):在 DSH Web 会话里直接
Ctrl+V粘贴图片,自动识别成文字描述填入输入框,回车即可发送——不需要文件路径 describe_image工具:模型按路径读取图片并转成文字,任何 surface(Web / headless)都可用- 零源码改动:完全通过 DSH 公开扩展点实现(工具注册、RPC 通道、client-modules),不改 Harness 任何代码
- 单包全包:一个 npm 包 = host 半区(工具 + RPC)+ 浏览器半区(粘贴识别),
dsh plugin add即装即用 - 安全设计:RPC 通道仅限 loopback;图片字节不进入模型上下文,只把文字描述带给模型
- 双语文案:跟随 Web 界面语言自动切换中文 / 英文
工作原理
DeepSeek 官方适配器是纯文本路由,DSH 内置的 read_image 工具会在模型不支持 image 输入时拒绝。本插件绕开这道限制:
粘贴图片 / 指定路径
→ 图片字节交给百炼 qwen-vl 视觉模型
→ 返回文字描述(作为 tool result 或 draft 文本)
→ DeepSeek 基于文字理解图片
- 工具模式:
describe_image(file_path, question?)注册到ctx.tools,schema 自动流入系统提示词 - 粘贴模式:浏览器半区在 document 上挂 capture 阶段 paste 监听,拦截图片 → base64 → host RPC(
/dsh-describe-image)→ 文字填入输入框,带"正在识别…"提示与失败 toast
安装
需要已安装 DSH(0.1.0-rc.6+)。
npm install -g dsh-tool-describe-image
dsh plugin --profile web add dsh-tool-describe-image
配置
需要阿里云百炼 API Key(百炼控制台免费开通):
$env:DASHSCOPE_API_KEY = "sk-你的key"
推荐写入 ~/.dsh/profiles/web/.env,免去每次手动设置:
DASHSCOPE_API_KEY=sk-你的key
可配置项
| 字段 | 默认值 | 说明 |
|---|---|---|
apiKey | 无(读 DASHSCOPE_API_KEY) | DashScope API key |
model | qwen-vl-plus | 视觉模型 id(qwen-vl-plus / qwen-vl-max) |
baseUrl | https://dashscope.aliyuncs.com | DashScope 端点 |
prompt | 详细描述指令 | 随图发送的指令文本 |