sala003/dsh-tool-describe-image ↗★ 0
dsh-tool-describe-image
DSH 插件:提供 describe_image 工具与粘贴图片转文字功能,通过通义千问 VL 模型为纯文本模型引入图像理解能力。
AI 分析
核心用途是让不支持多模态的纯文本模型也能通过通义千问接口理解图片内容。适合使用纯文本大模型但有图片解析、截图对话需求的用户,需配置百炼 API Key。
安装
$
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:sala003/dsh-tool-describe-image说明文档
阅读完整 README ↗配置
需要阿里云百炼 API Key(百炼控制台免费开通):
$env:DASHSCOPE_API_KEY = "sk-你的key"
推荐写入 ~/.dsh/profiles/web/.env,免去每次手动设置:
DASHSCOPE_API_KEY=sk-你的key
可配置项
| 字段 | 默认值 | 说明 |
|---|---|---|
apiKey | 无(读 DASHSCOPE_API_KEY) | DashScope API key |
model | qwen-vl-plus | 视觉模型 id(qwen-vl-plus / qwen-vl-max) |
baseUrl | https://dashscope.aliyuncs.com | DashScope 端点 |
prompt | 详细描述指令 | 随图发送的指令文本 |
maxImageBytes | 8 MiB | 单张图片读取上限 |
timeoutMs | 60000 | HTTP 协作超时 |
在 ~/.dsh/profiles/web/cordis.patch.yml 中覆盖:
- insert:
- id: describe-image
name: 'dsh-tool-describe-image'
config:
model: qwen-vl-max
可配置项
| 字段 | 默认值 | 说明 |
|---|---|---|
apiKey | 无(读 DASHSCOPE_API_KEY) | DashScope API key |
model | qwen-vl-plus | 视觉模型 id(qwen-vl-plus / qwen-vl-max) |
baseUrl | https://dashscope.aliyuncs.com | DashScope 端点 |
prompt | 详细描述指令 | 随图发送的指令文本 |
maxImageBytes | 8 MiB | 单张图片读取上限 |
timeoutMs | 60000 | HTTP 协作超时 |
在 ~/.dsh/profiles/web/cordis.patch.yml 中覆盖:
- insert:
- id: describe-image
name: 'dsh-tool-describe-image'
config:
model: qwen-vl-max
使用
dsh web
方式一:粘贴图片(Web)
- 任意截图
Ctrl+C - 输入框
Ctrl+V - 看到"正在识别图片…" → 文字描述自动填入输入框
- 回车发送
方式二:按路径描述
对模型说:
描述一下 C:\Users\你的用户名\Pictures\image.png
模型会自动调用 describe_image 工具并基于描述回答。