moon09300731/dsh-vision-tools ↗★ 1
dsh-vision-tools
DeepSeek Harness 视觉能力全家桶:vision_understand 工具(OpenAI 兼容视觉 API,默认免费智谱 GLM-4V-Flash)+ 粘贴/拖拽/按钮三入口识图
AI Analysis
集成智谱、阿里等 OpenAI 兼容视觉 API,支持截图粘贴、拖拽和按钮上传。适合需要为 DSH 快速补充多模态识图能力的场景。
Install
$
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:moon09300731/dsh-vision-toolsREADME
Read the full README ↗配置(vision_understand 工具需要)
创建 ~/.dsh/vision.env(全局生效,推荐):
VISION_PROVIDER=zhipu # zhipu | dashscope | siliconflow | openai
VISION_API_KEY=你的APIKey
可选覆盖:
VISION_BASE_URL=https://open.bigmodel.cn/api/paas/v4/chat/completions
VISION_MODEL=glm-4.6v-flash
| provider | 默认模型 | 说明 |
|---|---|---|
zhipu | glm-4.6v-flash | 智谱,免费(128K 上下文,支持思考模式) |
dashscope | qwen-vl-plus | 阿里百炼 |
siliconflow | Qwen/Qwen2.5-VL-7B-Instruct | 硅基流动 |
openai | gpt-4o-mini | OpenAI |
工作区回退:在项目目录放 .dsh-vision.env(同格式),仅该项目生效。配置每次调用实时读取,改完无需重启。
使用
- 粘贴:直接
Cmd/Ctrl+V粘贴剪贴板截图(捕获阶段拦截,优先于 GUI 自身附件处理) - 拖拽:拖图片到输入框左侧的「📷 识图」按钮
- 选择:点「📷 识图」按钮选文件
发送后 agent 会自动调用 vision_understand 识别图片。