dsh-img
为纯文本模型提供眼睛:适用于 DeepSeek Harness 的 analyze_image 工具,支持免费中文视觉 API 或任何兼容 OpenAI 的视觉端点
AI 分析
核心用途是为纯文本模型提供图像分析、OCR、前背景提取等视觉能力。适合需要多后端容灾、本地 OCR、截图分析及对话框直发图片的用户。
安装
$
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:gmleong/dsh-img说明文档
阅读完整 README ↗配置项(Config)
| 字段 | 默认 | 说明 |
|---|---|---|
preset | zhipu | 旧式单后端快捷方式(zhipu/qwen/custom) |
backends | 无 | 新式:有序后端数组,从左到右 failover(优先于 preset) |
timeoutMs | 60000 | 单次请求超时 |
maxImageMB | 10 | 图片大小上限 |
detail | auto | auto / low / high |
chatBridge | true | 对话框直发图:声明图片输入 + 请求前把附件转译成文字 |
bridgePrompt | 内置 | 附件转译时发给视觉模型的问题 |
cache | true | 识别结果持久化缓存(~/.dsh/dsh-img-cache/) |
ocrLang | chi_sim+eng | 本地 OCR 的 tesseract 语言包 |
pixelDiffSampleMax | 1024 | pixel-diff 降采样最长边(控制 CPU) |
traceSteps | 4 | vision_trace 的 posterize 颜色层数 |
foregroundTolerance | 40 | vision_extract_foreground 的背景色容差(越大抠得越狠) |