kaixinbaba/dsh-vision-recognizer ↗★ 0
dsh-vision-recognizer
DeepSeek Harness image recognition plugin: keep DeepSeek as the conversation brain while a configurable vision model (15+ providers, OpenAI-compatible + Anthropic) transcribes attached images. Configurable from Settings → Plugins.
安装
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:kaixinbaba/dsh-vision-recognizer说明文档
阅读完整 README ↗dsh-vision-recognizer
English | 简体中文
保持 DeepSeek 作为对话大脑,图片照样直接发,并且可以在「设置 → 插件」里随时切换识图供应商。 面向 DeepSeek Harness 的识图插件。
它注册一条新的提供商路由(默认 vision-recognizer,模型选择器里显示为 DeepSeek + 识图),包装真正的 DeepSeek 适配器:对外声明支持图片输入(附件预检与 read_image 门禁放行),并在请求流里把每张附加图片经你选定的视觉模型转译成文字,再交给纯文本的 DeepSeek 作答。对话仍由 DeepSeek 完成,识图只是附加能力。
用户附加图片 ──▶ vision-recognizer 路由 ──▶ 视觉模型转译(OCR + 版式 + 细节)
│ │
▼ ▼
DeepSeek 作答 ◀── 纯文本对话(图片已替换为 [图片转译] 文字)
特性
- 一键安装:
dsh plugin --profile web add dsh-vision-recognizer,无需构建脚本、无需 approvesharp(不依赖任何原生模块)。 - 在「设置 → 插件 → 识图」里配置:下拉选择供应商、填 API Key、可覆盖模型 / 接口地址 / token 上限 / 超时 / 标记,保存后立即生效,无需重启。
- 15+ 国内外供应商:OpenAI、Anthropic Claude、Google Gemini、OpenRouter、Azure OpenAI、Ollama(本地),以及阿里云百炼、通义千问国际、智谱 GLM、百度千帆、讯飞星火、月之暗面 Kimi、腾讯混元、火山引擎豆包、硅基流动。任何 OpenAI 兼容端点也能自定义接入。
- 双协议:OpenAI 兼容(
/chat/completions)与 Anthropic Messages 原生协议都支持,Claude 也能直接用。 - 绝不卡死:本地/匿名端点 20 秒硬超时上限,HTTP 429 快速失败,失败端点进入 60 秒冷却;没有 Key 也没有本地 Ollama 时数秒内快速失败并给出指引。
- 降级链:主模型失败后按
fallbackModels依次尝试,每个条目可指向不同供应商;全部失败才报错并列出每一次尝试。 - 内容哈希缓存:同一张图每个进程只转译一次(进程内,上限 200)。
- 本地零配置:
autoLocalOllama(默认开)探测http://localhost:11434,检测到就前置进降级链,图片不出本机。
快速开始
dsh plugin --profile web add dsh-vision-recognizer
npm 官方源慢的话:
dsh plugin --profile web add dsh-vision-recognizer --registry=https://registry.npmmirror.com
从本地源码安装(开发):
dsh plugin --profile web add file:/path/to/dsh-vision-recognizer