dsh-image-to-text
DSH model tool that converts images to text (OCR + description) via configurable vision API providers, with image intake support for text-only models.
安装
此插件尚未提供可验证的 bundle,或兼容性检查未通过。请先阅读仓库说明。 阅读完整 README ↗
说明文档
阅读完整 README ↗dsh-image-to-text
DSH (DeepSeek Harness) 插件:把图片转成文字(OCR + 内容描述),并让纯文本模型也能接收图片消息。
- 注册模型工具
image_to_text,支持多图、模型优先级自动切换、故障降级。 - 默认提供 7 个视觉 API provider 模板(智谱 GLM-4.6V-Flash / Gemini Flash 系列 / grok),
api_key全部留空,由你配置。 - 每个 provider 都可自定义
apiKey和endpoint;也支持IMAGE_TO_TEXT_API_KEY_*/IMAGE_TO_TEXT_ENDPOINT_*环境变量覆盖。 - 对
inputModalities不含image的模型,插件会:- 包装
llm.resolveModelInfo,放行图片准入(可关闭); - 包装
llm.streamWithRegistration,在请求发往纯文本 adapter 前把ImageBlock落盘为本地路径文本(可关闭)。
- 包装
安装
需要 Python 3 和至少一个视觉 API key。
# 进入目标 DSH profile,例如 web
dsh plugin --profile web add dsh-image-to-text
然后在 $DSH_HOME/profiles/web/cordis.patch.yml 注册插件行:
- insert:
- id: image-to-text
name: 'dsh-image-to-text'
保存后 DSH 会热重载。确认会话工具列表里出现 image_to_text 即安装成功。
配置
插件行支持以下 config 字段:
| 字段 | 默认 | 说明 |
|---|---|---|
pythonPath | Windows 自动探测 C:\Program Files\Python313\python.exe,否则 python | Python 可执行文件路径或 PATH 命令 |
providers | 内置 7 个 provider 模板 | 按 name(可再按 model)覆盖或新增 provider |
bypassImageGate | true | 是否包装 llm.resolveModelInfo 放行图片准入 |
rewriteImageBlocks | true | 是否把图片块改写为本地路径再发给纯文本模型 |
自定义 API URL / key(插件配置)
- insert:
- id: image-to-text
name: 'dsh-image-to-text'
config:
pythonPath: 'python'
providers:
# 覆盖内置 provider:只要 name(和可选 model)就能覆盖 key/endpoint
- name: zhipu
apiKey: '你的智谱 key'
endpoint: 'https://open.bigmodel.cn/api/paas/v4/chat/completions'
# 新增一个完全自定义的 OpenAI 兼容 provider
- name: my-vision
model: 'vision-model'
apiKey: 'sk-xxx'
endpoint: 'https://api.example.com/v1/chat/completions'
format: openai
priority: 1