HiSeax/dsh-image-to-text0

dsh-image-to-text

DSH model tool that converts images to text (OCR + description) via configurable vision API providers, with image intake support for text-only models.

AI 分析

核心用途是为 DSH 提供图像转文本与 OCR 功能。适合需要处理图片输入、使用纯文本模型进行多模态任务的用户。必要条件是需要 Python 3 环境以及至少一个视觉 API 密钥。

パッケージ
dsh-image-to-text
バージョン
0.1.0
ライセンス
MIT
最終更新
2026/08/15

インストール

検証済み bundle がないか、互換性チェックに失敗しています。先にリポジトリの説明を読んでください。 README 全文を読む ↗

ドキュメント

README 全文を読む ↗

配置

插件行支持以下 config 字段:

字段默认说明
pythonPathWindows 自动探测 C:\Program Files\Python313\python.exe,否则 pythonPython 可执行文件路径或 PATH 命令
providers内置 7 个 provider 模板name(可再按 model)覆盖或新增 provider
bypassImageGatetrue是否包装 llm.resolveModelInfo 放行图片准入
rewriteImageBlockstrue是否把图片块改写为本地路径再发给纯文本模型

自定义 API URL / key(插件配置)

- insert:
    - id: image-to-text
      name: 'dsh-image-to-text'
      config:
        pythonPath: 'python'
        providers:
          # 覆盖内置 provider:只要 name(和可选 model)就能覆盖 key/endpoint
          - name: zhipu
            apiKey: '你的智谱 key'
            endpoint: 'https://open.bigmodel.cn/api/paas/v4/chat/completions'
          # 新增一个完全自定义的 OpenAI 兼容 provider
          - name: my-vision
            model: 'vision-model'
            apiKey: 'sk-xxx'
            endpoint: 'https://api.example.com/v1/chat/completions'
            format: openai
            priority: 1

内置模板中的 provider namezhipugemini(多个 Gemini 模型共用)、grok。新增 provider 需要完整给出 name/model/apiKey/endpoint/format/priority

自定义 API URL / key(环境变量)

按 provider 名字符串(非字母数字转 _、全大写)命名:

IMAGE_TO_TEXT_API_KEY_ZHIPU=your-key
IMAGE_TO_TEXT_ENDPOINT_ZHIPU=https://open.bigmodel.cn/api/paas/v4/chat/completions

环境变量在每次调用时读取,不会写入磁盘。

自定义 API URL / key(插件配置)

- insert:
    - id: image-to-text
      name: 'dsh-image-to-text'
      config:
        pythonPath: 'python'
        providers:
          # 覆盖内置 provider:只要 name(和可选 model)就能覆盖 key/endpoint
          - name: zhipu
            apiKey: '你的智谱 key'
            endpoint: 'https://open.bigmodel.cn/api/paas/v4/chat/completions'
          # 新增一个完全自定义的 OpenAI 兼容 provider
          - name: my-vision
            model: 'vision-model'
            apiKey: 'sk-xxx'
            endpoint: 'https://api.example.com/v1/chat/completions'
            format: openai
            priority: 1

内置模板中的 provider namezhipugemini(多个 Gemini 模型共用)、grok。新增 provider 需要完整给出 name/model/apiKey/endpoint/format/priority

使用

用户在会话中上传图片,或模型在上下文中看到图片时,调用 image_to_text

{
  "images": ["C:\\path\\to\\image.png"]
}

可选参数:model(强制指定模型)、prompt(自定义提示词)。返回:

{
  "text": "OCR 与图片描述",
  "provider": "gemini",
  "model": "gemini-3.6-flash"
}