shinjiyu/dsh-plugin-multimodal3

dsh-plugin-multimodal

Vision sidecar for DeepSeek Harness: accept image attachments on text-only models, describe them, then send text to the main model.

AI 分析

核心用途是为不支持看图的纯文本模型配置一个多模态“副驾驶”(如 glm-4.5v),由其先识别并描述图片,再将文本送给主模型。适合在使用纯文本大模型时仍需处理图片输入的用户。

パッケージ
dsh-plugin-multimodal
バージョン
0.1.0
ライセンス
MIT
最終更新
2026/08/16

インストール

$npx -p @deepseek-ai/dsh dsh plugin --profile web add github:shinjiyu/dsh-plugin-multimodal

ドキュメント

README 全文を読む ↗

配置

环境变量(不要把 key 写进仓库):

变量作用
DSH_VISION_BASE_URL视觉接口,例如 https://api.example/v1
DSH_VISION_API_KEY该接口的 key
DSH_VISION_MODEL必须是真能看图的模型,例如 glm-4.5v
DSH_VISION_PROMPT可选。默认 OCR + 描述界面

没设 DSH_VISION_* 时回退 OPENAI_BASE_URL / OPENAI_API_KEYGLM-5.2-FP8 这类文本模型不能当 sidecar。

也可以在 profile 的 cordis.patch.yml 里写:

- id: dsh-plugin-multimodal
  name: dsh-plugin-multimodal
  inject: [llm, tools, attachments, systemPrompt]
  config:
    model: glm-4.5v
    apiKeyEnv: DSH_VISION_API_KEY