shinjiyu/dsh-plugin-multimodal3

dsh-plugin-multimodal

DSH 视觉旁路插件,支持为纯文本模型配置多模态 Sidecar 进行图片描述。

AI 分析

核心用途是为不支持看图的纯文本模型配置一个多模态“副驾驶”(如 glm-4.5v),由其先识别并描述图片,再将文本送给主模型。适合在使用纯文本大模型时仍需处理图片输入的用户。

套件
dsh-plugin-multimodal
版本
0.1.0
授權
MIT
最近更新
2026年8月16日

安裝

$npx -p @deepseek-ai/dsh dsh plugin --profile web add github:shinjiyu/dsh-plugin-multimodal

配置

环境变量(不要把 key 写进仓库):

变量作用
DSH_VISION_BASE_URL视觉接口,例如 https://api.example/v1
DSH_VISION_API_KEY该接口的 key
DSH_VISION_MODEL必须是真能看图的模型,例如 glm-4.5v
DSH_VISION_PROMPT可选。默认 OCR + 描述界面

没设 DSH_VISION_* 时回退 OPENAI_BASE_URL / OPENAI_API_KEYGLM-5.2-FP8 这类文本模型不能当 sidecar。

也可以在 profile 的 cordis.patch.yml 里写:

- id: dsh-plugin-multimodal
  name: dsh-plugin-multimodal
  inject: [llm, tools, attachments, systemPrompt]
  config:
    model: glm-4.5v
    apiKeyEnv: DSH_VISION_API_KEY