ximengxiaolan/dsh-vision-bridge ↗★ 3

dsh-vision-bridge

将输入框图片经视觉模型描述后交给纯文本模型处理。 适合纯文本模型用户处理图片,需配置兼容多模态端点。

套件
dsh-vision-bridge
相容性
待驗證
Harness 依賴範圍
^0.1.0-rc.6
Cordis 依賴範圍
^4.0.1
版本
0.1.0
授權
MIT
最近更新
2026年8月14日

同名套件的其他儲存庫

安裝

$npx -p @deepseek-ai/dsh dsh plugin --profile web add github:ximengxiaolan/dsh-vision-bridge

配置

唯一需要的是一个 OpenAI 兼容多模态模型(/chat/completions + image_url),例如阿里云百炼 qwen-vl-max、智谱 GLM-4V 等。

环境变量:

$env:VISION_API_KEY  = "sk-..."
$env:VISION_BASE_URL = "https://dashscope.aliyuncs.com/compatible-mode/v1"
$env:VISION_MODEL    = "qwen-vl-max"
$env:VISION_LANG     = "zh"   # zh | en

或在 profile 的 cordis.patch.yml 中配置(优先于环境变量):

- id: dsh-vision-bridge
  config:
    apiKey: 'sk-...'
    baseURL: 'https://dashscope.aliyuncs.com/compatible-mode/v1'
    model: 'qwen-vl-max'
    lang: zh
    timeoutMs: 180000
    enabled: true

使用

重启后直接在输入框粘贴图片并发送即可。DeepSeek 会基于视觉模型的描述继续处理。