wjling/dsh-vision-assist0

dsh-vision-assist

DeepSeek Harness 视觉助手插件:为无视觉能力的模型配置多模态识别模型,自动将输入图片改写为文本提示,支持热更新切换。

AI 分析

核心用途是让纯文本大模型具备“看图”能力。适合使用无视觉功能的主模型,但又需要临时进行图片识别和多模态交互的用户。

套件
dsh-vision-assist
版本
1.0.0
授權
MIT
最近更新
2026年9月2日

安裝

$npx -p @deepseek-ai/dsh dsh plugin --profile web add github:wjling/dsh-vision-assist

配置

方式一:DSH 设置页(推荐)——设置 → 插件 → 可配置标签页 → "视觉助手 vision-assist" 卡片:

  • 启用识别接管(总开关)
  • 识别模型 provider(如 codemaker
  • 识别模型 model(如 gemini-3.7-flash
  • 识别超时(毫秒,1000–600000)

方式二:settings.yaml(热更新,两种方式写的是同一份配置):

vision-assist:
  enabled: true          # 总开关,false 时工具与图片改写都停用
  provider: codemaker    # 识别模型所在 provider(需在 llm-pi-ai 中配置)
  model: gemini-3.7-flash  # 识别模型 id
  timeoutMs: 120000      # 单次识别超时(毫秒)

要求:选定的模型在 llm-pi-ai.providers. .models 中声明了 input: [text, image](未声明的模型会被 DSH 视为纯文本而拒绝图片)。