princefrogdida-ux/dsh-vision-suite0

dsh-vision-workbench

专为 Windows 优化的 DeepSeek Harness 视觉套件插件。

AI 分析

核心用途是为 DSH 提供视觉处理能力。适合需要在 Windows 环境下使用视觉模型进行图像分析的用户。安装后默认关闭,需在原生配置页面中手动启用并配置 Provider 和密钥。

包名
dsh-vision-workbench
版本
0.7.1
许可证
MIT
最近更新
2026年8月15日

安装

$npx -p @deepseek-ai/dsh dsh plugin --profile web add github:princefrogdida-ux/dsh-vision-suite

配置入口

插件安装后默认保持关闭,不会自动接管模型路由,也不会自动发送图片。

推荐使用 DeepSeek Harness 原生配置页面:

  1. 启动安装了本插件的 Web Profile。
  2. 打开“设置 → 插件 → 插件配置”。
  3. 点击 Vision Workbench 展开全部配置项。
  4. 填写文本模型、视觉 Provider 和 API Key。
  5. 打开“启用插件”,保存配置。
  6. 重启当前 Profile,使路由和工具配置生效。

API Key 密码框为空时会保留已经保存的密钥。页面刷新后不会回显密钥,只会显示对应凭据是否已经配置。

最小可用配置

第一次使用只需要配置以下内容:

配置项推荐值或说明
enabled开启
wrapperRoute保持 deepseek-vision-workbench
textProvider.provider保持 deepseek-official
textProvider.model选择当前 Harness 中可用的 DeepSeek 模型
visionProvider.nameprimary
visionProvider.baseURL视觉服务的 OpenAI-compatible API 地址,例如 https://api.example.com/v1
visionProvider.model服务商提供的视觉模型名称
visionProvider.credentialRef凭据名称,例如 VISION_API_KEY
API Key在同一 Provider 卡片的密码框中输入

保存并重启 Profile 后,在模型选择器中选择:

DeepSeek + Vision Workbench / 

随后上传图片并直接提问,例如“识别这张截图中的文字”或“比较这两张图片的布局差异”。

基础配置

字段默认值说明
enabledfalse是否注册包装路由和视觉工具
wrapperRoutedeepseek-vision-workbench插件自己的模型路由名称,不能与 deepseek-official 或文本 Provider 重名
textProvider.providerdeepseek-official负责最终推理的文本 Provider
textProvider.modeldeepseek-v4-pro包装路由公布的文本模型
timeoutMs120000一次视觉工具调用的总超时
proxyUrl仅用于本插件请求的 HTTP/HTTPS 代理

YAML 配置示例

没有 Web 配置界面时,可以在 Profile 的后置 Patch 中使用:

- id: vision-workbench
  name: dsh-vision-workbench
  config:
    enabled: true
    wrapperRoute: deepseek-vision-workbench
    textProvider:
      provider: deepseek-official
      model: deepseek-v4-pro
    visionProvider:
      name: primary
      baseURL: https://your-provider.example/v1
      model: your-vision-model
      credentialRef: VISION_API_KEY
      allowKeyless: false
      allowInsecureLocalhost: false
      maxTokens: 4096
    fallbackProviders: []
    providerRouting:
      attemptTimeoutMs: 45000
      failureThreshold: 2
      cooldownSeconds: 60
    limits:
      maxImagesPerCall: 4
      maxImageBytes: 10485760
      maxImagePixels: 40000000
    cache:
      enabled: true
      maxEntries: 200
      ttlSeconds: 3600
    localProcessing:
      enabled: true
      maxWorkingPixels: 16000000
    localOcr:
      enabled: false
      languagePath: ""
      languages: [eng]
      gzip: true
      timeoutMs: 60000
      maxLanguageBytes: 52428800
      maxRegions: 50
      pageSegMode: auto
      autoRotate: true
      lowConfidenceThreshold: 40
    browserCapture:
      enabled: false
      browserChannel: msedge
      allowedHosts: []
      allowPrivateHosts: false
      viewportWidth: 1440
      viewportHeight: 900
      maxPageHeight: 12000
      navigationTimeoutMs: 30000
    timeoutMs: 120000
    proxyUrl: ""

API Key 不应直接写入 YAML。请在 Harness Credentials 或插件可视化配置卡片中,把真实密钥保存到 credentialRef 指定的名称。

使用示例

上传图片后可以直接向所选的包装模型提问。模型可根据任务调用:

vision_describe attachment_ids=["sha256:..."] question="这张截图显示了什么?" structured=true
vision_ocr attachment_id="sha256:..." language_hint="中文和英文"
vision_ocr attachment_id="sha256:..." backend="local"
vision_crop attachment_id="sha256:..." region={"x":100,"y":80,"width":600,"height":300}
vision_compare before={"attachment_id":"sha256:before"} after={"attachment_id":"sha256:after"} tolerance=0.02
vision_palette path="screenshots/home.png" count=6
vision_browser_capture url="https://example.com" full_page=true wait_after_load_ms=500

裁剪图、差异图和网页截图都会保存为持久附件,可继续交给 vision_describe、vision_ocr 或后续会话步骤使用。