princefrogdida-ux/dsh-vision-workbench ↗★ 0
dsh-vision-workbench
Windows-first, non-invasive vision tools for DeepSeek Harness.
AI 分析
核心用途是为 DeepSeek Harness 提供视觉模型路由与图片处理工具。适合在 Windows 环境下使用 DSH 且需要多模态视觉分析能力的用户。需在插件设置中手动启用并配置 API 密钥。
インストール
$
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:princefrogdida-ux/dsh-vision-workbenchドキュメント
README 全文を読む ↗配置入口
插件安装后默认保持关闭,不会自动接管模型路由,也不会自动发送图片。
推荐使用 DeepSeek Harness 原生配置页面:
- 启动安装了本插件的 Web Profile。
- 打开“设置 → 插件 → 插件配置”。
- 点击 Vision Workbench 展开全部配置项。
- 填写文本模型、视觉 Provider 和 API Key。
- 打开“启用插件”,保存配置。
- 重启当前 Profile,使路由和工具配置生效。
API Key 密码框为空时会保留已经保存的密钥。页面刷新后不会回显密钥,只会显示对应凭据是否已经配置。
最小可用配置
第一次使用只需要配置以下内容:
| 配置项 | 推荐值或说明 |
|---|---|
| enabled | 开启 |
| wrapperRoute | 保持 deepseek-vision-workbench |
| textProvider.provider | 保持 deepseek-official |
| textProvider.model | 选择当前 Harness 中可用的 DeepSeek 模型 |
| visionProvider.name | primary |
| visionProvider.baseURL | 视觉服务的 OpenAI-compatible API 地址,例如 https://api.example.com/v1 |
| visionProvider.model | 服务商提供的视觉模型名称 |
| visionProvider.credentialRef | 凭据名称,例如 VISION_API_KEY |
| API Key | 在同一 Provider 卡片的密码框中输入 |
保存并重启 Profile 后,在模型选择器中选择:
DeepSeek + Vision Workbench /
随后上传图片并直接提问,例如“识别这张截图中的文字”或“比较这两张图片的布局差异”。
基础配置
| 字段 | 默认值 | 说明 |
|---|---|---|
| enabled | false | 是否注册包装路由和视觉工具 |
| wrapperRoute | deepseek-vision-workbench | 插件自己的模型路由名称,不能与 deepseek-official 或文本 Provider 重名 |
| textProvider.provider | deepseek-official | 负责最终推理的文本 Provider |
| textProvider.model | deepseek-v4-pro | 包装路由公布的文本模型 |
| timeoutMs | 120000 | 一次视觉工具调用的总超时 |
| proxyUrl | 空 | 仅用于本插件请求的 HTTP/HTTPS 代理 |
YAML 配置示例
没有 Web 配置界面时,可以在 Profile 的后置 Patch 中使用:
- id: vision-workbench
name: dsh-vision-workbench
config:
enabled: true
wrapperRoute: deepseek-vision-workbench
textProvider:
provider: deepseek-official
model: deepseek-v4-pro
visionProvider:
name: primary
baseURL: https://your-provider.example/v1
model: your-vision-model
credentialRef: VISION_API_KEY
allowKeyless: false
allowInsecureLocalhost: false
maxTokens: 4096
fallbackProviders: []
providerRouting:
attemptTimeoutMs: 45000
failureThreshold: 2
cooldownSeconds: 60
limits:
maxImagesPerCall: 4
maxImageBytes: 10485760
maxImagePixels: 40000000
cache:
enabled: true
maxEntries: 200
ttlSeconds: 3600
localProcessing:
enabled: true
maxWorkingPixels: 16000000
localOcr:
enabled: false
languagePath: ""
languages: [eng]
gzip: true
timeoutMs: 60000
maxLanguageBytes: 52428800
maxRegions: 50
pageSegMode: auto
autoRotate: true
lowConfidenceThreshold: 40
browserCapture:
enabled: false
browserChannel: msedge
allowedHosts: []
allowPrivateHosts: false
viewportWidth: 1440
viewportHeight: 900
maxPageHeight: 12000
navigationTimeoutMs: 30000
timeoutMs: 120000
proxyUrl: ""
API Key 不应直接写入 YAML。请在 Harness Credentials 或插件可视化配置卡片中,把真实密钥保存到 credentialRef 指定的名称。
使用示例
上传图片后可以直接向所选的包装模型提问。模型可根据任务调用:
vision_describe attachment_ids=["sha256:..."] question="这张截图显示了什么?" structured=true
vision_ocr attachment_id="sha256:..." language_hint="中文和英文"
vision_ocr attachment_id="sha256:..." backend="local"
vision_crop attachment_id="sha256:..." region={"x":100,"y":80,"width":600,"height":300}
vision_compare before={"attachment_id":"sha256:before"} after={"attachment_id":"sha256:after"} tolerance=0.02
vision_palette path="screenshots/home.png" count=6
vision_browser_capture url="https://example.com" full_page=true wait_after_load_ms=500
裁剪图、差异图和网页截图都会保存为持久附件,可继续交给 vision_describe、vision_ocr 或后续会话步骤使用。