InkshadeWoods/dsh-tool-visual-primitives ↗★ 1
dsh-tool-visual-primitives
DSH 视觉原语工具:参考 DeepSeek《Thinking with Visual Primitives》论文,将图片路由到外部视觉模型并返回带视觉基元的文本分析。纯文本循环,对话模型无需原生视觉能力即可'看见'图片。
安装
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:InkshadeWoods/dsh-tool-visual-primitives说明文档
阅读完整 README ↗dsh-tool-visual-primitives
为 DeepSeek Harness(DSH) 的纯文本模型补充视觉能力。插件把图片交给外部视觉模型分析,再把带有空间定位信息的纯文本视觉证据交回原对话模型;因此,被增强的模型不需要原生图片输入能力。
核心思路参考 DeepSeek 的 Thinking with Visual Primitives:以归一化坐标和可引用对象,将图像理解转化为后续推理可使用、可检查的证据。
当前版本支持从 GitHub 源码本地挂载。npm 发布后可使用下方的一键安装命令。
功能
- 两个入口,共用同一条
vision_analyze分析核心:显式工具调用与对话中的[vision]模型。 - 自动识别 11 类视觉任务:描述、对象清单、多主体、计数、定位、空间关系、比较、路径、拓扑、UI、文档视觉。
- 三档分析细节:
brief、standard(默认)、verbose。 - 三种视觉原语策略:
auto(默认)、on、off;原语使用、、,坐标范围为0–999。 - 仅为你选定的纯文本模型追加
[vision]变体;原模型保留,不受影响。 - 会话级视觉证据缓存:追问仅在已有证据覆盖新问题时复用,否则重新读图。
- 原生设置页:安全密钥存储、连接测试、
/models搜索选择、手动模型 ID,以及按供应商折叠选择待增强模型。
工作方式
图片 + 用户问题
│
▼
detectVisionMode() → shouldUsePrimitives() → buildVisionPrompt()
│
▼
外部视觉模型(OpenAI 兼容 Chat Completions)
│
▼
纯文本视觉证据(可含坐标化 primitives)
│
▼
原始文本模型继续回答
Mode 与 Detail 是正交控制:Mode 决定任务,Detail 决定信息密度。Primitives 决定是否强制结构化的空间证据。
前置条件
- 已可运行的 DSH Web Profile。
- Node.js
>= 20与 pnpm。 - 一个可访问的视觉模型服务。默认使用 OpenAI 兼容端点:
POST /chat/completions- 可选模型目录:
GET /models
视觉服务与被增强的文本模型可以来自不同供应商。
安装
npm 一键安装
发布到 npm 后,在 PowerShell 或终端执行:
npx @deepseek-ai/dsh plugin --profile web add dsh-tool-visual-primitives@latest
该命令调用 DSH 官方插件管理器,在 web Profile 中执行包安装。安装成功后,DSH 会识别本插件包内的 dsh.bundle.patch 声明,自动将插件加入 dsh.profile.bundles,并在启动时应用包内的 cordis.patch.yml。
该过程可重复执行,不会重复添加 bundle;它不会直接修改 Profile 自身的 cordis.patch.yml 或其他插件配置,因此可与 dsh-better-sidebar 等插件共存。
如使用的不是 web Profile,请将 --profile 改为对应的 Profile 名称:


