InkshadeWoods/dsh-tool-visual-primitives1

dsh-tool-visual-primitives

DSH 视觉原语工具:参考 DeepSeek《Thinking with Visual Primitives》论文,将图片路由到外部视觉模型并返回带视觉基元的文本分析。纯文本循环,对话模型无需原生视觉能力即可'看见'图片。

AI Analysis

核心用途是为纯文本模型扩展视觉理解能力。适合使用无视觉能力的纯文本模型,但又需要对上传图片进行理解和对话的用户。

Package
dsh-tool-visual-primitives
Version
1.1.0
License
MIT
Last updated
Aug 15, 2026

Install

$npx -p @deepseek-ai/dsh dsh plugin --profile web add github:InkshadeWoods/dsh-tool-visual-primitives

首次配置

打开 DSH 设置 → 视觉分析,按顺序完成:

  1. 填写 API KeyBase URL 与视觉模型。
  2. 点击 加载模型:插件从 /models 获取可搜索列表。
  3. 若服务不提供模型目录,直接填写 自定义模型 ID
  4. 点击 测试连接
  5. 配置分析参数,并在“对话视觉模型”中勾选希望追加 [vision] 的纯文本模型。

已保存的 API Key 不会在重新打开页面时回显;填写新值会覆盖旧值,点击“清除 API Key”才会删除它。

API 与模型目录

项目行为
视觉请求POST /chat/completions,使用 Authorization: Bearer
模型列表GET /models,使用 Accept: application/json 与同一 API Key
模型列表失败仍可直接填写自定义模型 ID,不影响视觉分析
小米 Mimo URL自动改用 api-key 请求头

使用方式

方式一:在对话中使用 [vision]

  1. 在插件设置的“对话视觉模型”中勾选一个纯文本模型。
  2. 重新打开对话模型列表,选择新增的 模型名 [vision]
  3. 上传、粘贴或拖入图片,并直接提出问题。

插件仅将图像块替换为视觉证据文本;最终回答仍由所选的原文本模型生成。

对于明确指向当前会话最近图片的追问,插件会检查缓存证据是否覆盖新的任务、细节与关注对象/位置。覆盖不足时会重新分析图片,而不是把不充分的旧答案当作事实。

方式二:显式调用 vision_analyze

工具接收且只接收一个图片来源:本地绝对路径或 HTTP(S) URL。

{
  "image_path": "D:/images/dashboard.png",
  "prompt": "统计界面上可点击的主要按钮,并标出它们的位置"
}
{
  "url": "https://example.com/chart.png",
  "prompt": "解读图表的趋势,并说明读不清的标签"
}

远程 URL 不允许指向 localhost、私有网络地址或携带用户名/密码;重定向会被拒绝,以降低服务器端请求伪造风险。

视觉证据格式

启用视觉原语时,外部视觉模型会被要求按如下标题返回:

[Mode]
[Visual Primitives]
[Observations]
[Relations]
[Uncertainty]
[Answer]

定位信息示例:

submit_button[[742, 861, 900, 930]]

[[125, 430], [210, 430], [300, 510]]

所有坐标均为相对 0–999,不是原图像素。

方式一:在对话中使用 [vision]

  1. 在插件设置的“对话视觉模型”中勾选一个纯文本模型。
  2. 重新打开对话模型列表,选择新增的 模型名 [vision]
  3. 上传、粘贴或拖入图片,并直接提出问题。

插件仅将图像块替换为视觉证据文本;最终回答仍由所选的原文本模型生成。

对于明确指向当前会话最近图片的追问,插件会检查缓存证据是否覆盖新的任务、细节与关注对象/位置。覆盖不足时会重新分析图片,而不是把不充分的旧答案当作事实。