gloryxpnv/dsh-tool-vision ↗★ 0
dsh-vision-local
Local-first vision for text-only DeepSeek Harness agents: route image understanding to a local OpenAI-compatible vision model, return structured JSON evidence (summary / OCR / layout / semantics / visual / uncertainty).
安装
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:gloryxpnv/dsh-tool-vision说明文档
阅读完整 README ↗dsh-tool-vision
为纯文本的 DeepSeek Harness agent 提供本地优先的视觉能力。
npm 包:
dsh-vision-local· 源码仓库:gloryxpnv/dsh-tool-vision· English README
让纯文本模型(DeepSeek、GLM 等不支持图片输入的模型)拥有"视觉"——使用本地视觉模型,零 API 成本,图片数据完全不出本机。
DeepSeek (纯文本) ──▶ vision 工具 ──▶ 本地 VLM(LM Studio / Ollama / 任意 OpenAI 兼容端点)
◀── 结构化 JSON 证据 ──▶
亮点
- 🏠 完全本地、完全私密。 图片只发送给你自己的本地视觉模型(LM Studio、Ollama、vLLM 或任意 OpenAI 兼容端点)。无需云端 key、无单图成本、图片字节永不离开你的机器。
- 📋 结构化证据,而非模糊转述。 VLM 被要求填写固定 JSON 模板——
summary(摘要)、ocr(逐字全文+行)、layout(版面区域,含阅读顺序)、semantics(实体与关系)、visual(配色/风格),以及显式的uncertainty(不确定项)列表。主模型引用具体证据作答,而不是凭空猜测。 - 🛡️ 反幻觉设计。 模板强制模型在
uncertainty中声明无法确定的内容;无文字的图片 OCR 返回空字段而非编造文字。若 VLM 未能产出合法 JSON,插件回退为原始回答并明确标注——绝不静默捏造。 - 📎 粘贴 / 上传图片即可用。 可选的
vision-bridge服务让纯文本路由直接接收粘贴或上传的图片:宿主在 prompt 到达模型前,将图片交给本地 VLM 描述。不再被read_image门禁拒绝,也无需先保存文件。开启keepThumbnail后,消息历史保留原图缩略图,描述文字紧随其后。 - ⚙️ 零配置起步,全部可调。 默认指向
http://127.0.0.1:1234/v1(LM Studio 默认端口);端点、模型 id、token 预算、超时、图片大小上限、结构化开关——每个旋钮都是文档化的配置字段。 - 🚀 为本地 GPU 调优。 默认参数(8192 输出 token、50 MB 图片上限、180 秒超时)面向本地工作站 GPU 上的 9B 级 VLM,而非轻量云请求。
- 🔌 一个插件,两个表面。 面向模型的
vision工具(图片路径或图片问题出现时即可调用)+ 可选的vision-bridge服务(供希望纯文本路由自动接收图片的宿主使用)。
安装
# 在 DSH profile 目录中(或通过 dsh CLI):
dsh plugin --profile web add dsh-vision-local
然后可将插件行加入你的 profile patch(cordis.patch.yml),或直接依赖 bundle 自带的配置层——bundle 附带一份开箱即用的 cordis.patch.yml(合理默认值)。
安装后重启宿主(pnpm dsh web 或你的启动命令)以加载模块。