go-farther-and-farther/dsh-tool-eyes ↗★ 0
dsh-tool-eyes
Local vision 'eyes' for DeepSeek Harness (DSH): screen tool (capture screen or image -> local OpenAI-compatible VLM description) and ocr tool (Windows built-in OCR, zero model / GPU / cloud).
安装
$
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:go-farther-and-farther/dsh-tool-eyes说明文档
阅读完整 README ↗dsh-tool-eyes
DeepSeek Harness (DSH) 的本地视觉"眼睛"插件。
给纯文本 Agent 加上两个模型侧工具:
screen— 截屏(或描述已有图片),通过本地 OpenAI 兼容视觉端点(llama.cpp--mmproj/ LM Studio / Ollama 等)返回视觉模型的文字描述。ocr— 用 Windows 内置 OCR 引擎逐字提取全部文字:零模型、零 GPU、零云端、毫秒级。
screen = 截图 / 图片 -> 本地视觉模型 -> 文字描述(理解)
ocr = 截图 / 图片 -> Windows OCR -> 逐字原文 (提取)
为什么
DeepSeek 的 chat-completions 是纯文本的。与其把整个对话切到视觉模型,不如保留文本大脑、用工具加眼睛:
- 默认私有 —
screen指向本地端点,图片不出本机。 - 便宜 — 0.8B~4B 的本地视觉模型描述屏幕绰绰有余;
ocr则完全零成本。 - 默认诚实 —
screen的提示词要求视觉模型"只描述所见、除非画面中有明确标签否则不猜应用/游戏/角色名",实测能显著减少小模型的名称幻觉。
环境要求
- Windows 10/11(
ocr使用 WinRT OCR;screen用 .NET 截图) - Node.js >= 22.19,DeepSeek Harness >= 0.1.0-rc.6
screen额外需要一个 OpenAI 兼容视觉端点,例如:- llama.cpp:
llama-server -m model.gguf --mmproj mmproj.gguf --port 1235 - LM Studio(已加载视觉模型)、Ollama,或任意 OpenAI 兼容网关
- llama.cpp:
安装
本包仅发布在 GitHub(未发布到 npm)。
dsh plugin --profile web add https://github.com/go-farther-and-farther/dsh-tool-eyes
然后重启 dsh web,screen / ocr 工具会自动出现在 Agent 工具集中。
手动安装(离线 / 源码方式)
把本包复制到 profile 的 node_modules,并在 $DSH_HOME/profiles/ /cordis.patch.yml 注册:
- insert:
- id: tool-eyes
name: 'dsh-tool-eyes'
config:
baseUrl: http://127.0.0.1:1235/v1
model: ''
timeoutMs: 180000
配置
插件配置(全部可选):
| 键 | 默认值 | 含义 |
|---|---|---|