237229953-create/dsh-vision ↗★ 0
dsh-vision
给纯文本模型自动配眼:图片消息自动桥接为视觉模型描述(日志内表面替换,不改写人类转录),附带 see_image 追问工具
安装
$
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:237229953-create/dsh-vision说明文档
阅读完整 README ↗dsh-vision —— 给纯文本模型自动配眼
让 DeepSeek-V4 这类纯文本模型在 dsh 里"看到"图片:图片消息自动桥接为视觉模型生成的文字描述,原图保留在人类转录中。零新增凭据 —— 视觉模型复用 profile 已配置的 llm-pi-ai 路由(默认 opencode-go / minimax-m3,与主模型同一把 key)。
原理(全部基于 dsh 官方机制,零 hack)
- 拦截
llm/streamwaterfall:请求含 image 块且目标模型未声明 image 输入时触发; - 用视觉模型把图片转为文字描述;
- 把描述作为一条
user/messagesurface-replace 事件 append 进会话日志(与 compaction 压缩历史同款机制)——只对模型可见,人类转录保留原图; - 本次请求用同一份描述改写后放行,首轮即成功;
- 替换事件落库后,后续每轮历史投影天然给出稳定文本:网关前缀缓存与普通文本会话完全等价(历史全命中,仅新消息 miss)。
安装
# 1. 接线到 profile(把本地目录作为 link 依赖加入 bundle)
dsh plugin --profile web add link:C:/Users/86191/Desktop/dsh-vision
# 2. 重启 dsh web 后验证挂载
dsh --profile web --dump-config | Select-String dsh-vision
配置(在 ~/.dsh/profiles/web/cordis.patch.yml 或 bundle 自带 patch 中覆盖)
- insert:
- id: dsh-vision
name: dsh-vision
config:
provider: opencode-go # 视觉模型路由(复用已配置的 key)
model: minimax-m3 # 快(~3s)且便宜;可选 kimi-k2.7-code / qwen3.6-plus / kimi-k3 / qwen3.7-plus / mimo-v2.5 / grok-4.5
maxTokens: 4096 # 描述输出上限
mode: both # auto=仅自动桥 | manual=仅 see_image 工具 | both=两者
timeoutMs: 60000 # 视觉调用超时
行为说明
- 自动桥:图片出现在纯文本模型的请求中时自动转换,无需模型或用户做任何事;
- 原生看图优先:当前模型自身支持 image(如
kimi-k3)时插件完全不干预; see_image工具:手动/追问入口,file_path+ 可选question;- 缓存:描述固化在日志,历史前缀缓存与文本会话等价;新图首次出现按未命中价计费一次(与发送新消息相同);
- 失败语义:视觉调用失败时本次请求仍成功(图片位置为"解析失败"占位),且不固化,下次自动重试;
- 成本:视觉调用不进入会话 usage 统计(绕过 agent loop 记录路径),缓存命中后趋零;图片描述通常几百 token,按视觉模型单价计。
限制
- 依赖 dsh 预览版 API(
llm/streamwaterfall、surface replace、foldSurface),rc 升级若改签名需同步更新; - 图片位于历史中部首次出现时,该轮从图片处起前缀缓存失效一次,之后恢复(前缀缓存固有特性);
- 视觉模型必须真实支持图片输入,配置错误会导致占位文本(不会死循环)。