yan5236/slcatwujian-dsh-vision-plugin ↗★ 1
@dsh-local/vision-bridge
让不支持图片的主模型借助已配置视觉模型理解图片,自动转文字描述并提供追问工具。 适合主模型无图片输入能力、又需读图的用户;需先配置支持图片输入的视觉模型提供方。
安裝
此插件尚未提供可驗證的 bundle,或相容性檢查未通過。請先閱讀倉庫說明。 閱讀完整 README ↗
說明文件
閱讀完整 README ↗配置
打开 设置 → 图片理解:
| 配置项 | 说明 |
|---|---|
| 模型提供方 | 选择已注册的模型提供方(需在 设置 → 模型 中提前配置) |
| 视觉模型 | 选择或手动输入支持图片输入的模型 ID |
| 描述最大 token 数 | 200–8000,默认 1200 |
| 自动分析消息中的图片 | 开启后图片自动交给视觉模型;关闭后助手会提示改用 vision_ask |
- 测试模型:验证所选模型是否声明支持图片输入,并展示上下文窗口等信息。
- 声明图片输入:当模型未声明
image输入模态时(仅 pi-ai 系提供方支持),点击按钮将image写入提供方的defaultInput,持久生效。
使用
-
直接发送图片,插件自动分析并注入描述;消息中的注入标签形如:
【图片描述·vision-bridge·attachmentId=xxx】图片 name.png,1280×720px,已由视觉模型分析;坐标原点为图片左上角 (0,0),单位像素
-
助手可调用
vision_ask工具追问细节:vision_ask(attachmentId="xxx", question="描述右上角区域的内容") vision_ask(path="C:/path/to/image.png", question="图片中有什么文字?")