yan5236/slcatwujian-dsh-vision-plugin ↗★ 1

@dsh-local/vision-bridge

让不支持图片输入的主模型通过已配置的视觉模型理解图片:自动把消息中的图片替换为带像素坐标系的文字描述,并提供 vision_ask 追问工具与设置页 适合主模型无图片输入能力、又需读图的用户;需先配置支持图片输入的视觉模型提供方。

パッケージ
@dsh-local/vision-bridge
互換性
未検証
Harness ピア範囲
*
Cordis ピア範囲
*
バージョン
1.0.0
ライセンス
MIT
最終更新
2026/08/14

インストール

検証済み bundle がないか、互換性チェックに失敗しています。先にリポジトリの説明を読んでください。 README 全文を読む ↗

ドキュメント

README 全文を読む ↗

配置

打开 设置 → 图片理解:

配置项说明
模型提供方选择已注册的模型提供方(需在 设置 → 模型 中提前配置)
视觉模型选择或手动输入支持图片输入的模型 ID
描述最大 token 数200–8000,默认 1200
自动分析消息中的图片开启后图片自动交给视觉模型;关闭后助手会提示改用 vision_ask
  • 测试模型:验证所选模型是否声明支持图片输入,并展示上下文窗口等信息。
  • 声明图片输入:当模型未声明 image 输入模态时(仅 pi-ai 系提供方支持),点击按钮将 image 写入提供方的 defaultInput,持久生效。

使用

  • 直接发送图片,插件自动分析并注入描述;消息中的注入标签形如:

    【图片描述·vision-bridge·attachmentId=xxx】图片 name.png,1280×720px,已由视觉模型分析;坐标原点为图片左上角 (0,0),单位像素

  • 助手可调用 vision_ask 工具追问细节:

    vision_ask(attachmentId="xxx", question="描述右上角区域的内容")
    vision_ask(path="C:/path/to/image.png", question="图片中有什么文字?")