Elohia/dsh-plugin-image-input ↗★ 0

dsh-plugin-image-input

把粘贴或拖入的图片转为结构化文字,供纯文本模型读取。 适合用无视觉能力模型却需处理图片的用户;需配置OpenAI兼容视觉API。

包名
dsh-plugin-image-input
兼容性
待验证
版本
0.1.1
许可证
MIT
最近更新
2026年8月15日

安装

$npx -p @deepseek-ai/dsh dsh plugin --profile web add github:Elohia/dsh-plugin-image-input

配置视觉 API(设置页填写,一次搞定)

重启后打开 设置 → 图片转文字,填写:

字段说明示例
baseUrlOpenAI 兼容接口地址(不含 /chat/completions)https://dashscope.aliyuncs.com/compatible-mode/v1
model视觉模型名qwen-vl-max / gpt-4o / glm-4v
apiKey你的 API Key(留空 = 保持不变)sk-...
maxTokens最大输出 token2048

保存即生效(无需重启)。配置存于 ~/.config/mm-vision/config.json。

不填设置页也可以:插件会回退读取同路径配置文件或环境变量 MM_VISION_API_KEY / DASHSCOPE_API_KEY / QWEN_API_KEY / OPENAI_API_KEY / GEMINI_API_KEY。

使用

  1. 粘贴 / 拖拽一张图片到输入框(出现缩略预览)
  2. 直接按 Enter 或点发送(或先点 🖼️ 按钮只转文字)
  3. 等约 1 分钟(思考型视觉模型对复杂图较慢),自动转为文字描述并发送
  4. 模型就能"看"到图了

转换期间输入框显示"正在把图片转为文字后发送…";失败会提示并保留图片,不会丢内容。 多张图片逐张转换、一起发送。