Elohia/dsh-plugin-image-input ↗★ 0
dsh-plugin-image-input
图片转文字输入插件:给无视觉能力的纯文本 LLM(DeepSeek 等)提供图片输入接管。输入框粘贴/拖拽图片后一键转为结构化文字描述;视觉 API 配置在设置页填写,支持任意 OpenAI 兼容视觉模型(qwen-vl / gpt-4o / glm-4v 等)。多模态模型下自动让位,不劫持原生图片通道。 适合用无视觉能力模型却需处理图片的用户;需配置OpenAI兼容视觉API。
설치
$
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:Elohia/dsh-plugin-image-input配置视觉 API(设置页填写,一次搞定)
重启后打开 设置 → 图片转文字,填写:
| 字段 | 说明 | 示例 |
|---|---|---|
baseUrl | OpenAI 兼容接口地址(不含 /chat/completions) | https://dashscope.aliyuncs.com/compatible-mode/v1 |
model | 视觉模型名 | qwen-vl-max / gpt-4o / glm-4v |
apiKey | 你的 API Key(留空 = 保持不变) | sk-... |
maxTokens | 最大输出 token | 2048 |
保存即生效(无需重启)。配置存于 ~/.config/mm-vision/config.json。
不填设置页也可以:插件会回退读取同路径配置文件或环境变量
MM_VISION_API_KEY/DASHSCOPE_API_KEY/QWEN_API_KEY/OPENAI_API_KEY/GEMINI_API_KEY。
使用
- 粘贴 / 拖拽一张图片到输入框(出现缩略预览)
- 直接按 Enter 或点发送(或先点 🖼️ 按钮只转文字)
- 等约 1 分钟(思考型视觉模型对复杂图较慢),自动转为文字描述并发送
- 模型就能"看"到图了
转换期间输入框显示"正在把图片转为文字后发送…";失败会提示并保留图片,不会丢内容。 多张图片逐张转换、一起发送。