Elohia/dsh-plugin-image-input ↗★ 0

dsh-plugin-image-input

图片转文字输入插件:给无视觉能力的纯文本 LLM(DeepSeek 等)提供图片输入接管。输入框粘贴/拖拽图片后一键转为结构化文字描述;视觉 API 配置在设置页填写,支持任意 OpenAI 兼容视觉模型(qwen-vl / gpt-4o / glm-4v 等)。多模态模型下自动让位,不劫持原生图片通道。 适合用无视觉能力模型却需处理图片的用户;需配置OpenAI兼容视觉API。

패키지
dsh-plugin-image-input
호환성
미검증
버전
0.1.1
라이선스
MIT
최근 업데이트
2026. 8. 15.

설치

$npx -p @deepseek-ai/dsh dsh plugin --profile web add github:Elohia/dsh-plugin-image-input

配置视觉 API(设置页填写,一次搞定)

重启后打开 设置 → 图片转文字,填写:

字段说明示例
baseUrlOpenAI 兼容接口地址(不含 /chat/completions)https://dashscope.aliyuncs.com/compatible-mode/v1
model视觉模型名qwen-vl-max / gpt-4o / glm-4v
apiKey你的 API Key(留空 = 保持不变)sk-...
maxTokens最大输出 token2048

保存即生效(无需重启)。配置存于 ~/.config/mm-vision/config.json。

不填设置页也可以:插件会回退读取同路径配置文件或环境变量 MM_VISION_API_KEY / DASHSCOPE_API_KEY / QWEN_API_KEY / OPENAI_API_KEY / GEMINI_API_KEY。

使用

  1. 粘贴 / 拖拽一张图片到输入框(出现缩略预览)
  2. 直接按 Enter 或点发送(或先点 🖼️ 按钮只转文字)
  3. 等约 1 分钟(思考型视觉模型对复杂图较慢),自动转为文字描述并发送
  4. 模型就能"看"到图了

转换期间输入框显示"正在把图片转为文字后发送…";失败会提示并保留图片,不会丢内容。 多张图片逐张转换、一起发送。