wuwangmao/dsh-qwen-multimodal ↗★ 0
dsh-qwen-multimodal
DSH 捆绑包:Qwen 多模态桥接 — 视觉(qwen3-vl)、语音转文本(qwen3-asr)、文本转图像(qwen-image),通过 deepseek-vision 技能脚本实现
安装
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:wuwangmao/dsh-qwen-multimodal说明文档
阅读完整 README ↗dsh-qwen-multimodal
让纯文本主模型(如 DeepSeek)一个插件补齐三种多模态能力的 DSH 组合包(bundle):千问 API 驱动的看图、听音、生图三合一,并内置"生图 → 识图回看"的质量确认闭环。
| 工具 | 能力 | 后端 |
|---|---|---|
describe_image | 图片 / 截图 / OCR / 图表理解(可一次多张) | 千问 VL(默认 qwen3-vl-flash) |
transcribe_audio | 语音 / 录音转写(wav/mp3/m4a/aac/flac/ogg/amr) | Qwen3-ASR(qwen3-asr-flash) |
generate_image | 文字描述生成图片并保存到本地 | Qwen-Image(qwen-image-plus) |
媒体本身不进入主模型上下文:视觉 / 音频内容被转为文字,生图结果保存为本地文件,插件返回路径。
工作原理
本插件 API 调用完全复用包内
skills/deepseek-vision/scripts/*.py 原版脚本与 .env 配置(视觉 / 音频走阿里云百炼 OpenAI 兼容接口,
生图走百炼原生 multimodal-generation 接口)。插件本身是纯 JS 的 Cordis bundle,只依赖宿主已挂载的
subprocess / tools 服务,从 git 安装无需构建步骤。
安装
方式一:从 GitHub 安装
dsh plugin --profile demo add github:wuwangmao/dsh-qwen-multimodal
方式二:本地 checkout / tarball
dsh plugin --profile demo add ./dsh-qwen-multimodal
# 或
pnpm pack # 产出 tarball 后
dsh plugin --profile demo add ./dsh-qwen-multimodal-0.1.0.tgz
安装后重启 DSH(dsh --profile demo),插件加载时会注册上述三个模型工具。
配置
1. API Key(必填)
复制 skills/deepseek-vision/.env.example 为 skills/deepseek-vision/.env 并填写:
VISION_API_KEY=sk-xxxx # 必填:阿里云百炼 API Key(控制台创建,新用户送免费额度,大学生每年300元代金券)
VISION_MODEL=qwen3-vl-flash # 视觉模型,默认即可
AUDIO_MODEL=qwen3-asr-flash # 转写模型,默认即可
IMAGE_MODEL=qwen-image-plus # 生图模型,默认即可
视觉 / 音频 / 生图默认复用同一个 Key;也支持 AUDIO_API_KEY / IMAGE_API_KEY 单独配置,
以及 VISION_BASE_URL 换平台(魔搭 / 硅基流动),详见 .env.example 注释。
💡 提示:
.env位于安装包内部(node_modules 下),卸载重装会被清掉。 若要长期保存配置,建议把技能目录复制到包外(例如D:/qwen-vision), 再用下方的config.skillDir指向它。
2. Python 环境
要求 Python 3.10+(生图脚本使用了 int | None 类型标注语法)。
默认从系统 PATH 解析 python。若环境中没有 python(或解析不到),在 profile 的
cordis.patch.yml 中重述插件行并指定: