SilasSolivagus/dsh-plugin-multimodal ↗★ 0
dsh-plugin-multimodal
DeepSeek Harness (Cordis) 插件: 给 Agent 直接加上多模态(图/声/视频)能力
AI 分析
核心用途是扩展 DSH 的多模态交互边界。适合需要 Agent 直接处理视频帧、音频或进行语音识别等复杂多媒体任务的用户。支持通过环境变量和工具动态配置后端。
インストール
検証済み bundle がないか、互換性チェックに失敗しています。先にリポジトリの説明を読んでください。 README 全文を読む ↗
ドキュメント
README 全文を読む ↗配置可配置性(四级优先级)
同一个旋钮有四层来源,优先级从高到低:
单条消息内联提示 > 会话内 set_multimodal_backend 工具 > 环境变量 > patch.yml / schema 默认
-
profile 级静态配置(
cordis.patch.yml的config:或 schema 默认值)—— 重启 dsh 生效。 -
环境变量(启动前 export,最高优先于静态配置,适合开发 / CI 临时覆盖):
环境变量 对应旋钮 MULTIMODAL_AUTO_INJECTautoInject(true/false) MULTIMODAL_VISION_BACKENDvisionBackend MULTIMODAL_VISION_MODELvisionModel MULTIMODAL_OLLAMA_URLollamaBaseUrl MULTIMODAL_VISION_HTTPhttpEndpoint MULTIMODAL_FFMPEG_BINffmpegBin MULTIMODAL_VIDEO_MAX_FRAMESvideoMaxFrames MULTIMODAL_VIDEO_FPSvideoFps MULTIMODAL_ASR_BACKENDasrBackend MULTIMODAL_ASR_MODELasrModel MULTIMODAL_WHISPER_BINwhisperBin MULTIMODAL_ASR_HTTPasrEndpoint MULTIMODAL_VISION_MODEL=llava MULTIMODAL_ASR_MODEL=small dsh --profile headless "看 /tmp/x.png" -
会话内工具切换:
set_multimodal_backend(参数vision_backend/vision_model/asr_backend/asr_model/auto_inject,均可选),调用后影响该会话后续所有请求。 -
单条消息内联提示:
@vision=/@asr=仅作用于一条消息(见上)。
配置三级动态切换(均已实测)
# ② 环境变量覆盖(最高优先于 patch.yml;改模型无需编辑配置、无需重启)
MULTIMODAL_VISION_MODEL=llava dsh --profile headless "看 /tmp/x.png"