CaseyTso/analyze_image_tool ↗★ 0
analyze-image-tool
A vision bridge for text-only DeepSeek Harness models: registers an `analyze_image` tool that answers questions about images via ANY OpenAI-compatible vision/multimodal endpoint (SiliconFlow, DashScope, Zhipu, OpenRouter, Ollama, ...).
AI 分析
核心用途是为纯文本模型赋予视觉能力。适合使用 DeepSeek 等纯文本模型,但又需要让其通过第三方多模态 API 识别图片的用户。
インストール
$
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:CaseyTso/analyze_image_toolドキュメント
README 全文を読む ↗配置
在 profile 的 cordis.patch.yml 里针对插件 id 配置(或在设置界面/环境变量配置):
- id: analyze-image-tool
config:
baseURL: https://api.siliconflow.cn/v1 # 任意 OpenAI 兼容端点
apiKey: '' # 可留空,走下方解析链
model: Qwen/Qwen3-VL-32B-Instruct # 端点上的视觉/多模态模型 id
maxTokens: 2048
timeoutMs: 60000
maxImageBytes: 10485760
端点示例(都是同一套配置,任选)
| 场景 | baseURL | model 示例 | 说明 |
|---|---|---|---|
| SiliconFlow(默认) | https://api.siliconflow.cn/v1 | Qwen/Qwen3-VL-32B-Instruct | 需 key,视觉能力强 |
| 阿里百炼 DashScope | https://dashscope.aliyuncs.com/compatible-mode/v1 | qwen3-vl-flash | 兼容模式,性价比高 |
| 智谱 | https://open.bigmodel.cn/api/paas/v4 | glm-4.6v-flash | 有免费档 |
| OpenRouter | https://openrouter.ai/api/v1 | google/gemini-2.5-flash | 多模型聚合 |
| Ollama 本地 | http://localhost:11434/v1 | qwen3-vl:4b | 无需 key,完全离线 |
API key 解析链(按顺序)
- 插件配置
apiKey - 环境变量
VISION_API_KEY,其次SILICONFLOW_API_KEY(可写入~/.dsh/.env或导出) - dsh 凭据通道(
VISION_API_KEY,其次SILICONFLOW_API_KEY) - 本地端点(localhost)无需 key
端点示例(都是同一套配置,任选)
| 场景 | baseURL | model 示例 | 说明 |
|---|---|---|---|
| SiliconFlow(默认) | https://api.siliconflow.cn/v1 | Qwen/Qwen3-VL-32B-Instruct | 需 key,视觉能力强 |
| 阿里百炼 DashScope | https://dashscope.aliyuncs.com/compatible-mode/v1 | qwen3-vl-flash | 兼容模式,性价比高 |
| 智谱 | https://open.bigmodel.cn/api/paas/v4 | glm-4.6v-flash | 有免费档 |
| OpenRouter | https://openrouter.ai/api/v1 | google/gemini-2.5-flash | 多模型聚合 |
| Ollama 本地 | http://localhost:11434/v1 | qwen3-vl:4b | 无需 key,完全离线 |