tdf1995/dsh-plugin-vision ↗★ 0
dsh-plugin-vision
DeepSeek Harness native plugin: give text-only LLMs (e.g. DeepSeek) vision via free Gemini / GLM vision APIs — describe images, OCR, VQA, screenshots, charts.
AI 分析
核心用途是为纯文本模型扩展图像识别与分析能力。适合需要处理图片、截图或图表任务的用户。必要条件是需自行配置 Gemini 或智谱 GLM 的 API Key。
インストール
$
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:tdf1995/dsh-plugin-visionドキュメント
README 全文を読む ↗API Key 配置 API Key Configuration
插件不内置、不提交任何 Key。按以下任意一种方式提供即可(优先级从高到低):
方式 1:环境变量
export GEMINI_API_KEY=your_key # Gemini(国内访问需代理)
export ZHIPU_API_KEY=your_key # 智谱 GLM(直连,国内推荐)
方式 2:DSH 凭据库(持久)
编辑 ~/.dsh/.credentials.yaml:
GEMINI_API_KEY: your_key
ZHIPU_API_KEY: your_key
方式 3:会话内工具(立即生效,无需重启)
在对话中直接说:
帮我保存 Gemini 的 Key:AIza...
模型将调用 vision_set_key 完成写入。
Key 申请
- Gemini:Google AI Studio(免费额度)
- 智谱 GLM:open.bigmodel.cn(
glm-4.6v-flash完全免费)
使用方法 Usage
在对话中自然描述需求即可,模型会自动调用视觉工具:
帮我看看这张图 D:\work\screenshot.png
这张订单截图里商品是什么?多少钱?
用 GLM 分析 code/my/logo.png,描述一下配色
显式指定提供商 / 模型:
用 gemini-3.6-flash 看 baojia/data/purchased_items/xxx.jpg,做 OCR
插件配置项 Plugin Configuration
| 字段 | 默认值 | 说明 |
|---|---|---|
provider | auto | 默认提供商:auto / gemini / glm |
geminiModel | gemini-3.6-flash | Gemini 默认模型 |
glmModel | glm-4.6v-flash | GLM 默认模型(免费) |
geminiKeyEnv | GEMINI_API_KEY | Gemini Key 的凭据引用名 |
glmKeyEnv | ZHIPU_API_KEY | GLM Key 的凭据引用名 |
maxAttempts | 3 | 限流重试次数(1-6) |
maxImageBytes | 20971520 | 图片读取上限(字节) |
downscaleThreshold | 4194304 | 超过该字节数触发压缩;0 关闭 |
maxDimension | 1920 | 压缩后最长边(像素) |
jpegQuality | 85 | 压缩质量(0-100) |