tenglongbohai/dsh-paddle-ocr ↗★ 0
dsh-paddle-ocr
DSH DeepSeek Harness plugin: Add PaddleOCR vision to text-only LLMs (Agnes, DeepSeek, MiniMax, GLM, Mimo). 为DeepSeek Harness纯文本模型添加图片识别能力,支持本地截图和文档OCR。
安装
$
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:tenglongbohai/dsh-paddle-ocr说明文档
阅读完整 README ↗步骤 3:配置 API Token
### 步骤 5:更新配置
编辑 `/root/.dsh/profiles/web/package.json`,添加:
```json
{
"dsh": {
"profile": {
"bundles": [
// ... 其他插件
"dsh-paddle-ocr"
]
},
"dependencies": {
// ... 其他依赖
"dsh-paddle-ocr": "file:/path/to/dsh-paddle-ocr"
}
}
}
🚀 使用方法
方式 1:工具调用
// AI 会自动调用,或手动调用
await tools.paddle_ocr({
image_path: "/path/to/local/image.png", // 本地文件
// 或
image_path: "https://example.com/image.jpg", // 网络图片
prompt: "提取所有文字",
return_bbox: true
});
方式 2:视觉模型变体
- 刷新 DSH 网页
- 在模型选择中找到
模型名 (PaddleOCR)变体 - 上传图片,自动识别并回答问题
返回格式
{
"status": "success",
"result": "识别的文字内容...",
"blocks": [
{
"text": "文字内容",
"bbox": [x1, y1, x2, y2],
"type": "text|paragraph_title|inline_formula"
}
],
"model": "PaddleOCR-VL-1.6"
}
💡 使用场景
场景 1:本地截图识别
- 用户上传本地截图
- PaddleOCR 识别文字内容
- Agnes/DeepSeek/GLM 等基于文字回答问题
- 解决纯文本模型不支持本地文件的限制
场景 2:批量文档处理
- 上传 PDF/Word/Excel 文档
- 自动识别文字内容
- 基于内容进行问答
- 节省付费多模态模型调用成本
场景 3:多模型适配
- 插件自动检测所有配置的提供商
- 纯文本模型自动创建视觉变体
- 多模态模型自动跳过
- 无需手动配置每个模型