pipiwolve/dsh-baidu-ocr0

dsh-baidu-ocr

Baidu cloud OCR (PaddleOCR-VL + Unlimited-OCR) for DeepSeek Harness Web: drag images/PDFs in, OCR to markdown, write results as local files.

包名
dsh-baidu-ocr
版本
0.1.0
许可证
MIT
最近更新
2026年8月26日

安装

$npx -p @deepseek-ai/dsh dsh plugin --profile web add github:pipiwolve/dsh-baidu-ocr

配置 API Key

三种来源,优先级从高到低:

  1. 设置页(推荐):设置 → 插件 → 百度 OCR,填 key 保存 → 写入 ${DSH_HOME:-~/.dsh}/baidu-ocr.json
  2. credentials 服务ctx.get('credentials').resolve('BAIDU_OCR_KEY')
  3. 环境变量export BAIDU_OCR_KEY="bce-v3/ALTAK-.../..."

key 格式为百度 BCE IAM API Keybce-v3/ALTAK-.../...),对两个引擎的 Bearer 鉴权都有效。

获取:https://console.bce.baidu.com/iam/#/iam/accesslist


使用

方式一:拖入

  1. 从 Finder(或文件管理器)拖文件到页面任意位置,全屏出现「松开以添加文件到 OCR」提示;
  2. 右下角「百度 OCR」面板弹出,文件变成可删除的 chip(hover 显示完整路径);
  3. 选引擎(自动 / PaddleOCR-VL / Unlimited-OCR),点「识别 N 个文件」;
  4. 结果卡片显示 markdown 预览 + 结果文件路径,.md/.json 落到源文件旁。

面板可拖动标题栏移动、收起OCR 圆钮(悬浮在输入框上方,不挡发送按钮)、支持粘贴绝对路径手动添加。

方式二:模型工具

在对话里直接说:

用 baidu_ocr 识别 /absolute/path/to/image.png

工具返回预览 + 文件路径;要拿完整文本,再让 Agent 用 readmarkdownFile