QEDQCD/dsh-ocr-vision ↗★ 0

@deepseek-ai/dsh-ocr-vision

面向模型的图像文字识别工具,本地运行 OCR 并返回纯文本。 让纯文本模型读取图片文字,需 Linux 或 macOS、Python 及 OCR 依赖。

包名
@deepseek-ai/dsh-ocr-vision
兼容性
待验证
Harness 依赖范围
^0.1.0-rc.6
Cordis 依赖范围
^4.0.1
版本
0.1.0-rc.5
许可证
MIT
最近更新
2026年8月16日

安装

$npx -p @deepseek-ai/dsh dsh plugin --profile web add github:QEDQCD/dsh-ocr-vision

使用

模型侧直接调用(或经技能引导):

ocr_image(file_path: "截图.png")
ocr_image(file_path: "截图.png", region: "120,80,600,400")   # 只识别关注区域

预期输出(工具返回的纯文本信封):


/workspace/截图.png

ocr

报错码:ERR_DB_CONN_TIMEOUT
关键行:Connection refused -> db.internal:5432 / retry 3/3 failed

配置

ocr_image 插件可通过 cordis 配置调整:

字段默认含义
pythonBinpython3运行 ocr.py 的 Python 解释器
ocrScript随包 ocr.pyRapidOCR CLI 脚本路径
ocrCommand空完整命令前缀,覆盖 pythonBin+ocrScript(测试/定制宿主用)
scale2默认放大倍数(小字更准)
maxImageBytes50 MiB经 ctx.fs 读取的最大图片字节
timeoutMs60000单次 OCR 子进程超时