Hed1an/dsh-bring-local-llm ↗★ 0
dsh-bring-local-llm
让用户个人/本地 LLM 接入 DeepSeek Harness:Ollama、KoboldCpp、LM Studio 及任意 OpenAI 兼容端点作为本地冗余算力,本地优先处理一部分信息,难点才交给云端主模型。充分利用本地算力并节省 token。
安装
npx -p @deepseek-ai/dsh dsh plugin --profile web add github:Hed1an/dsh-bring-local-llm说明文档
阅读完整 README ↗dsh-bring-local-llm
把你本机的任意本地大模型接入 DeepSeek Harness(DSH Desktop)。 本地优先处理一部分信息(文本批量劳动 + 视觉/OCR),难点才交由云端主模型 —— 充分利用本地冗余算力、节省在线 token。
可连接任意本地模型(不限于某个具体模型):通过 Control Plane 的 Provider 抽象,Ollama / KoboldCpp / LM Studio / 任意 OpenAI 兼容端点(vLLM、LocalAI、llama.cpp server 等)都可一键接入;模型文本/视觉能力按 models.catalog.yaml 声明即可。默认示例用 qwen3.5:9b,但不是唯一可选。
综合实践:
dsh-koboldcpp-hands(DSH 工具插件规范)·local-agent-vision-team(你自研的 DSH 桥接 + Control Plane + Ollama)·OpenHarness(provider 抽象 / 多角色 / 冗余算力思路)。
它能做什么
在 DSH 主模型(云端,如 DeepSeek)的工具清单里注册一组工具,全部委托给你本地部署的 Control Plane(FastAPI 后端,默认 127.0.0.1:8765):
| 工具 | 作用 |
|---|---|
local_llm_run | 在本地文本模型跑一次(批量改写/翻译/抽取/去重/格式化/结构化输出)→ 省在线 token |
local_llm_route | 本地优先分流:先试本地冗余算力;全失败 → needs_cloud=true,请主模型(云端)接管难点 |
local_vision_read | 本地多模态看图(OCR/分析),传图片文件路径 |
0.2.0 起为标准 Cordis 工具插件(
inject:["tools"]+ctx.tools.register(defineTool(...))),与 DSH 生态工具插件一致;不再用动态插件/粘贴桥接,依赖更少、加载更稳。
实测 token 节省率(真实数据,多维度)
用本地模型 qwen3.5:9b 跑 5 类任务、每类 40 条真实文本(全部 used_local=true, needs_cloud=false),Control Plane 实测:
| 任务 | 本地 in | 本地生成 out(=云端省掉) | 云端直接做基线 | 走本地后云端在付 | 节省 token | 节省率 |
|---|---|---|---|---|---|---|
| 英译中 | 468 | 433 | 901 | ~468 | 433 | 48% |
| 改写·友好 | 467 | 1574 | 2041 | ~467 | 1574 | 77% |
| 抽取·JSON | 466 | 592 | 1058 | ~466 | 592 | 56% |
| 分类 | 475 | 2000 |