sparkmio/dsh-sfversion3

dsh-sfversion

按需视觉桥:支持图片描述、空间定位与 UI 还原,兼容 OpenAI Chat Completions 多模态接口。

AI 分析

核心用途是为 DSH 引入多模态视觉解析能力。适合需要让 AI 分析图片、PDF 页面、进行 UI 还原等任务的用户;需配置 StepFun 或兼容的 API 密钥。

套件
dsh-sfversion
版本
1.2.1
最近更新
2026年8月16日

安裝

此插件尚未提供可驗證的 bundle,或相容性檢查未通過。請先閱讀倉庫說明。 閱讀完整 README ↗

直接使用的依赖与平台接口

  • DeepSeek Harness / Cordis:插件宿主、生命周期、设置、工具注册、llm/stream 模型请求边界以及客户端会话输入 facade。
  • @deepseek-ai/dsh-client-connection:浏览器与宿主之间的 Connection RPC;文档通过这条受控通道注册到宿主短期内存。
  • @deepseek-ai/dsh-attachment / @deepseek-ai/dsh-client-ui-attachment:图片附件的 DSH 原生附件协议;本插件只将图片接入这条原生链路。
  • pdfjs-dist:PDF 文字层、页码、文字 bbox 和页面渲染后备链路。
  • xlsx:XLS/XLSX 工作簿、Sheet、单元格及图片关系解析。
  • fflate:DOCX/PPTX/XLSX/XMind 等 ZIP/XML 容器解包。
  • word-extractorcfb:旧版二进制 DOC/XLS 等格式的兼容解析。
  • @napi-rs/canvas:PDF 扫描页的 PNG 页面渲染后备。
  • StepFun / OpenAI Chat Completions 兼容接口:视觉识别请求的外部模型接口,不是本项目内置的模型。

使用

  • 点 ↑ 选图,输入问题后发送;系统会根据问题自动选择识别模式;
  • 直接粘贴/拖入图片,同样会在请求前翻译;
  • 让 Agent 分析工作区图片:vision_glance
  • 让 Agent 分析工作区文档:document_inspect ;支持 doc/docx/ppt/pptx/xls/xlsx/xmind/pdf/md/markdown
  • 询问图片元素位置:vision_ground ,例如“红色按钮位于哪里?”;
  • 按图还原 UI:vision_restore_ui ,成功后可让 DeepSeek 用 write 工具保存为 restored-ui.html
  • 设置页中的 API Key 是只写字段,保存后不会回显。

默认配置

视觉模型step-3.7-flash
接口https://api.stepfun.com/v1
描述输出上限1800 tokens
空间定位输出上限1400 tokens
UI 还原输出上限8000 tokens
推理强度low(兼容接口不支持时应忽略该字段)
API Key设置页优先,或 DSH Credential STEPFUN_API_KEY