dsh-sfversion
按需视觉桥:图片描述、空间定位与 UI 还原,支持 OpenAI Chat Completions 兼容多模态接口
AI 분석
核心用途是为 DSH 引入多模态视觉解析能力。适合需要让 AI 分析图片、PDF 页面、进行 UI 还原等任务的用户;需配置 StepFun 或兼容的 API 密钥。
설치
검증된 bundle이 없거나 호환성 검사에 실패했습니다. 먼저 저장소 설명을 읽어 주세요. 전체 README 읽기 ↗
直接使用的依赖与平台接口
- DeepSeek Harness / Cordis:插件宿主、生命周期、设置、工具注册、
llm/stream模型请求边界以及客户端会话输入 facade。 @deepseek-ai/dsh-client-connection:浏览器与宿主之间的 Connection RPC;文档通过这条受控通道注册到宿主短期内存。@deepseek-ai/dsh-attachment/@deepseek-ai/dsh-client-ui-attachment:图片附件的 DSH 原生附件协议;本插件只将图片接入这条原生链路。pdfjs-dist:PDF 文字层、页码、文字 bbox 和页面渲染后备链路。xlsx:XLS/XLSX 工作簿、Sheet、单元格及图片关系解析。fflate:DOCX/PPTX/XLSX/XMind 等 ZIP/XML 容器解包。word-extractor、cfb:旧版二进制 DOC/XLS 等格式的兼容解析。@napi-rs/canvas:PDF 扫描页的 PNG 页面渲染后备。- StepFun / OpenAI Chat Completions 兼容接口:视觉识别请求的外部模型接口,不是本项目内置的模型。
使用
- 点 ↑ 选图,输入问题后发送;系统会根据问题自动选择识别模式;
- 直接粘贴/拖入图片,同样会在请求前翻译;
- 让 Agent 分析工作区图片:
vision_glance; - 让 Agent 分析工作区文档:
document_inspect;支持doc/docx/ppt/pptx/xls/xlsx/xmind/pdf/md/markdown; - 询问图片元素位置:
vision_ground,例如“红色按钮位于哪里?”; - 按图还原 UI:
vision_restore_ui,成功后可让 DeepSeek 用 write 工具保存为restored-ui.html; - 设置页中的 API Key 是只写字段,保存后不会回显。
默认配置
| 项 | 值 |
|---|---|
| 视觉模型 | step-3.7-flash |
| 接口 | https://api.stepfun.com/v1 |
| 描述输出上限 | 1800 tokens |
| 空间定位输出上限 | 1400 tokens |
| UI 还原输出上限 | 8000 tokens |
| 推理强度 | low(兼容接口不支持时应忽略该字段) |
| API Key | 设置页优先,或 DSH Credential STEPFUN_API_KEY |