sparkmio/dsh-sfversion

sparkmio★ 3JavaScriptLast synced: 2026-08-15

Open on GitHub

SF视觉桥——给纯文本模型的 DeepSeek Harness 装上眼睛。

README excerpt

dsh-sfversion SF视觉桥 为纯文本模型接入按需多模态能力:图片或文档先经过结构化解析,再把结果注入 DeepSeek Harness。普通图片不会默认生成 HTML,系统会根据用户问题自动选择描述/OCR、空间定位或 UI 还原;文档会把原文文字和内嵌图片分层处理,并保留页码、段落、幻灯片、Sheet、单元格和坐标锚点。 一键安装 把下面这段话发给你的Harness: 请直接帮我把这个插件安装到当前的 DeepSeek Harness 环境中: https://github.com/sparkmio/dsh-sfversion 请自行检查 Harness 的版本和目录结构,阅读插件说明,完成依赖安装、配置注册及必要的代码调整。不要只给出操作建议,请实际执行安装流程。完成后运行测试验证插件是否可用,并简要说明你做了哪些修改、如何使用,以及是否存在需要我手动处理的问题。 特性 - 图片与文档上传 :输入框左侧 ↑ 支持 png/jpeg/webp/gif 图片和 doc/docx/ppt/pptx/xls/xlsx/xmind/pdf/md/markdown 文档;图片走原生附件,文档走输入引用和宿主 RPC 解析; - 原生图片体验 :输入框左侧 ↑ 按钮把图片作为原生草稿附件加入输入框,与文字一起发送;直接粘贴/拖入图片也支持; - 按意图识别 :普通问题使用描述/OCR;出现“哪里、位置、左上、附近、坐标”等空间问题时使用独立定位链路;明确要求网页、HTML、UI 复刻时才生成 HTML; - 空间定位 : vision ground 返回目标 bbox 、中心点、0~1000 归一化坐标、九宫格区域、OCR 文字和相对关系,适合复杂图片中的“某元素大概在哪里”; - UI 还原 : vision restore ui 输出内联 CSS、无外部资源的完整 HTML;要求从 开始并以 结束,不完整结果不会写入缓存; - 模型工具 : vision glance (描述/OCR)、 vision ground (空间定位)、 vision restore ui (HTML 还原)、 document inspect (文档结构化解析); - 可靠缓存 :按图片内容、识别模式、模型、问题、接口地址和缓存版本隔离,避免更换模型/API 后复用旧结果; - 文档空间上下文 :原文文字、图片 OCR、彩色图片描述分别放入明确区块;PPTX 使用形状坐标,XLSX 使用单元格/图片范围,PDF 使用页码和文字坐标,DOCX/Markdown 在无法得到真实像素坐标时明确标注精度,不伪造位置; - 文档图片分流 :文字型图片优先 OCR;彩色/混合图片输出详细描述并保留 OCR;图片 OCR 明确标注为图片内容,不会覆盖正文; - 稳健性 :处理 429/5…

View full README on GitHub →
Media / Contentdeepseek-harnessdsh-pluginstepfunvisionocr

Category