sparkmio/dsh-sfversion
sparkmio★ 3JavaScriptLast synced: 2026-08-15
SF视觉桥——给纯文本模型的 DeepSeek Harness 装上眼睛。
README excerpt
dsh-sfversion SF视觉桥 为纯文本模型接入按需多模态能力:图片或文档先经过结构化解析,再把结果注入 DeepSeek Harness。普通图片不会默认生成 HTML,系统会根据用户问题自动选择描述/OCR、空间定位或 UI 还原;文档会把原文文字和内嵌图片分层处理,并保留页码、段落、幻灯片、Sheet、单元格和坐标锚点。 一键安装 把下面这段话发给你的Harness: 请直接帮我把这个插件安装到当前的 DeepSeek Harness 环境中: https://github.com/sparkmio/dsh-sfversion 请自行检查 Harness 的版本和目录结构,阅读插件说明,完成依赖安装、配置注册及必要的代码调整。不要只给出操作建议,请实际执行安装流程。完成后运行测试验证插件是否可用,并简要说明你做了哪些修改、如何使用,以及是否存在需要我手动处理的问题。 特性 - 图片与文档上传 :输入框左侧 ↑ 支持 png/jpeg/webp/gif 图片和 doc/docx/ppt/pptx/xls/xlsx/xmind/pdf/md/markdown 文档;图片走原生附件,文档走输入引用和宿主 RPC 解析; - 原生图片体验 :输入框左侧 ↑ 按钮把图片作为原生草稿附件加入输入框,与文字一起发送;直接粘贴/拖入图片也支持; - 按意图识别 :普通问题使用描述/OCR;出现“哪里、位置、左上、附近、坐标”等空间问题时使用独立定位链路;明确要求网页、HTML、UI 复刻时才生成 HTML; - 空间定位 : vision ground 返回目标 bbox 、中心点、0~1000 归一化坐标、九宫格区域、OCR 文字和相对关系,适合复杂图片中的“某元素大概在哪里”; - UI 还原 : vision restore ui 输出内联 CSS、无外部资源的完整 HTML;要求从 开始并以 结束,不完整结果不会写入缓存; - 模型工具 : vision glance (描述/OCR)、 vision ground (空间定位)、 vision restore ui (HTML 还原)、 document inspect (文档结构化解析); - 可靠缓存 :按图片内容、识别模式、模型、问题、接口地址和缓存版本隔离,避免更换模型/API 后复用旧结果; - 文档空间上下文 :原文文字、图片 OCR、彩色图片描述分别放入明确区块;PPTX 使用形状坐标,XLSX 使用单元格/图片范围,PDF 使用页码和文字坐标,DOCX/Markdown 在无法得到真实像素坐标时明确标注精度,不伪造位置; - 文档图片分流 :文字型图片优先 OCR;彩色/混合图片输出详细描述并保留 OCR;图片 OCR 明确标注为图片内容,不会覆盖正文; - 稳健性 :处理 429/5…
View full README on GitHub →Category
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 1,700
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 884
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 405