xzyonline/dsh-vision
xzyonline★ 1TypeScriptLast synced: 2026-08-15
Vision for text-only DeepSeek: view_image tool via any OpenAI-compatible VLM endpoint. macOS/Windows/Linux, one-click install.
README excerpt
dsh-vision — 给纯文本 DeepSeek 的「眼睛」(DSH 视觉方案总入口) 本仓库是 DeepSeek Harness(DSH)视觉方案 的总入口:让没有视觉能力的 DeepSeek 模型 在 Web 端与 CLI 端 都能看图、贴图、OCR、追问细节。核心插件 view image (本仓库维护) 负责「任意视觉问答」;方案还整合了 ModLens(粘贴链路与 请求前图片转换)、macOS 本地 OCR(免费离线)与多 provider 兜底脚本。 方案修订:2026-08-15(ModLens 架构落地 + autoRead 修复)|审查报告见 docs/REVIEW.md 为什么需要这套方案 - DSH 的 DeepSeek chat-completions 适配器是 纯文本 的:消息或历史中出现任何图片块会整轮报 UNSUPPORTED CONTENT ,且历史重放会把图片永久带进每次请求——即「贴一张图,会话永久瘫痪」。 - 本方案在 四层 上把图片在进入模型前转成文字证据:贴图链路 → 请求前转换 → 模型工具 → 本地兜底。 架构总览 层 组件 端 职责 L1 粘贴链路 原生贴图 + 准入声明 Web 贴图按 DSH 原生附件入库, 输入框/消息里显示整张图缩略图 ;模型元数据声明 ["text","image"] 让准入放行(见 DEPLOY.md 第 2 步) L2 序列化转换 imageBlocksToText 补丁 双端 只改 发给模型的 wire :图片块 →「已保存为本地文件: 」文本; 聊天里的整张图不受影响 ;历史重放同样转换,不再崩会话 L3 模型工具 view image (本插件)/ modlens read image 双端 模型拿到路径后自主读图:任意视觉问题(view image)/ 结构化证据(modlens:OCR+布局+语义+不确定性清单) L4 本地兜底 dsh-ocr / vision.py 双端 macOS Vision 框架离线 OCR(免费不限量)/ 多 provider(智谱/豆包/通义/OpenAI/Claude)脚本 L5 模型变体 (modlens vision) 包装路由 双端 仅对 未声明图片输入的 provider (如 glm)注册;DeepSeek 已由准入声明+序列化补丁覆盖,不再有此变体 端到端链路 - 历史含图的老会话 :序列化补丁在重放时同样转换,不再 UNSUPPORTED CONTENT (2026-08-15 已实测修复)。 - autoRead 已关闭 ( autoRead: false ):它会在 pre-step 改写消息本身,把聊天里的图替换成 OCR 英文文字(2026-08-15 实测踩坑),序列化补丁是保留整张图的正确层。 - paste-…
View full README on GitHub →Category
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 1,700
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 884
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 405