xzyonline/dsh-vision

xzyonline★ 1TypeScriptLast synced: 2026-08-15

Open on GitHub

Vision for text-only DeepSeek: view_image tool via any OpenAI-compatible VLM endpoint. macOS/Windows/Linux, one-click install.

README excerpt

dsh-vision — 给纯文本 DeepSeek 的「眼睛」(DSH 视觉方案总入口) 本仓库是 DeepSeek Harness(DSH)视觉方案 的总入口:让没有视觉能力的 DeepSeek 模型 在 Web 端与 CLI 端 都能看图、贴图、OCR、追问细节。核心插件 view image (本仓库维护) 负责「任意视觉问答」;方案还整合了 ModLens(粘贴链路与 请求前图片转换)、macOS 本地 OCR(免费离线)与多 provider 兜底脚本。 方案修订:2026-08-15(ModLens 架构落地 + autoRead 修复)|审查报告见 docs/REVIEW.md 为什么需要这套方案 - DSH 的 DeepSeek chat-completions 适配器是 纯文本 的:消息或历史中出现任何图片块会整轮报 UNSUPPORTED CONTENT ,且历史重放会把图片永久带进每次请求——即「贴一张图,会话永久瘫痪」。 - 本方案在 四层 上把图片在进入模型前转成文字证据:贴图链路 → 请求前转换 → 模型工具 → 本地兜底。 架构总览 层 组件 端 职责 L1 粘贴链路 原生贴图 + 准入声明 Web 贴图按 DSH 原生附件入库, 输入框/消息里显示整张图缩略图 ;模型元数据声明 ["text","image"] 让准入放行(见 DEPLOY.md 第 2 步) L2 序列化转换 imageBlocksToText 补丁 双端 只改 发给模型的 wire :图片块 →「已保存为本地文件: 」文本; 聊天里的整张图不受影响 ;历史重放同样转换,不再崩会话 L3 模型工具 view image (本插件)/ modlens read image 双端 模型拿到路径后自主读图:任意视觉问题(view image)/ 结构化证据(modlens:OCR+布局+语义+不确定性清单) L4 本地兜底 dsh-ocr / vision.py 双端 macOS Vision 框架离线 OCR(免费不限量)/ 多 provider(智谱/豆包/通义/OpenAI/Claude)脚本 L5 模型变体 (modlens vision) 包装路由 双端 仅对 未声明图片输入的 provider (如 glm)注册;DeepSeek 已由准入声明+序列化补丁覆盖,不再有此变体 端到端链路 - 历史含图的老会话 :序列化补丁在重放时同样转换,不再 UNSUPPORTED CONTENT (2026-08-15 已实测修复)。 - autoRead 已关闭 ( autoRead: false ):它会在 pre-step 改写消息本身,把聊天里的图替换成 OCR 英文文字(2026-08-15 实测踩坑),序列化补丁是保留整张图的正确层。 - paste-…

View full README on GitHub →
Media / Contentai-assisteddeepseekdeepseek-harnessdshdsh-pluginpluginview-imagevision

Category