CraZY222123/dsh-ocr-plugin
CraZY222123★ 8Python最后同步: 2026-08-14
—
README 摘要
dsh-ocr-plugin 给 DeepSeek Harness 加"眼睛"的本地 OCR 插件: 让纯文本模型 真正看到图片内容 ——截图、发票、表格、扫描件、多栏文档,全部本地识别,不依赖任何云 OCR。 背景:DeepSeek API 当前不接收图片输入,对话里发图只能看到"这是一个图片附件"。 本插件在消息序列化时把图片 本地 OCR 成文本 再发给模型,图片从此可被理解。 快速通道秒级出结果(rapidocr),深度通道用 DeepSeek-OCR-2 做版面级解析。 ⚠️ 平台兼容性(先看这里) 本插件在 鸿蒙 PC(HarmonyOS PC) 上开发并实测通过,针对鸿蒙做了部分适配: - 快速通道(RapidOCR)在鸿蒙 PC 沙箱环境下正常可用; - Python 运行库可通过 DSH OCR PYTHONPATH / DSH OCR LD LIBRARY PATH 指向自带依赖(如 brew 安装的 Python 3.12 与 vendored 轮子); - 深度通道(llama.cpp)在鸿蒙 PC 上可运行,但 CPU 推理耗时较高;若在受限沙箱(线程即进程)下遇到视觉编码异常慢的性能问题,建议在容器或常规主机上运行深度推理。 其他系统(Linux / macOS / Windows) :插件本体是跨平台 Node.js + Python 实现,无鸿蒙专属依赖,满足前置要求即可运行。 DSH OCR PYTHONPATH / DSH OCR LD LIBRARY PATH 仅在需要自带 Python 运行库时设置;Windows 不需要 LD LIBRARY PATH 。 功能 - 双通道 OCR - 快速: ocr image.py + RapidOCR(onnxruntime,秒级) - 深度:DeepSeek-OCR-2(GGUF 量化,llama.cpp llama-mtmd-cli 本地推理)——消息里带 [深度识图] 即触发 - 版面理解 (移植自 DeepSeek-OCR-2 的版面原理): - 行主序阅读顺序重排(多栏先左后右、栏内自上而下) - 网格对齐表格检测 → 还原为 分隔 的 Markdown 行 - 每行文本附带左上角坐标 文本@x,y ,供模型按语义重组 - 缓存 :快速通道内存缓存(128 条),深度通道按附件 ID 磁盘缓存( $DSH HOME/attachments/ocr2-cache ),同一图片只算一次 - 即插即用 :以 ctx.provide('ocr', ...) 挂到适配器缝上——装上即接管、停用即回退内置实现,无需改适配器代码(前提见下方"前置要求") 工作原理 目录结构 前置要求 组件 必需 说明 DeepSeek Harness ✅ 部署含 dsh-llm-deepseek …
在 GitHub 查看完整 README →分类
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 2,047
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 920
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 457