kid-tea/dsh-rapid-ocr-ui
kid-tea★ 0TypeScriptLast synced: 2026-08-16
Local text-only OCR plugin for DeepSeek Harness: ocr_image tool extracts text from images locally — no vision model, no API key, no external upload.
README excerpt
dsh-rapid-ocr-ui 给 DeepSeek Harness 的 纯文本 Agent 装上本地 OCR:图片粘贴/引用后, 用 ocr image 工具在本地提取文字并返回纯文本——不依赖视觉模型、不需要 API Key、 不发送任何图片到外部服务。 =20" / 这是什么 dsh-rapid-ocr-ui 是 DeepSeek Harness 的双面(Host + Client)插件,核心是 一个本地、纯文本输出的 OCR 工具 : - ocr image(file path) —— 把图片(PNG/JPEG/WebP/BMP/GIF)在本地跑 OCR, 返回 { path, text, provider } 。对不支持图片输入的纯文本模型,它就是 read image 的替代品: 提取文字 ,而不是看图。 - read image 能力分发 —— 插件不改写任何模型。图片能力由当前路由的 模型决定:多模态模型照常走原生 read image ;纯文本路由会被引导去用 ocr image ,而不是收到一张它读不了的图。 - systemPrompt 引导 —— 会话提示词里会告诉纯文本 Agent:「提取文字用 ocr image 」。 - 聊天页 OCR 开关 —— 输入栏左侧有一个「OCR 模式」小按钮(会话级), 打开后按需对图片做 OCR,纯文本 Agent 也能「看」图片里的字。 - ctx.ocr 可插拔 seam —— 后端支持 tesseract / rapidocr / paddleocr-json / paddleocr-py ,默认 none 是无害的空实现(不装引擎也能 启动)。 它解决什么 :你的会话用的是不支持图片输入的模型(比如 DeepSeek 纯文本 路由)时,用户贴一张图,Agent 无法读图。这个插件让 Agent 用本地 OCR 把 图片里的 文字 变成纯文本继续工作——截图里的报错、文档截图、验证码、票据、 PPT 文字等,全部在本地完成,不出本机。 与「纯视觉方案」的关系 [!NOTE] 社区已有 纯视觉方案 (基于视觉模型的完整图像理解:看图问答、像素级定位、 裁剪、对比、取色、OCR 等)。如果你的需求是「让 Agent 真正看懂图」(描述、 定位元素、UI 还原),请优先使用纯视觉方案——它们对图片的理解是完整的。 本插件定位是互补的 轻量文字提取器 : - 纯文本输出 :只返回文字,不含图像推理,纯文本模型直接可用; - 本地运行 :tesseract 等引擎全在本机,图片不出本机、无外部依赖; - 零成本 :不需要视觉模型、不需要 API Key、不消耗视觉额度; - 即装即用 :装好 tesseract(或任一支持的引擎)即可,无需配置模型组。 一句话: 要看懂图,用纯视觉方案;只需要图里的…
View full README on GitHub →Category
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 2,346
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 946
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 517