QEDQCD/dsh-ocr-vision

QEDQCD★ 0TypeScript最后同步: 2026-08-16

在 GitHub 打开

README 摘要

dsh-ocr-vision 一个 DeepSeek Harness 插件 (bundle),让 纯文本大模型 (如 DeepSeek)也能"看图"—— 新增模型侧 ocr image 工具,用本地 RapidOCR 把图片文字提取成纯文本返回给主聊,而不是 把图片发给模型。这是 claude-ocr-vision (Claude Code / Codex 版)在 DeepSeek Harness 上的对应实现。 解决什么问题 运行 DeepSeek Harness 接入 纯文本大模型 (DeepSeek 无多模态)时,模型需要识图时会调用 read image 工具,把图片作为 content block 发给后端。纯文本路由没有图片输入能力, read image 在 tool-fs 侧会严格拒绝("does not declare image input"),模型看到一条错误。 本插件从根上避免这件事:提供 ocr image 工具,把图里文字用本地 OCR 提取成纯文本返回, 模型永远只处理文本。同时通过系统提示段引导模型在纯文本路由下优先用 ocr image 。 工作机制 - 工具 : ocr image ,模型侧 schema,输出纯文本。图片字节永远不发给模型 API。 - 脚本 : ocr.py ,RapidOCR 封装(2 倍放大、 --region 区域裁剪、 --coords / --json 坐标、 空图容错),与 claude-ocr-vision 共用同一份。 - 技能 : SKILL.md ,任务导向三步流程(先明确识图目的/关注区域/任务关联,再提取,再围绕任务组织文本)。 - 系统提示段 : tool:ocr-vision ,引导模型在纯文本路由下用 ocr image 。 安装 系统要求 项目 说明 操作系统 Linux 或 macOS(Windows 未测试) Python 3.7+ Python 依赖 rapidocr-onnxruntime 、 pillow 、 numpy (缺失时 ocr image 会失败并报错) DeepSeek Harness dsh CLI 与一个 profile(如 headless / web ) 一句话让 Agent 帮你装 把下面整段复制给你的 Agent(Claude Code / Cursor / Codex 均可): 请先阅读 https://github.com/QEDQCD/dsh-ocr-vision 的 README.md「系统要求」,确认本机满足(Linux/macOS、Python 3.7+、已装 rapidocr-onnxruntime / pillow / numpy 、有 dsh CLI 与一个 profile 如 headless );不满足则先告知我缺…

在 GitHub 查看完整 README →
内容/媒体bundledeepseek-harnessdshdsh-pluginocrrapidocrvision

分类