paul-yangmy/dsh-umi-ocr-vision

paul-yangmy★ 0JavaScript最后同步: 2026-08-17

在 GitHub 打开

README 摘要

dsh-umi-ocr-vision DeepSeek Harness 的 Umi-OCR 视觉桥接插件。 它参考 dsh-vision 的桥接思路:当主模型只有文本能力时,自动把聊天中的图片交给本地 Umi-OCR 识别为文字,再把 OCR 结果作为“非可信视觉上下文”注入请求,最后由原来的 DeepSeek 文本模型完成回答。 Umi-OCR 是离线 OCR 工具,提供的是文字识别能力,不是完整的多模态语义理解。对于纯截图、文档、验证码、界面文字等场景非常合适;如果图片需要理解空间关系、物体语义,请改用真正的视觉大模型插件(例如 dsh-vision )。 工作原理 当前主模型 图片处理方式 最终回答者 支持图片 原图直接发送,不经过 Umi-OCR 当前模型 deepseek-official 等文本模型 Umi-OCR 读取原图,OCR 文本作为非可信附件上下文注入 DeepSeek - 插件不会替换你在界面中选择的主模型。 - 多张聊天附件会按顺序分别 OCR,然后一起放入同一次 DeepSeek 请求。 - OCR 结果被标记为“非可信观察数据”,图片中出现的提示词不会获得系统权限。 - 不把图片发送到任何云端服务(HTTP 模式也默认只访问本机 127.0.0.1 )。 安装 安装后重启 Harness。 准备 Umi-OCR 1. 下载并启动 Umi-OCR。 2. 确认 Umi-OCR 的 HTTP 服务已开启:默认监听 http://127.0.0.1:1224 。 - 如果关闭了 HTTP 服务,请到 Umi-OCR「全局设置」中开启。 3. 可先用浏览器访问 http://127.0.0.1:1224/api/ocr/get options 验证服务可用。 CLI 模式(可选) 如果你不想开 HTTP 服务,也可以让插件直接调用 Umi-OCR 命令行: CLI 模式会先把图片写入临时目录,再执行: 然后读取输出文件。CLI 模式需要 Umi-OCR 支持命令行调用。 配置 在 $DSH HOME/settings.yaml 的 llm-deepseek 段落中配置(不需要重启): 也可以直接在 Harness「设置 → 插件 → 插件配置」中修改同一份配置。 工具集 启用 enableVisionTools: true 后,插件会导出 createVisionTools ,向 Harness 注册以下 vision 工具: - vision ocr : 对图片执行 Umi-OCR,返回全文和行级坐标。 - vision glance : 快速查看图片,返回尺寸和可见文本。 - vision detect text : 列出所有文本块及原始坐标。 - vision ground text : 按文本定位元素,返回 x1,y1,x2,y…

在 GitHub 查看完整 README →
内容/媒体deepseek-harnessdshdsh-pluginocrumi-ocrvision

分类