tenglongbohai/dsh-paddle-ocr

tenglongbohai★ 0JavaScript最后同步: 2026-08-19

在 GitHub 打开

DSH plugin: Add PaddleOCR vision capability to Agnes-2.5-Flash free model

README 摘要

dsh-paddle-ocr DSH 插件:为纯文本模型添加 PaddleOCR 视觉识别能力 🎯 解决的问题 问题背景 许多 LLM 提供商的文本模型不支持图片输入,导致用户在 DSH 中无法使用图片功能: - ❌ Agnes-2.5-Flash 仅支持网络图片 URL,无法处理本地截图 - ❌ DeepSeek-V4 系列官方声明为纯文本模型 - ❌ MiniMax-M2.x 系列不支持图片输入 - ❌ GLM 纯文本模型(不带 V)不支持图片输入 - ❌ Mimo-v2.5-pro 是纯文本模型,不支持图片 解决方案 本插件通过 PaddleOCR VL 1.6 为纯文本模型添加视觉能力: - ✅ 本地文件支持 - 用户上传的截图可直接识别 - ✅ 网络图片支持 - URL 图片也可识别 - ✅ 多提供商支持 - Agnes, DeepSeek, MiniMax, GLM, Mimo - ✅ 智能检测 - 自动跳过多模态模型(如 GLM-4V, MiniMax-M3, Mimo-v2.5) - ✅ 完全免费 - Agnes 免费 + PaddleOCR 每日 20,000 页免费额度 🔧 实现方式 核心技术 - PaddleOCR VL 1.6 - 百度飞桨视觉语言模型 - DSH Cordis 插件系统 - 使用官方 API 注册工具和模型变体 - 智能检测 - 自动判断模型是否已支持图片 工作流程 关键特性 - ✅ 多提供商支持 - 自动适配 Agnes, DeepSeek, MiniMax, GLM, Mimo - ✅ 智能过滤 - 自动跳过多模态模型(GLM-4V/5V, MiniMax-M3, Mimo-v2.5 等) - ✅ 本地文件支持 - PNG, JPEG, PDF, Word, Excel - ✅ 网络图片支持 - HTTP/HTTPS URL - ✅ 高精度识别 - 中文、英文、表格、公式 - ✅ 坐标定位 - 返回文字位置信息 📦 安装方式 前置要求 - Node.js = 22.19 - DSH = 0.1.0-rc.6 - PaddleOCR API Token (免费申请) 申请 API Token 1. 访问 百度 PaddleOCR API 申请页面 2. 注册/登录百度 AI Studio 账号 3. 申请 PaddleOCR VL API 权限( 免费 ) 4. 获取 API Token(约需 1-3 个工作日审核) 免费额度:每天 20,000 页次 步骤 1:克隆项目 步骤 2:安装依赖 步骤 3:配置 API Token 步骤 4:安装到 DSH 步骤 5:更新配置 编辑 /root/.dsh/profiles/web/package.json ,添加: 步骤 6:重启 DSH 🚀 使用方法 方式 1…

在 GitHub 查看完整 README →
内容/媒体dsh-pluginocrvision

分类