BaihaWhite/mcp-ds-ocr
BaihaWhite★ 1JavaScript最后同步: 2026-08-16
—
README 摘要
dsh-ocr · DSH OCR 视觉识别插件 视觉模型 OCR 插件(OpenAI / Anthropic 双协议):配置 API 格式 / API URL / API Key / Model Name (设置 → 插件 → 插件配置 的可折叠卡片),支持 获取模型列表 与 测试连接 按钮; ocr recognize 工具对传入图片自动识别;结果 百分比坐标化 并以 对角线两点方框 描述;低置信度文字自动 同图区域重读 再识别并合并。 安装 方式一:插件商店(推荐,已收录) 仓库已打 topic:dsh-plugin 并被商店收录, package.json 已声明 dsh.bundle.patch : 1. 打开 设置 → 插件 → 插件商店 ,搜索 dsh-ocr (或 BaihaWhite ); 2. 卡片点「安装」:自动 pnpm add github:BaihaWhite/mcp-ds-ocr + 写入 profile bundles; 3. 重启 DSH 生效;之后可「更新 / 卸载 / 一键更新」。 方式二:手工挂载(本地开发) 文件 文件 说明 lib/index.js 宿主半(ESM 无构建): ocr recognize 工具、 /api/dsh-ocr/models test 路由(loopback+同源校验)、配置经 dsh-settings 持久化 lib/client.js 浏览器半(ModuleLoader lazy-factory):设置 → 插件 的可折叠配置卡片 package.json 包清单: exports ( . 宿主 / ./client 浏览器)、 dsh.bundle.patch (商店安装)、 dsh.client (浏览器自动发现) cordis.patch.yml bundle patch:声明 dsh-ocr 插件行 plugin/ 早期动态 Cordis 版本源码存档(已由正式包取代) test-400x300.png 400×300 测试图片 配置项(dsh-settings 持久化,全局生效) 字段 说明 apiFormat openai (POST {apiurl}/chat/completions ,Bearer)或 anthropic (POST {apiurl}/v1/messages ,x-api-key + anthropic-version,自动补 /v1 ) apiurl 服务商 base URL apikey 认证密钥(明文存于本机设置文件,请勿外传) model 视觉模型名;「获取模型列表」拉取后可从旁侧下拉选择 threshold 置信度阈值(默认 0.7),低于阈值触发区域重读 coordMode both / percent / pixel retryEnable…
在 GitHub 查看完整 README →分类
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 2,208
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 933
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 488