baimaomaomao556/eagleeye-mcp
baimaomaomao556★ 0PythonLast synced: 2026-08-14
EagleEye MCP — pixel-accurate visual toolbox for Agents (screenshot, measure, OCR, regression)
README excerpt
EagleEye MCP 0.6.1 beta — Pixel-accurate visual toolbox for Agents 截屏 · 像素测量 · OCR · 模板匹配 · 视觉回归(确定性优先,不是「把图读成一段话」) Acquire → Focus → Measure → Perceive · Compare · Verify 公开仓库:https://github.com/baimaomaomao556/eagleeye-mcp(git tag dsh-plugin )。 与摄像头 MCP「Open Eagle Eye」无关。 这是什么 / 不是什么 EagleEye 是 MCP Server (stdio),不是一次性看图 CLI。DSH / Agent Skills 薄包装见 skills/eagleeye/ 。 你要做的事 用 对话里出现一张图,先读成结构化证据 modlens 按剧本还原 UI / 长截图 OCR / 描 SVG vision-tools 截当前桌面、量像素、做视觉回归 EagleEye 平台能力 能力 Windows macOS / Linux capture screen / load image / 测量 / OCR / Visual QA 支持 支持 list monitors 支持(含 DPI) 支持(mss bounds,无 DPI) list windows / capture window 支持 PLATFORM UNSUPPORTED capture window graphics (后台渲染表面) Win10 2004+ PLATFORM UNSUPPORTED 窗口类工具在非 Windows 上返回结构化错误,不会静默失败。请改用 capture screen 或 load image 。 快速开始 本地开发(当前推荐) Host 接入见 docs/HOSTS.md。上下文紧张时可设 EAGLEEYE TOOL PROFILE=core ,只暴露 Phase 1 的 8 个工具;默认 full 为全部 32 个。 uvx / skills 示例 Host 配置见 examples/mcp.uvx.json ;本地已安装时用 examples/mcp.local.json 。 工具清单(32 个,按计划分层) Phase 1 · MVP(8 个)· EAGLEEYE TOOL PROFILE=core 层级 工具 说明 L0 获取 capture screen 屏幕截图(mss,多显示器,含黑帧检测) L0 获取 load image 加载本地图片 L1 视野 crop image 按精确坐标裁剪 L2 测量 get pixel 读取像素颜色 L2 测量 sample region 区域颜色统计(均…
View full README on GitHub →Category
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 1,700
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 884
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 405