ethanweave/glm4v-vision-mcp
ethanweave★ 1Python最后同步: 2026-08-14
GLM-4.6V 图像理解 MCP:识图/OCR/图表解析,原生接入 DeepSeek Harness(dsh-mcp-client),也兼容 Codex/Cline 等
README 摘要
GLM-4.6V-Flash 图像理解 MCP + Codex Skill 基于智谱开放平台 GLM-4.6V-Flash (免费视觉模型, 128K 上下文 )的图像理解 MCP 服务, 一键部署到 macOS / Linux / Windows,并封装为 Codex Skill: 用户发图即自动识图,优先级高于普通对话 。 你只需要做一件事: 填入 ZHIPU API KEY (免费申请:https://open.bigmodel.cn/usercenter/apikeys ), 其余全部自动化。 零、配合 DeepSeek Harness 使用(原生 MCP 接入) DSH 原生支持 MCP( @deepseek-ai/dsh-mcp-client ),无需 Codex,直接把本模块注册为 DSH 工具: 在 /.dsh/profiles/ /cordis.patch.yml 加入 (注意: command 用你的 venv python 绝对路径): 生效步骤 : 1. 确认已安装 venv 依赖( server/requirements.txt )且 server/.env 已填 Key 2. 保存配置 → 完全退出并重启 DSH ( dsh web 或托盘退出) 3. 验证:DSH 会话里应出现 mcp glm4v analyze image / ocr image / analyze chart 等工具 4. 发一张图或说「这张图里有什么」→ 模型自动调用识图工具 Key 由服务器自动读取同目录 server/.env ,DSH 配置无需硬编码密钥。 下面「四、MCP 接入参数」是通用配置,同样适用于 Codex / Cline / Claude Desktop 等。 一、目录结构 二、MCP 能力(工具清单) 工具 说明 analyze image(image, prompt, ...) 图文问答 / 图片理解,支持 URL、data URI、裸 base64、本地路径,支持最多 8 张多图 ocr image(image, language, ...) OCR 文字识别:逐行输出、保留版式、表格转 Markdown,支持区域裁剪 analyze chart(image, chart type, ...) 图表解析:识别类型/坐标轴/图例/单位,结构化提取数据,总结趋势 describe image(image, detail, ...) 图片内容描述(brief / standard / detailed) check setup(ping=true) 环境自检:Key / 模型 / 端点 / 依赖 / 真实联网 ping 图片输入四种形式 ( image 参数): 1. http(s):// 公开 URL(默认直传,也可 GLM DOWN…
在 GitHub 查看完整 README →分类
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 1,123
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 794
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 298