ethanweave/glm4v-vision-mcp

ethanweave★ 1Python最后同步: 2026-08-14

在 GitHub 打开

GLM-4.6V 图像理解 MCP:识图/OCR/图表解析,原生接入 DeepSeek Harness(dsh-mcp-client),也兼容 Codex/Cline 等

README 摘要

GLM-4.6V-Flash 图像理解 MCP + Codex Skill 基于智谱开放平台 GLM-4.6V-Flash (免费视觉模型, 128K 上下文 )的图像理解 MCP 服务, 一键部署到 macOS / Linux / Windows,并封装为 Codex Skill: 用户发图即自动识图,优先级高于普通对话 。 你只需要做一件事: 填入 ZHIPU API KEY (免费申请:https://open.bigmodel.cn/usercenter/apikeys ), 其余全部自动化。 零、配合 DeepSeek Harness 使用(原生 MCP 接入) DSH 原生支持 MCP( @deepseek-ai/dsh-mcp-client ),无需 Codex,直接把本模块注册为 DSH 工具: 在 /.dsh/profiles/ /cordis.patch.yml 加入 (注意: command 用你的 venv python 绝对路径): 生效步骤 : 1. 确认已安装 venv 依赖( server/requirements.txt )且 server/.env 已填 Key 2. 保存配置 → 完全退出并重启 DSH ( dsh web 或托盘退出) 3. 验证:DSH 会话里应出现 mcp glm4v analyze image / ocr image / analyze chart 等工具 4. 发一张图或说「这张图里有什么」→ 模型自动调用识图工具 Key 由服务器自动读取同目录 server/.env ,DSH 配置无需硬编码密钥。 下面「四、MCP 接入参数」是通用配置,同样适用于 Codex / Cline / Claude Desktop 等。 一、目录结构 二、MCP 能力(工具清单) 工具 说明 analyze image(image, prompt, ...) 图文问答 / 图片理解,支持 URL、data URI、裸 base64、本地路径,支持最多 8 张多图 ocr image(image, language, ...) OCR 文字识别:逐行输出、保留版式、表格转 Markdown,支持区域裁剪 analyze chart(image, chart type, ...) 图表解析:识别类型/坐标轴/图例/单位,结构化提取数据,总结趋势 describe image(image, detail, ...) 图片内容描述(brief / standard / detailed) check setup(ping=true) 环境自检:Key / 模型 / 端点 / 依赖 / 真实联网 ping 图片输入四种形式 ( image 参数): 1. http(s):// 公开 URL(默认直传,也可 GLM DOWN…

在 GitHub 查看完整 README →
Media / Contentcodexdsh-pluginglmimage-understandingmcpocrvision

分类