GOU-GEE/deepseek-vision
GOU-GEE★ 2Python最后同步: 2026-08-15
—
README 摘要
deepseek-vision-mcp 给 DeepSeek(及其他纯文本大模型)装上「眼睛」 的开源 MCP Server。 DeepSeek 系列模型是纯文本模型,无法直接识别图片。本项目的思路是: 通过 MCP Server 暴露一个 analyze image 工具 ,把图片交给第三方 OpenAI 兼容的视觉模型 API (智谱 GLM-4.6V、硅基流动 Qwen2.5-VL、 通义千问 qwen-vl-plus 等)识别,再把识别文本返回给主模型。 配合项目自带的 Skill 文件 ,DeepSeek 主模型在遇到图片时会 自动 调用 该工具——对用户来说,就像 DeepSeek 突然会「看图」了。 视觉识别能力由第三方模型提供,图片会被发送到对应服务商的 API。 请阅读文末的隐私说明。 🚀 一句话安装(复制给 AI 助手,免手动操作) 主要在 DeepSeek Harness 中使用时,复制下面的推荐提示词给助手。它会从全新克隆构建 本仓库的 DSH Bundle、安装到桌面版共用的 Web profile,并引导你在 DSH 可视化页面中 安全填写 Key,最后完成自动托管 Python 与真实图片验收。 其他 MCP 客户端请使用后面的通用版。 关于 API Key(请先读) : - ✅ 默认方案使用智谱 glm-4.6v-flash :安装后在 DSH 的 设置 → 插件 → 插件配置 → DeepSeek Vision 中填写你在 https://open.bigmodel.cn 申请的 Key。 - ⚠️ Key、模型和 Base URL 必须属于同一家服务商。硅基流动或通义千问的 Key 也能用, 但必须同时把对应的 VISION MODEL 与 VISION BASE URL 告诉助手,不能套用智谱默认值。 - 🔒 免费或付费 Key 都不必发给 AI 助手:可视化页面不会回显 Key,凭据由 DSH 官方凭据存储保存,不会写进仓库或普通配置文件。 DeepSeek Harness 推荐版(一会话从零部署并验收) : 其他 MCP 客户端通用版(Claude Code / Codex / OpenCode 等) : 如果你更喜欢手动安装,请按下方 快速开始 操作,效果完全一样。 目录 - 一句话安装(复制给 AI 助手) - 解决的问题 - 工作原理 - 支持的视觉模型 - 快速开始 - 配置说明 - 与 DeepSeek Harness 集成 - 与 Codex 集成 - Skill 自动触发机制 - 命令行工具 - 项目结构 - 开发与测试 - 常见问题 - 隐私说明 - 许可证 解决的问题 场景 没有本项目的 DeepSeek 有了本项目之后 用户发来一张报错截图,问「哪里错了?」 模型看不到图,只能让用户贴文字 自…
在 GitHub 查看完整 README →分类
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 1,700
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 884
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 405