fengs2021/dsh-image-mmx
fengs2021★ 0JavaScriptLast synced: 2026-08-16
给 DSH 文本模型装眼睛:图片自动调用 mmx(MiniMax VLM)识别,识别结果注入模型上下文
README excerpt
dsh-image-mmx 给 DeepSeek Harness 的 文本模型 装一双眼睛:会话里粘贴/发送图片,自动调用 mmx(MiniMax VLM) 识别,识别结果注入模型上下文——DeepSeek 等纯文本模型也能理解图片内容。 能力 - 图片收发 :文本模型( inputModalities 无 image)也能发送含图消息,不再报「当前模型不支持图片」 - 自动识别 :图片落盘到会话工作区 .attachments/ ,自动执行 mmx vision describe (MiniMax VLM) - 模型可见替换 :图片块在模型可见面替换为 [图片N]:" " + mmx 识别文本(画面元素、布局、报错/代码/界面文字逐字保留) - 用户侧不变 :人类 transcript 照常渲染原图缩略图(可点击放大) - 优雅降级 :mmx 未安装/未认证/超时(60s)/格式不支持(gif)时降级为路径文本 - 原生模型免打扰 :本身支持图片输入的模型走原生路径,不做任何处理 配套插件:dsh-file-bridge(📎 附件按钮上传 + send files 文件下发 + explorer 跳转)。 依赖 本机已安装并认证 mmx-cli (MiniMax 官方 CLI): 安装 前置:DeepSeek Harness 0.1.0-rc.6+ 、Node.js 18+。 使用 1. 在 DSH Web 输入框 粘贴/拖入图片 (或配合 dsh-file-bridge 的 📎 附件按钮选图) 2. 发送后插件自动:落盘 → mmx 识别 → 模型直接读到识别结果并回复 3. 多图支持:每张图独立并行识别,按 [图片1] [图片2]... 编号 实现 基于 dsh-image-bridge(MIT)机制改造: 1. 包装 llm.resolveModelInfo 为文本模型补 image 模态(放行 api-proxy 预检) 2. agent/pre-step :图片落盘 + 并行调用 mmx vision describe 3. agent/request-error :surface replace 把图片块换成识别文本, retry 重发 License MIT
View full README on GitHub →Category
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 2,047
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 920
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 457