yan5236/slcatwujian-dsh-vision-plugin
yan5236★ 1JavaScript最后同步: 2026-08-14
让不支持图片输入的主模型通过已配置的视觉模型理解图片的 DSH 插件:自动桥接、像素坐标描述、vision_ask 追问工具与设置页
README 摘要
slcatwujian 的 DSH 图片理解插件(vision-bridge) 让不支持图片输入的主模型也能"看懂"图片 —— 插件会自动把消息中的图片交给已配置的视觉模型分析,生成 带像素坐标系 的文字描述注入会话,主模型基于描述理解图片,无需更换主模型。 包名: @dsh-local/vision-bridge | 版本:1.0.0 | 许可证:MIT 功能特性 - 🖼️ 自动图片桥接 :用户上传图片后,插件调用配置的视觉模型生成详细描述(内容概括、元素定位、文字转录、状态细节),并把消息中的图片块替换为文字描述,主模型照常回复。 - 🎯 像素坐标体系 :所有元素位置都以像素坐标给出 —— 原点在图片左上角 (0,0) ,x 轴向右、y 轴向下;元素定位格式为中心点 (cx, cy) 与边界框 [x1, y1, x2, y2] 。 - 🔍 vision ask 追问工具 :助手在回答中需要更多图片细节时,可调用 vision ask 工具向视觉模型追问(支持 attachmentId 或本地图片路径 path 两种入参)。 - 📤 发送放行补丁 :自动解除网页端对"不支持图片输入模型"的图片发送拦截,消息可正常发出,由插件接管图片分析。 - ⚙️ 内置设置页 :在 设置 → 图片理解 中配置视觉模型提供方/模型、描述最大 token 数、自动分析开关,支持一键「测试模型」验证与「声明图片输入」。 - 💾 配置持久化 :配置写入 DSH 存储(storage: json),DSH 重启后自动恢复。 - 🔁 去重缓存 :同一图片在同一会话内只分析一次,描述结果缓存复用。 工作原理 插件通过 llm/stream 事件钩子实现桥接;同时为网页端 RPC( /vision-bridge/rpc )提供 get-state / list-models / set-config / test / enable-image 接口供设置页调用。 安装 1. 将本插件目录放入 DSH web profile 的本地包目录: 2. 在 profile 的 cordis.patch.yml 中注册插件(追加到 insert 列表): 3. 重新加载 DSH web 服务(或重启 DSH)。 依赖 - DSH(含 @deepseek-ai/cordis 、 @deepseek-ai/dsh-tools 、 @deepseek-ai/dsh-llm ) - 已配置至少一个 支持图片输入 的模型提供方(如 pi-ai 系适配器),用于充当视觉模型 配置 打开 设置 → 图片理解 : 配置项 说明 模型提供方 选择已注册的模型提供方(需在 设置 → 模型 中提前配置) 视觉模型 选择或手动输入支持图片输入的模型 ID 描述最大 token 数 200–8000,默认 12…
在 GitHub 查看完整 README →分类
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 1,123
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 794
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 298