condaThinker/dsh-image-inline
condaThinker★ 2JavaScript最后同步: 2026-08-14
DSH plugin: show_image tool that renders an image inline into the web chat flow (QQ/WeChat style) — path text in the message, image bytes never enter model context.
README 摘要
dsh-image-inline 让 DeepSeek Harness (DSH) 的 Web UI 支持 模型主动把一张图片渲染进对话流 (QQ/微信聊天式:图片显示在会话里、可上翻、和对话同步)。 对话流消息内容里 只保留路径文本 ,图片本身 不进入模型上下文 (模型上下文保持干净,纯文本模型路由不受影响)。 工作方式 模型调用新增的 show image 工具(传入磁盘图片路径)时: 1. host ( dsh/index.js ):校验路径/格式/大小 → 读取字节 → 通过附件服务 saveImage 存成内容寻址附件 → 返回 纯文本 结果(路径 + 元数据摘要)。图片的展示载荷(attachmentId/宽高/字节数)通过工具的 presentationMeta 放进 tool/result 事件的 meta 字段—— 不进模型上下文、不进会话日志的 image 块 。 2. client ( dsh/client.js ):注册 tool.call.toolview 键控槽位(key = show image ),在对话流中该工具调用的位置渲染图片卡片(复用官方 MessageImage 组件:缩略图、点击看原图、加载失败可重试)。图片 URL 走插件自己的内容寻址 HTTP 端点。 为什么需要插件自己的 HTTP 端点? DSH 内置的 conversation.resolveImage → session.attachment RPC 只服务"会话日志的 image 块里被引用的附件"( api-proxy 的 referencedImage 授权)。本插件的结果 故意不包含 image 块 (否则图片会进入模型上下文),因此附件永远不会被日志引用,必须由插件自己提供读取通道。 安全性:attachmentId 是 sha256: 内容哈希—— 内容寻址 capability URL ,不知道图片内容就无法猜测;id 只出现在用户可读的会话日志与插件注册表中。服务默认绑定 loopback,与整个 Web UI 同一信任模型。 安装 本插件零构建(纯 JS),GitHub 直接分发源码,安装时无需执行任何构建脚本。 卸载: 配置 cordis.patch.yml 中的 config (可覆盖): 键 默认 说明 maxImageBytes 26214400 (25MiB) 单张图片编码字节上限(实际生效值 = min(本配置, 附件服务配置)) maxImagePixels 40000000 (40MP) 宽×高上限; 0 关闭该检查 mediaTypes png/jpeg/webp/gif 接受的格式白名单 使用 在会话中让模型显示一张图片,例如: 用 show image 显示 /path/to/your/image.png 模型调用…
在 GitHub 查看完整 README →分类
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 1,700
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 884
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 405