reimu-create/dsh-vision
reimu-create★ 3JavaScript最后同步: 2026-08-14
DSH plugin: text-only models (e.g. DeepSeek-V4) automatically see images via a vision model. Official surface-replace, cache-friendly, human transcript untouched. 纯文本模型自动识图桥
README 摘要
dsh-vision —— 给纯文本模型自动配眼 让 DeepSeek-V4 这类纯文本模型在 dsh 里"看到"图片:图片消息自动桥接为视觉模型生成的文字描述,原图保留在人类转录中。零新增凭据 —— 视觉模型复用 profile 已配置的 llm-pi-ai 路由(默认 opencode-go / minimax-m3 ,与主模型同一把 key)。 原理(全部基于 dsh 官方机制,零 hack) 1. 拦截 llm/stream waterfall:请求含 image 块且目标模型未声明 image 输入时触发; 2. 用视觉模型把图片转为文字描述; 3. 把描述作为一条 user/message surface-replace 事件 append 进会话日志(与 compaction 压缩历史同款机制)—— 只对模型可见,人类转录保留原图 ; 4. 本次请求用同一份描述改写后放行,首轮即成功; 5. 替换事件落库后,后续每轮历史投影天然给出稳定文本:网关前缀缓存与普通文本会话完全等价(历史全命中,仅新消息 miss)。 安装 配置(官方 settings 通道,热生效) 界面方式 :设置 → 插件 → 额外插件 → 可配置插件 → 展开 dsh-vision 卡片: - 视觉模型下拉 :自动枚举当前所有 provider 中声明 [text, image] 输入的模型(按提供方分组); - 高级字段:输出上限、模式(auto/manual/both)、超时。 保存后写入 settings.yaml 的 dsh-vision 分节(与 llm-pi-ai 同款官方通道),下一次识图立即生效。 文件方式 (组合层默认值,见 bundle 自带 cordis.patch.yml ): 配置解析顺序:patch 的 config (组合层 base)→ settings.yaml 用户层,后者优先;字段级覆盖,热生效。 说明:官方"插件配置"标签页只服务 dsh 仓库内白名单命名空间(apiproxy),第三方插件的配置 UI 由 uiopt 的"额外插件"卡片承载,数据通道仍是官方 settings seam。 行为说明 - 自动桥 :图片出现在纯文本模型的请求中时自动转换,无需模型或用户做任何事; - 原生看图优先 :当前模型自身支持 image(如 kimi-k3 )时插件完全不干预; - see image 工具 :手动/追问入口, file path + 可选 question ; - 缓存 :描述固化在日志,历史前缀缓存与文本会话等价;新图首次出现按未命中价计费一次(与发送新消息相同); - 失败语义 :视觉调用失败时本次请求仍成功(图片位置为"解析失败"占位),且不固化,下次自动重试; - 成本 :视觉调用不进入会话 usage 统计(绕过 ag…
在 GitHub 查看完整 README →分类
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 1,700
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 884
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 405