cransmathenia666-hash/dsh-Sight
cransmathenia666-hash★ 1PowerShellLast synced: 2026-08-14
Give text-only DeepSeek Harness (dsh) agents vision — pasted images auto-convert to text descriptions with persistent caching, each image converted only once.
README excerpt
dsh-Sight 中文 · English 让 DeepSeek Harness(dsh)拥有 视觉能力 :无论你选用的模型是纯文本还是多模态, 都可以直接粘贴图片,由 harness 自动把图交给视觉工具理解。 解决的问题 dsh 本身不限制图片进入会话,但当你选用的模型是 纯文本模型 (例如 deepseek-v4-flash ), 粘贴图片会整轮失败,报错: 图片根本进不了会话,agent 也没有机会用任何工具去看它—— dsh 就此失去视觉能力 。 本项目从根上给 dsh 补上这条"视觉通路":图片能进会话,agent 能读到图, 理解交给视觉工具完成。结果就是: dsh 在纯文本模型下也能看图了 。 原理 dsh 的 pi-ai 模型通道( @deepseek-ai/dsh-llm-pi-ai )在把请求发给模型之前,有一个硬校验: 只要本轮含图片、而模型声明不支持图片,就直接抛错终止整轮。本项目(dsh-Sight)做两件事: 1. 请求时改写(request-time rewrite)+ 描述缓存 :当"真实模型无图能力 + 消息含图"时,不再抛错。 补丁读取 /.qwen-mm-plugins/config 里的 DashScope 配置, 直接调用视觉 API 把图片转成 文字描述 (如"一个女孩站在楼梯上…"),用这段文字替换图片占位后继续发给模型;转换结果写入 /tmp/paste/descriptions.json 持久化缓存, 同一张图只转换一次 ,之后任何轮次、 任何会话、重启后都直接复用描述,不再重复调用视觉 API(消除"每轮 10 30 秒"的固定延迟)。 视觉 API 不可用时回退为"把图落盘到 /tmp/paste/ 并给模型指路"。 2. 假装支持图片 : resolveModel / listModels 声明模型支持图片输入,让 harness 的 selectModel 检查通过—— 即使会话里已经出现过图片,也能自由切换回纯文本模型 , 不会被"此模型不支持图片"挡住。 效果:粘贴图片不再整轮失败;图片在请求前就转成文字(比另调一轮视觉 MCP 更快),且同一张图只转一次、之后所有轮次秒回; 纯文本模型(如 deepseek-v4-flash)与多模态模型之间可以随意切换。 前提 : /.qwen-mm-plugins/config 里配好 DASHSCOPE API KEY (用于把图转成文字)。 没有该配置时会自动回退到"落盘 + 让 agent 调视觉 MCP 工具"的旧方案,不会报错。 兼容性 项 值 :-- :-- dsh 版本 0.1.0-rc.6 (其他版本需自行核对,脚本会自动拦截版本不匹配) 平台 Windows(PowerShell)/ macOS / Linux(bash) 前置 Nod…
View full README on GitHub →Category
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 1,700
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 884
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 405