cransmathenia666-hash/dsh-Sight

cransmathenia666-hash★ 1PowerShellLast synced: 2026-08-14

Open on GitHub

Give text-only DeepSeek Harness (dsh) agents vision — pasted images auto-convert to text descriptions with persistent caching, each image converted only once.

README excerpt

dsh-Sight 中文 · English 让 DeepSeek Harness(dsh)拥有 视觉能力 :无论你选用的模型是纯文本还是多模态, 都可以直接粘贴图片,由 harness 自动把图交给视觉工具理解。 解决的问题 dsh 本身不限制图片进入会话,但当你选用的模型是 纯文本模型 (例如 deepseek-v4-flash ), 粘贴图片会整轮失败,报错: 图片根本进不了会话,agent 也没有机会用任何工具去看它—— dsh 就此失去视觉能力 。 本项目从根上给 dsh 补上这条"视觉通路":图片能进会话,agent 能读到图, 理解交给视觉工具完成。结果就是: dsh 在纯文本模型下也能看图了 。 原理 dsh 的 pi-ai 模型通道( @deepseek-ai/dsh-llm-pi-ai )在把请求发给模型之前,有一个硬校验: 只要本轮含图片、而模型声明不支持图片,就直接抛错终止整轮。本项目(dsh-Sight)做两件事: 1. 请求时改写(request-time rewrite)+ 描述缓存 :当"真实模型无图能力 + 消息含图"时,不再抛错。 补丁读取 /.qwen-mm-plugins/config 里的 DashScope 配置, 直接调用视觉 API 把图片转成 文字描述 (如"一个女孩站在楼梯上…"),用这段文字替换图片占位后继续发给模型;转换结果写入 /tmp/paste/descriptions.json 持久化缓存, 同一张图只转换一次 ,之后任何轮次、 任何会话、重启后都直接复用描述,不再重复调用视觉 API(消除"每轮 10 30 秒"的固定延迟)。 视觉 API 不可用时回退为"把图落盘到 /tmp/paste/ 并给模型指路"。 2. 假装支持图片 : resolveModel / listModels 声明模型支持图片输入,让 harness 的 selectModel 检查通过—— 即使会话里已经出现过图片,也能自由切换回纯文本模型 , 不会被"此模型不支持图片"挡住。 效果:粘贴图片不再整轮失败;图片在请求前就转成文字(比另调一轮视觉 MCP 更快),且同一张图只转一次、之后所有轮次秒回; 纯文本模型(如 deepseek-v4-flash)与多模态模型之间可以随意切换。 前提 : /.qwen-mm-plugins/config 里配好 DASHSCOPE API KEY (用于把图转成文字)。 没有该配置时会自动回退到"落盘 + 让 agent 调视觉 MCP 工具"的旧方案,不会报错。 兼容性 项 值 :-- :-- dsh 版本 0.1.0-rc.6 (其他版本需自行核对,脚本会自动拦截版本不匹配) 平台 Windows(PowerShell)/ macOS / Linux(bash) 前置 Nod…

View full README on GitHub →
Media / Contentdeepseek-harnessdshdsh-pluginimagevisionagent

Category