WEIHAOLEE/dsh-plugin-vision-fallback
WEIHAOLEE★ 0JavaScript最后同步: 2026-08-17
DeepSeek HARNESS 视觉代理插件
README 摘要
dsh-vision-fallback(视觉代理) 给 DeepSeek Harness(DSH)的 text-only 会话加一个「视觉代理」开关: - 文本请求完全不干预 —— 原样走你原来选的模型(哪个都行,Flash/Pro/其他) - 含图请求自动转发 —— 直接把你当前消息里的图片 + 这句话发给视觉模型(OpenAI 兼容,默认火山方舟豆包),不带任何历史上下文 - 开关式使用 —— 输入框旁一个「视觉代理」开关,点开即用,点关恢复原状 - 多视觉服务商 —— 设置页「Vision 模型」里可增删服务商、设默认、测试连接,热生效 ⚠️ 诚实声明(请先读) 这个插件是作者用 deepseek-v4-pro 通过 vibe coding (人机来回试错式开发)写出来的。 作者并不是 DSH 的开发者,对 DSH 内部机制的理解大量来自读源码 + 踩坑 + 猜, 不保证正确、不保证稳定,有 bug 是常态 。它目前只在一个人的 Windows 机器上、 配合 deepseek-v4-pro + 火山方舟豆包跑通过。请自行评估、自行修改,出问题别指望作者。 具体的不确定点和已知坑见文末 不确定与已知问题。 工作原理 开关的本质是:开启时把会话的模型切到本插件注册的 vision-fallback 路由 (因为 DSH 的 read image 要求当前路由声明图片输入,纯文本模型过不了这个门槛), 同时记住你原来的模型;关闭时恢复。所以开启后模型选择器里会显示「视觉代理」, 这是机制使然,不代表你的文本模型变了。 目录结构 安装 坑: dsh plugin add 会以 link: 方式把插件链入 profile,Node 解析插件内部 import 时 会还原到真实路径,所以 插件目录里必须有自己的 node modules (上面第 3 步)。 另外 package.json 的 exports 里 必须保留 "./package.json" 条目 , 否则 client-modules 扫描会报 ERR PACKAGE PATH NOT EXPORTED 并永久缓存“不是客户端包”。 配置 热生效于 %DSH HOME%\settings.yaml 的 llm-vision-fallback: 段: - API Key 通过 DSH 凭据服务写入(设置页/凭据入口), 本仓库不含任何密钥 - 想加服务商(硅基流动 / 百炼千问 / GLM / OpenRouter / 本地 vLLM…):只要 OpenAI 兼容即可 使用 1. 会话里选好你的文本模型(任意) 2. 点输入框旁的「 视觉代理 」开关(变蓝,显示「视觉代理 · 你的模型名」) 3. 正常聊天 = 你的模型;让 agent 看某张图( read image )= 自动转发视觉服务商 …
在 GitHub 查看完整 README →分类
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 2,376
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 947
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 532