342949145/dsh-vision-bridge
342949145★ 1JavaScriptLast synced: 2026-08-16
DSH 识图桥接插件:让 DeepSeek 等纯文本模型会话也能发送图片,图片自动经视觉模型识图转文字(识图桥接,read_image 工具兼容)
README excerpt
dsh-vision-bridge GitHub : https://github.com/342949145/dsh-vision-bridge · License: MIT 适用范围 :本插件只服务 网页版 DSH ( /.dsh ,如 profiles/web/ )。 桌面版 Deepseek Harness EAC (当前 DeepSeek 会话所在形态)由内置插件 dsh-tool-vision 接管识图,配置在 %DSH HOME%\settings.yaml 的 tool-vision 命名空间(当前模型 qwen3.7-plus / 阿里云百炼),无需安装本插件;两套配置互不相通,排查识图问题时先确认 DSH 形态。 让 DeepSeek 等纯文本模型 的 DSH 会话也能正常发送图片:图片在进入模型之前自动交给外部视觉模型(阿里云百炼 qwen-vl)识别,识别结果以文字形式喂给当前模型。 无需切换模型、无需手动运行任何命令。 解决的问题 DSH 将 DeepSeek 系列模型的输入能力声明为仅文本( inputModalities: ["text"] ),因此: - 发送带图片的消息会被拒绝: “当前模型不支持图片,请切换支持图片的模型” (错误码 MODEL DOES NOT SUPPORT IMAGES ); - read image 工具同样被模型能力检查拦截; - 即使放行,DeepSeek API 本身也不接收图片。 本插件从两个层面解决: 1. 放行 :包装 ctx.llm.resolveModelInfo ,对目标 provider(默认 deepseek )的模型补充声明 image 输入能力,使所有模型能力检查通过; 2. 转译 :包装目标 provider 适配器的 stream 方法,在消息进入序列化之前把 image 块逐个取出,调用百炼视觉 API 识图,替换为文字块——模型最终收到的始终是纯文本。 纯服务端插件,GUI 无需任何改动。不修改会话记录,不拦截原生支持图片的模型(如 pi-ai)。 安装 方式一:npm 安装(推荐,桌面版插件市场同款) 然后在 DSH profile(如 /.dsh/profiles/web/ )中启用: 或把 dsh-vision-bridge 加入 package.json 的 dsh.profile.bundles 列表。 方式二:本地开发挂载(link) 配置 配置优先级: 环境变量 插件目录 .env VISION SKILL DIR 指向目录的 .env / vision.js 。 变量 必填 默认 说明 DASHSCOPE API KEY ✅ — 阿里云百炼 API Key(申请) DASHSCOPE BASE URL https://dashscope.aliyun…
View full README on GitHub →Category
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 2,208
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 933
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 488