lium970320/dsh-vision-bridge
lium970320★ 2JavaScriptLast synced: 2026-08-14
DSH 视觉桥接插件:让无视觉能力的主模型看图(会话收图 + 自动转文字 + view_image 工具)
README excerpt
dsh-vision-bridge · DSH 视觉桥接 DSH 插件 :本仓库已打上 dsh-plugin 标签,可在 DeepSeek Harness 官方插件发现页被检索到。 让 DeepSeek Harness(DSH) 里没有视觉能力的主模型(如 deepseek-v4-pro)能够"看图": 1. 会话直接收图 :用户在会话里发送图片不再被"模型不支持图片"拦截; 2. 消息保留图片 :用户消息框显示图片缩略图,转换不在用户消息上发生; 3. 内部自动转文字 :图片在模型请求组装层被自动交给视觉模型转成文字描述,主模型只收到文字; 4. 自觉看图工具 : view image 工具供模型在需要看图时自行调用(支持本地路径 / URL / data URL)。 项目结构 NPM 包安装 已发布到 npm: @liu min/dsh-vision-bridge ( 0.1.1 ,公开, dsh-plugin 标签) 两种安装方式: - 从 npm 拉取 (DSH 生态原生方式,装完需补打适配器补丁与配置): - 从 GitHub clone + 一键脚本 (最省心,install.ps1 会自动完成复制/登记/声明/打补丁/自测): 无论哪种方式,装完都要 重启 dsh web 并 配置视觉接口 (这是两条总是要做的步骤,见下文)。 快速开始(30 秒) 没装过 DeepSeek Harness?先看官方快速开始: 1. 准备一个视觉接口(网址 + 密钥) ,例如 OpenAI 官方:网址 https://api.openai.com/v1 、模型 gpt-5.1 、密钥环境变量 OPENAI API KEY (先 setx OPENAI API KEY " " ); 2. 运行安装脚本 ,带上接口参数: 没有参数也可以直接运行,脚本会逐步询问网址 / 模型名 / 密钥。 3. 重启 dsh web ,在任意会话里发一张图片——消息框显示图片、模型能读出内容,即安装成功。 详细配置说明见下文"配置视觉接口(必做)"。 前置条件 - DeepSeek Harness 已安装且 dsh web 启动过至少一次( /.dsh/profiles/web/ 存在); - 主模型走 dsh-llm-pi-ai 适配器(settings.yaml 里 llm-pi-ai.providers. 已配置), 或 你愿意手工在 settings 里声明图片输入; - 一个视觉接口(网址 + API 密钥) ——本插件不内置任何服务商,必须显式配置,例如: - OpenAI 官方: https://api.openai.com/v1 + OPENAI API KEY ; - xAI Grok: https://api.x.ai/v1 + XAI API KEY ; - 任…
View full README on GitHub →Category
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 1,700
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 884
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 405