lcb522/dsh-plugin-vision-bridge
lcb522★ 0JavaScriptLast synced: 2026-08-16
DSH plugin: let text-only model sessions see images via a vision-model bridge (chat uploads + read_image)
README excerpt
dsh-plugin-vision-bridge 让 纯文本模型会话 也能"看图",覆盖两条路径: 1. 聊天框发图/贴图 :上传预检会以"当前模型不支持图片"拒绝纯文本模型——插件拦截 session.prompt RPC,被拒绝时自动把图片交给配置的视觉模型(默认 zai/glm-4.6v ) 识别,用文字描述替换图片后重新提交。会话历史中只有文字,没有图片块。 2. read image 工具 :模型调用 read image 读工作区图片文件时,同样转由视觉模型 识别,返回文字描述。 两种情况下,会话本身继续使用你选定的文本模型(如 glm-5.2 / deepseek)。 行为 - 会话模型 不支持 图像(glm-5.2、deepseek 系列)→ 上述两条路径都走视觉桥。 - 会话模型 支持 图像(如你把会话切到 GLM-4.6V 本身)→ 原生直通,桥完全不介入 (聊天发图先原样提交,只有被拒才桥接,零额外开销)。 - 视觉调用失败(配额、网络)→ 返回明确的错误信息,不静默丢图。 配置(profile 的 cordis.patch.yml 中挂载行) 字段 默认 说明 provider zai 视觉模型所在 provider 路由(settings.yaml 里配置的) model glm-4.6v 视觉模型 id(必须在该 provider 的 models 列表中声明) system 见代码 视觉调用的系统提示词(如何描述图片) userText 见代码 视觉调用的用户侧指令 maxTokens 16384 视觉调用输出上限 timeoutMs 180000 视觉调用软超时 redirectReadImage true 是否拦截 read image 工具调用 redirectChatUploads true 是否桥接聊天框图片上传 更换视觉模型 编辑 /.dsh/profiles/web/cordis.patch.yml 中 vision-bridge 行的 provider / model , 重启 harness 即可。模型需在 /.dsh/settings.yaml 的 llm-pi-ai.providers. .models 中声明(含 input: [text, image] )。 前提 /.dsh/settings.yaml 中对应 provider 的 models 列表必须包含视觉模型,例如: 注意: models 列表会 整体替换 该 provider 的内置目录,原有条目要以裸 id 形式保留。 安装与使用 1. 获取源码 2. 复制到运行时位置 运行时位置 /.dsh/profiles/node modules/dsh-plugin-vision-bridge/ 是共享回退层, 所有 profile 都能解析。依赖…
View full README on GitHub →