DreamRift/dsh-vision-bridge

DreamRift★ 0JavaScript最后同步: 2026-08-18

在 GitHub 打开

DeepSeek Harness 多模态视觉桥(dsh-vision-bridge):贴图经 llm/stream 自动转 VL 文字描述(解决 UNSUPPORTED_CONTENT)+ view_image/ocr_image 主动视觉工具 + 原生多模态路由自动跳过(rc.7);零依赖。Vision bridge for text-only DeepSeek models.

README 摘要

DeepSeek 多模态视觉桥(dsh-vision-bridge) dsh-vision-bridge 是 DeepSeek Harness(DSH)的多模态视觉插件。DeepSeek 官方接口是纯文本的: 在 Web UI 贴图后, dsh-llm-deepseek 适配器会因消息中的图片内容块直接抛 UNSUPPORTED CONTENT 。 本插件借鉴 Qwen-MM-Plugins 的思路(VL 描述注入 + 主动视觉工具),以 DSH 原生插件实现「让纯文本的 DeepSeek 模型看见图片」: - 贴图自动代理 :拦截 llm/stream 请求,把消息中的 ImageBlock 交给 OpenAI 兼容的视觉模型 (默认 DashScope qwen-vl-max )生成结构化中文描述(含图中文字逐字转录),替换为文本块后放行。 同图跨轮次缓存、描述文本稳定(保 KV cache 前缀);VL 失败进入失败冷却并降级为占位文本, 不阻塞会话;会话标题请求自动跳过视觉解析。 - 主动视觉工具 :注册 view image (查看本地图片 / 按问题回答)与 ocr image (逐字转录), 模型可主动查看文件系统中的截图、设计稿、图表。 - 设置页卡片 (v0.2.0 起):设置 → 插件 → 插件配置 → 「视觉模型」,可修改端点(来源)/ 模型 / OCR 模型并保存, 热更新生效 (无需重启);密钥与 harness 官方一致——write-only 不回显明文, 只显示「已配置 / 未配置」徽标,留空保持。 - 模型能力桥接 (v0.4.0 重构):运行时探测原生多模态路由并自动跳过视觉桥。 DSH rc.7 起官方 llm-pi-ai 适配器(pi-ai 库) 原生支持图片 ,本插件在请求到达时 经 ctx.llm.resolveModelInfo() 查询 inputModalities ,含 image 即直通(不调 VL、 不改写消息),让 pi-ai 原生多模态链路零开销工作;text-only 路由( deepseek-official ) 仍走 VL 代理。旧版「给 pi-ai 模型补 image 声明」行为已移除(rc.7 中既有害又无必要)。 零硬 npm 依赖( dsh-settings / schemastery / dsh-tools 动态 import,缺包仅降级对应功能)、 不改 DSH 核心源码、不写会话事件,Windows / Linux / macOS 原生可用(无 Python / uvx / WSL 要求)。 - 设计依据与决策记录: DeepSeek多模态视觉桥-开发计划.md - 挂载与配置: docs/挂载指南.md - Qwen-MM-Plugins 调研: docs/Qwen-MM-Pl…

在 GitHub 查看完整 README →
内容/媒体dashscopedeepseek-harnessdshdsh-pluginllmmultimodalocrqwen-vl

分类