wang-bool/visual-review

wang-bool★ 2JavaScriptLast synced: 2026-08-18

Open on GitHub

dsh 插件,可以支持图像上传,图像识别。将ds的使用体验变为多模态

README excerpt

中文 English visual-review 为 DeepSeek Harness(DSH)Web 界面打造的 双面插件 :让聊天界面直接 显示图片 ,并让模型 解读图片 。 - 图片显示 :用户粘贴 / 上传的图片(PNG / JPEG / WebP / GIF)会直接渲染在对话气泡里。 - 视觉解读 : visual review 工具调用视觉多模态模型,返回图片的中文文字描述(文字、物体、人物、场景、图表等)。 - 双引擎 :云端优先(任意 OpenAI 兼容的多模态 chat/completions API,零本地依赖);未配置时自动回退本机 Qwen3-VL-8B(数据不出本机)。 - 无需更换模型 :插件在发送路径上把「图片块」转换成「带附件 ID 的文本注解」,任何本身看不到图片的文本模型都能配合工作。 目录 - 功能特性 - 架构与工作原理 - 目录结构 - 环境要求 - 安装 - 配置 - 使用 - 安全说明 - 开发与测试 - 常见问题(FAQ) - License 功能特性 能力 说明 聊天界面渲染图片 客户端插件注入 conversation.chat.node 渲染槽,把图片块渲染为 (经 /vr-image 路由取字节) 模型“看见”图片 /api/session.prompt 拦截 + agent/pre-step 兜底:图片块 → 注解文本,附带附件 ID,提示模型调用工具 图片解读工具 visual review :传 attachment id (会话图片)或 image path (本地文件)即可分析 云端引擎 OpenAI 兼容 chat/completions ,图片以 data: URL 内联发送,支持 content / reasoning content 返回 本机引擎 内置 JSON-lines worker,加载本地 Qwen3-VL-8B 推理,图片与结果均不出本机 配置工具 visual review config :查看 / 更新云端 url / api key / model ,一键切换引擎 架构与工作原理 三个关键机制: 1. 发送拦截(图片 → 注解) 。客户端发送 session.prompt 时,插件拦截请求,把内容中的 image 块交给附件服务保存,得到附件 ID(形如 sha256:xxx ),再替换成一段文本注解: agent/pre-step 钩子对模型侧消息做同样的转换,作为兜底且幂等。于是 文本模型也能“看见”图片 ——它只需按注解调用工具。 2. /vr-image 路由(字节 → 渲染) 。客户端渲染槽把注解里的附件 ID 提取出来,渲染为 " ;Host 端从附件存储读回图片字节返回。该路由 仅接受回环地址 (127.0.0.1 / ::1)的请求。 3. visua…

View full README on GitHub →
Media / Contentdeepseek-harnessdshdsh-plugindsh-pluginsdsh-skilldsh-skillsimage-analysisimage-recognition

Category