c-ling/dsh-plugin-vision-bridge

c-ling★ 0JavaScript最后同步: 2026-08-17

在 GitHub 打开

DeepSeek Harness 视觉桥接插件:上传/粘贴图片,通过 OpenAI 兼容视觉 API 生成英文描述,再交给纯文本模型。

README 摘要

dsh-plugin-vision-bridge DeepSeek Harness 视觉识别插件:保留原生粘贴 / 拖拽图片体验,发送时先由 OpenAI 兼容视觉 API 生成英文描述,再把纯文本交给 DeepSeek。 English 简介 - 输入框上传按钮 :与原生粘贴 / 拖拽共用同一套草稿缩略图、删除和限额校验。 - 自动看图 :发送图片时,宿主先把图片保存为 durable attachment,再调用 OpenAI 兼容视觉 API( POST {baseUrl}/chat/completions )生成英文描述。 - 可回溯历史 :每次发送追加一个 vision/image 图片展示事件 + 一条插件上下文 描述消息;最终用户消息保持纯文本,DeepSeek 只看到文字描述。 - describe image 工具 :模型可以主动重新观察已上传图片,不传 imageId / imageIds 时查看最近一张;多图时插件上下文会给出 attachmentId, 同时也接受文件名、draftId 或 1-based 图片序号。可通过 imageIds 数组在一次 调用中同时传入多张图片,让视觉模型一起理解、对比或推理。可传可选 prompt 参数临时覆盖默认描述提示词,让视觉模型按需提取指定信息(例如“读取图中的报错 信息”“图中按钮是什么颜色”);不传则使用设置页配置的默认提示词。 - 设置页 :Base URL、模型、只写 API Key、描述提示词模板、超时与图片限制; 支持在设置中直接“查看日志”以排查视觉 API 调用报错; 中英文界面随 Settings → General → Language 实时切换,明暗主题使用 --dsw-alias- token。 视觉 API 失败时发送失败并恢复输入框草稿,不静默降级。 安装 从 GitHub 安装到 web profile(需要 pnpm 在 PATH 上;没有则用下面的 corepack 方式): 或使用已有的 dsh 命令: pnpm 不在 PATH 上时: dsh plugin 把参数原样转发给 pnpm,直接从本仓库拉取包(pnpm 9+,本机需装有 git )。 安装时若看到 declares no dsh.bundle — installed as a plain dependency 的提示属正常现象: 本插件不是 profile bundle 层,而是通过下面的 loader 行激活。 然后在 /.dsh/profiles/web/cordis.patch.yml 增加一行插入: 重启 dsh web (client-modules 按进程缓存包裁决,新包必须重启宿主),然后硬刷新页面。 在会话输入框左侧会出现图片上传按钮;设置页中出现「视觉识别」。 本地开发可直接安…

在 GitHub 查看完整 README →
内容/媒体agentaiattachmentchatcordisdeepseekdeepseek-aideepseek-harness

分类