linenxi-ctrl/dsh-vision
linenxi-ctrl★ 10JavaScriptLast synced: 2026-08-14
为 DeepSeek Harness 增加外挂识图模型:圆形鲸鱼按钮、发送图片识图自动回传、模型自主截图+识图工具、多协议自动适配、小白一键安装(未装 Node.js 自动下载)
README excerpt
dsh-vision —— DeepSeek Harness 外挂识图模型插件 为 DeepSeek Harness 增加「外挂识图模型」能力:让本来不具备视觉能力的模型,通过一个可自定义地址/密钥/提示词的外部视觉模型来「看懂」图片与屏幕。 功能 1. 网页配置按钮与面板 :页面右下角出现一个DeepSeek 鲸鱼圆形按钮(可拖动),点击即可配置外挂识图模型的 API 地址、密钥、模型名、识图提示词(skill)、代理与超时。 2. 发送图片识图并自动回传 :点鲸鱼按钮打开面板,点「📤 发送图片」选图,插件会先把它发给外挂识图模型,等识别完成后把识别文本 自动作为消息发回当前会话 (无需手动复制粘贴),DeepSeek 基于识别文本作答。 3. 模型自己截图 + 识图 :插件为 agent 注入 screenshot (截屏)与 recognize image (识图)两个工具,并注入提示词,模型可自行「截图 → 识图 → 等待结果」。 4. 自动适配识图 API 协议 :内置 OpenAI Chat Completions、OpenAI Responses、Anthropic Messages、Google Gemini 四种协议,并按 apiBase 自动探测;另有 custom 模板协议适配任意长尾接口。 文件结构 工作原理 识图请求在 host(Node)侧 发起,因此不受浏览器 CORS 限制;图片请求走同源 /api/vision/recognize ,同样无 CORS 问题。 安装 两种方式任选: npm 安装 (标准,推荐)或 手动 / 离线 (下载 zip,无需 pnpm)。 方式一:npm 安装(推荐) 需要系统已装 Node.js 18+ 与 pnpm。 安装后 无需手动改任何配置文件 : package.json 的 dsh.bundle.patch 声明会被 DSH 自动 reconcile 进 profile 的 dsh.profile.bundles , cordis.patch.yml 即成为该 profile 的一个 bundle layer。 方式二:手动 / 离线(无需 pnpm,小白友好) 从 Releases 下载 zip 解压: 1. Windows 双击 install.bat ,macOS/Linux 运行 bash install.sh —— 无需预装 Node.js :脚本检测不到时会自动从国内镜像(npmmirror / 华为云 / 腾讯云)下载免安装版(无需管理员权限); 2. 脚本会自动:复制英文副本、复制进每个 profile 的 node modules 、在 cordis.patch.yml 加 vision 行、创建 agent preset vision (复制随附 standard 并…
View full README on GitHub →Category
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 1,700
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 884
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 405