Renji004/dsh-omni-vision

Renji004★ 0JavaScript最后同步: 2026-08-18

在 GitHub 打开

Local eyes for text-only DSH models: render/paste/OCR/analyze images

README 摘要

dsh-omni-vision 本插件全由 DeepSeek v4 Flash( deepseek-v4-flash )编写。 让 Agent 自己"看见"文字与图形的 DSH 插件,全程本地、不依赖视觉模型: - eyes render — 在 Web GUI 对话流里渲染画布(文字、线条、矩形、圆形、椭圆),PNG 落盘到工作区 renders/ (读完即焚),并 一式两份 另存永久副本到 pics/ 。 - eyes paste — 让用户把剪贴板图片(截图/照片)直接 Ctrl+V 粘贴或拖进页面:浏览器捕获图片、归一化为 PNG 存到工作区,供本地 OCR/像素分析读取。只写 renders/ (读完即焚, 不留 pics/ 永久副本)。 全本地读图路径 (不限流、离线),独立于 DSH 原生发图链路(DSH 输入框本身支持图片粘贴/拖放,但发图需要选择支持图片的模型,见"限制")。 - eyes ocr — 用 Windows 自带 OCR( Windows.Media.Ocr ,完全离线)把 PNG 里的文字读回成文本。 这是 Agent "看见文字"的途径 :DeepSeek 是纯文本模型,但识别出的文本可以原样喂回给模型引用。 - eyes analyze — 把 PNG 解码成像素数据(N×N 颜色网格、主色占比、内容包围盒)。 这是 Agent "看见图形/颜色"的途径 :无需视觉模型,图形以结构化数据呈现。 全程本地闭环:浏览器 canvas → 本机 HTTP → 本机磁盘 → Windows OCR / 像素分析。 所有下载均按需、不盲目下载 (详见"下载策略");出网环节仅限:模型推理本身,以及(可选)首次渲染 Mermaid 图且本地无副本时按需获取一次 Mermaid 库。 平台要求 仅支持 Windows。 eyes ocr 通过 PowerShell 调用 Windows 自带 OCR 引擎( Windows.Media.Ocr ,完全离线); eyes render / eyes paste / eyes analyze 本身不依赖 Windows 特性,但整个插件在非 Windows 上无法提供"读字"能力,按 Windows 平台维护。 下载策略:全部按需,不盲目下载 安装与启动阶段零下载;所有获取均按需发生: - 插件本体 :本地 link: / file: 安装,无任何下载。 - Mermaid 库 :唯一可能发生的运行时下载——仅在 首次实际渲染 Mermaid 图 且本地无副本时,浏览器按需从 CDN 获取一次(成功后缓存);不渲染 Mermaid 就完全不会下载。 - 其余全部本地 :渲染、OCR、像素分析、图片接收,均不产生任何网络下载。 工作原理 - 图片能力探测 + 降级 :执行时探测当前模型路由是…

在 GitHub 查看完整 README →
内容/媒体dsh-pluginocragentvision

分类