princefrogdida-ux/dsh-vision-suite

princefrogdida-ux★ 0TypeScriptLast synced: 2026-08-15

Open on GitHub

Windows-first vision suite with image understanding, OCR, screenshot diffing, and multi-provider routing for DeepSeek Harness.

README excerpt

DSH Vision Suite 面向 Windows 的 DeepSeek Harness 视觉能力套件,插件包名为 dsh-vision-workbench 。它在保留官方 deepseek-official 文本路由的同时,为 DeepSeek 增加图片理解、OCR、截图裁剪、像素差异比较、主色提取和安全网页截图能力。 DeepSeek 继续负责推理。只有调用远程视觉工具时,插件才会把用户选定的图片发送给已配置的 OpenAI-compatible 视觉模型。 插件能力 工具 作用 执行位置 vision describe 理解 1~4 张上传图片或工作区图片,支持图片问答、多图比较和结构化截图证据 视觉 Provider vision ocr 识别整张图片或指定区域中的文字,可选择远程视觉模型或本地 Tesseract Provider 或本机 vision crop 按像素坐标裁剪图片,并保存为可继续使用的持久附件 本机 vision compare 比较两张同尺寸截图,返回变化比例和洋红色差异图 本机 vision palette 提取图片中的近似主色 本机 vision browser capture 使用独立的无头 Edge 或 Chrome 截取白名单网页 本机浏览器 插件还提供: - 支持 PNG、JPEG 和 WebP。 - 图片附件使用持久 ID,工具结果可随会话保存和回放。 - 支持一个主视觉 Provider 和最多三个顺序后备 Provider。 - Provider 失败时执行有限回退,并通过冷却机制避免持续请求故障端点。 - 支持图片数量、文件大小、像素数、工作像素、超时和缓存限制。 - API Key 通过 Harness Credentials 保存,不写入插件配置、日志或页面响应。 - 可为插件请求单独配置 HTTP/HTTPS 代理,不修改全局网络设置。 - Sharp、Tesseract.js 和浏览器能力均按需加载。 配置入口 插件安装后默认保持关闭,不会自动接管模型路由,也不会自动发送图片。 推荐使用 DeepSeek Harness 原生配置页面: 1. 启动安装了本插件的 Web Profile。 2. 打开“设置 → 插件 → 插件配置”。 3. 点击 Vision Workbench 展开全部配置项。 4. 填写文本模型、视觉 Provider 和 API Key。 5. 打开“启用插件”,保存配置。 6. 重启当前 Profile,使路由和工具配置生效。 API Key 密码框为空时会保留已经保存的密钥。页面刷新后不会回显密钥,只会显示对应凭据是否已经配置。 API Key 官方入口 下面这些服务都提供官方 API Key,并有可通过 OpenAI-compatible Chat Completion…

View full README on GitHub →
Media / Contentcomputer-visiondeepseek-harnessdsh-pluginocrwindowsvision

Category