xing666173/dsh-vision-hub

xing666173★ 3JavaScript最后同步: 2026-08-21

在 GitHub 打开

DeepSeek Harness EAC 视觉全家桶:15 个像素级视觉工具(增强版 dsh-tool-vision)+ 桥接内联预览 + 拖拽文件上传,单端点驱动,对话干净,EAC 原生设置适配

README 摘要

👁️ dsh-vision-hub — 给 DeepSeek Harness EAC 装上眼睛的视觉全家桶 一个仓库,三件利器 :像素级视觉工具 × 桥接内联预览 × 拖拽文件上传。 让纯文本的 DeepSeek 主模型真正"看得见"——图片进得来、看得懂、用得好。 纯文本模型(如 deepseek-v4-flash)天生看不见图。EAC 的请求管道又严格要求 "请求必须从会话日志推导",塞一张图进去,整个回合直接报错。dsh-vision-hub 用一套优雅的组合拳解决这件事: 桥接 → 下沉 → 工具化 ,图片被无声地 "翻译"成模型能读的线索,再交给视觉模型逐像素看个明白。 🧩 三大组件 1️⃣ tool-vision/ — 像素级视觉工具箱(增强版 dsh-tool-vision 0.4.0) 一个 OpenAI 兼容端点,驱动 15 个视觉工具 ——不搞模型路由、不搞降级链、 不搞独立设置页,你的 GLM 配置就是全部: 工具 一句话 inspect image 看图问答的基础款, [图片: 路径] 标记的官方搭档 vision describe 看图问答 / 多图对比,可要结构化 JSON vision ground 像素级定位:告诉我"那个按钮"的精确坐标 vision detect 把图里的元素全部点名:按钮、输入框、图标…带编号 vision crop 按原图像素裁剪放大,细节看不清楚?裁出来看 vision pixel diff 逐像素对比两张图,差异比例 + 热图 + 最差区域 vision colors 主色提取,给"照着图还原 UI"提供调色板 vision ocr 图片文字转写,专注文字,不编造 vision long screenshot ocr 长截图分块转写,聊天记录/长文档一键变 Markdown vision trace 图标/Logo 矢量化,输出真彩色 SVG vision extract foreground 纯色背景抠图,一秒出透明 PNG vision html screenshot 本地 HTML 无头渲染截图(禁网,安全) vision screenshot 桌面截屏,还能顺带识别屏幕内容 vision present 把生成/导出的图片正式展示给用户 vision materialize 附件落盘成真实文件路径 增强版相对上游的诚意 (详见 docs/ENHANCEMENTS.md ): - ✨ 对话干净 :桥接标记从一大段指令瘦身为 [图片: 路径] ,使用规则下沉到 系统提示层,模型照读、界面不脏; - 🛡️ 内容安全识别 :图片被端点安全策略拒绝时返回明确的 VISION CONTENT FILTERED ,告诉你"换张图",而不是一脸茫然; - 🔁 限流自动重试 :免费端点 429/5xx…

在 GitHub 查看完整 README →
内容/媒体ai-toolsdeepseek-harnessdsh-pluginllmocrvision

分类