nyantused-cpun/gewu-tools
nyantused-cpun★ 0JavaScript最后同步: 2026-08-16
格物审视面:让 DSH 无视觉模型经视觉子代理完成视觉检验。Model-agnostic visual-inspection pipeline: HTML screenshots + vision-subagent briefing + source-code truth verification.
README 摘要
格物 gewu-tools 格物审视面 :让 DSH 中无视觉能力的模型,通过视觉子代理完成需要「亲眼检查」的任务。 格物:《大学》「格物致知,考察事物而后知」——先把东西看仔细,再下结论。 English: README.en.md 它解决什么问题 DSH 的会话主脑通常是 纯文本模型 ——它读不了渲染出来的页面,自然回答不了「这页方案好不好看、挤不挤、图连对没有」。视觉子代理(如 subagent vision ,mimo-v2.5 等)看得见,但有两个短板: 1. 没有会话上下文 :它不知道客户铁律、业务标记语义(比如 ⭐ 是「核心能力」不是装饰 emoji),会把有意设计误报成缺陷; 2. 会看错 :OCR 级误读(字认错)、页码归属被截图边界带偏。 格物把 2026-08-16 在 24 页售前方案上实测收敛的 三步流水线 做成两个工具: 实测收益:误报率显著下降(简报提供上下文)、关键数字零差错上会(源码核验)、整稿叙事线/密度/跨页一致性可审(子代理多图能力)。 模型无关性声明 本插件在视觉子代理 mimo-v2.5(稳) 与 qwen3.7-plus(洞察强、误报略多) 上实测验证。实测结论: 模型档位不决定审阅结果的可信度 —— - 简报契约(上下文) 消除无上下文误报:例如把业务标记 ⭐(核心能力)误判为装饰 emoji,实测在无简报的插件模式下系统性发生; - 真值核验闭环(gewu locate) 把 OCR 误读与页码偏移挡在采信之外:实测 qwen3.7-plus 的 3 个核心新论断中 2.5 个经不起源码核验,全部被核验环节拦截。 档位差异只体现在 审阅风格 (高挡洞察更锐、稳挡结论更保守),不体现在结果对错上。无论接入何种档位的视觉模型,本流水线产出均可信、可审计——这也是格物把「核验」固化为流水线第三步的原因。 安装 前置:Windows + Chrome/Edge + Node 24+(仅脚本验证用)。 方式一:社区通道 (若已接入 awesome-dsh-plugins 生态) 方式二:独立脚本 (推荐,随项目分发) 安装脚本做的事:在 DSH 的 agent preset(默认 pre-sales,可用环境变量 GEWU PRESET 覆盖)里追加 gewu-tools 挂载行,指向 \.dsh\gewu-tools (安装位,项目目录的 Junction)。 安装后必须重启 DSH 会话 (host 插件无热更新)。验证: install-gewu-plugins.ps1 -Verify 应三绿(preset 挂载行 / junction 链 / import 加载)。 使用(主代理视角) gewu prep 参数 参数 说明 html path 方案 HTML 路径(必填) client / background…
在 GitHub 查看完整 README →分类
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 2,346
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 946
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 517