jypjypjypjyp/dsh-vqa-agent
jypjypjypjyp★ 1JavaScript最后同步: 2026-08-14
DSH 插件:vqa_ask 双模型视觉问答 —— 主模型提问 → 视觉模型看图回答,UI 实时展示 QA 过程,支持多模态视觉模型选择
README 摘要
dsh-vqa-agent DSH Web 插件(官方 bundle 形态):主模型调用 vqa ask 向 视觉模型 提问,图片字节真实送达视觉模型,UI 实时展示「主模型提问 → 视觉模型回答」的 QA 过程;主设置提供多模态视觉模型选择页。 结构 构建 安装到 DSH Web profile 1. 在 /Users/a1234/.dsh/profiles/web/package.json : - dependencies 增加 "dsh-vqa-agent": "file: " - dsh.profile.bundles 增加 "dsh-vqa-agent" 2. 在 profile 目录执行 pnpm install (或 pnpm add dsh-vqa-agent@file: )。 3. 重启 web 服务并刷新页面。 也可以把本仓库推到 GitHub/GitLab 后用 git 依赖(参考 whale-girl 的 github:vlln/whale-girl main )。 通信契约 - Node ↔ 浏览器: webServer 路由(全部 POST JSON): - /dsh-vqa-agent/exchange {callId} — 单次问答快照(轮询,流式) - /dsh-vqa-agent/image {convKey} — 图片 dataURL(每会话拉一次) - /dsh-vqa-agent/transcript {} — 全部会话 QA 记录 - /dsh-vqa-agent/settings {} — 当前选择 + 多模态模型列表 - /dsh-vqa-agent/set-model {provider, model} — 设置页选择视觉模型 - 浏览器 half 由 ModuleLoader .load({id, factory}) 挂载, React 经种子词 require("react") 解析(esbuild --external:react ),样式直接注入 DOM。 功能 - 工具 vqa ask(image, question, model?, provider?, maxTokens?) :读文件 → 魔数嗅探真实格式(PNG/JPEG/WebP/GIF,不信扩展名)→ attachments 生成引用 → 图片发给视觉模型 → 流式回答;同图追问自动带上下文。 - 工具卡片( tool.call.toolview key vqa ask ):主模型提问气泡 + 视觉模型回答气泡 + 缩略图 + 状态徽标(固定深色底,明暗主题均清晰)。 - Run 面板( tool.view.cordis key self ):「双模型 QA 过程」总览。 - 设置页( settings.section id vqa-vi…
在 GitHub 查看完整 README →分类
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 1,123
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 794
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 298