xingling80/dsh-zhipu-vision
xingling80★ 1JavaScript最后同步: 2026-08-15
—
README 摘要
dsh-zhipu-vision — 视觉理解插件(DSH 原生插件) 基于官方 NPM SDK( dsh-tools / dsh-host-webserver / dsh-system-prompt / schemastery )实现的 DSH 原生插件,不修改 DSH 源码。核心体验: 聊天框粘贴图片 → 自动识别 → DeepSeek 回答 (视觉识别由智谱 GLM-4V 负责,回答由 DeepSeek 负责,全程不切换模型)。 界面显示名统一为「视觉」:侧边栏入口、面板标题、设置卡片均显示「视觉」; 包名 / 工具名 / 路由仍为 dsh-zhipu-vision / zhipu vision / /api/dsh-zhipu-vision/ 。 能力 能力 说明 粘贴识图(核心) 聊天框 Ctrl+V 粘贴图片 → 自动保存到 /.dsh/pastes/ → 识别指令插入输入框 (官方 conversation input 通道,立即可见)→ 你继续输入自己的需求 → 一次回车发送 → DeepSeek 调用 zhipu vision 结合图片回答你的需求 视觉侧边栏 侧边栏「视觉」入口 → 面板:粘贴/拖图 + 缩略图 + 需求输入框 + 「发送给 DeepSeek」 (图片+问题一条消息入会话)+ 面板内快速识别 + 已保存图片画廊 + 清空历史 视觉理解工具 zhipu vision :本地图片绝对路径 或 http(s) URL + 提问 → 返回模型回答(图片描述 / OCR / 截图分析 / 图表文档解读) 设置入口 GUI 设置 → 插件 → 插件配置 →「视觉」卡片:API Key(只写不回显)、模型、接口、超时、大小上限、粘贴拦截、自动发送、保留天数 图片保留 默认保留 7 天自动清理( keepPastesDays 可调,0 = 永久);面板可一键清空 零运行时依赖 host 使用 Node ≥22 内置 fetch ;浏览器端仅依赖 React 粘贴识图怎么用(推荐) 1. 复制任意图片(截图用 Win+Shift+S) 2. 在聊天输入框 Ctrl+V 3. 插件自动:保存图片,并在输入框插入「识别这张图片: 」 4. 在它后面输入你的需求 (如:这个报错怎么解决?这段代码有什么问题?) 5. 回车发送 → DeepSeek 调用 zhipu vision 看图并针对你的需求回答 另一条路:侧边栏「视觉」面板 → 粘贴图片 → 输入需求 → 「发送给 DeepSeek」,效果相同。 可关选项(设置卡片): interceptPaste (不拦截粘贴)、 autoSendOnPaste (开启后粘贴即自动发送纯识别消息,不等你输入需求)。 架构 自动发送走官方 sessions driver 通道(与任务看板插件同款 API)…
在 GitHub 查看完整 README →分类
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 2,047
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 920
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 457