zcma11/dsh-vision-plugin
zcma11★ 0JavaScript最后同步: 2026-08-15
DeepSeek Harness plugin: upload/paste images; on send transcribe via a vision model (DashScope) or offline Windows OCR. 用deepseek-harness做的,Made with the DeepSeek-harness.
README 摘要
dsh-vision-plugin English documentation: README.en.md DeepSeek Harness 插件:在聊天输入框上传/粘贴图片,发送时用 视觉模型 (百炼 DashScope)或 Windows 离线 OCR 转述图片内容,并把描述注入消息: 安装 或从 GitHub 直接安装: pnpm 9 注意 :若 add 报 ERR PNPM ADDING TO ROOT (workspace root 检查),在命令末尾追加 --workspace-root : git 源插件需要 pnpm 允许构建脚本( prepare ),按 pnpm 打印的提示把包名加入 $DSH HOME/profiles/web/pnpm-workspace.yaml 的 allowBuilds 后重试。 教程 ① 上传 / 粘贴图片 1. 点输入框工具行的 🖼️ (视觉转述)或 📝 (纯 OCR)选一张图片; 或直接 Ctrl+V 粘贴(QQ 截图、系统截图都行,BMP 自动转 PNG)。 2. 图片出现在输入框上方的 预览条 ——缩略图 + 文件名 + 视觉/OCR 徽标 + 红色 × 删除按钮。 也可以点 🗑️ N 一键清空本会话所有待发图片。 3. 在输入框输入文字(可选),然后回车发送。 ② 发送时如何转述 上传方式 转述方式 📝 OCR 按钮 仅 Windows 内置 OCR(离线、不调模型) 🖼️ 按钮 / Ctrl+V 粘贴 仅视觉模型(需先选择模型 + 配置 API Key) - 转述成功 → 消息正常发送,主模型收到的内容以 【解析了提供图片,图片内容是 】 开头,后接你的原文;预览条随后自动清除。 - 转述失败 → 消息 不会 发给主模型,顶部弹出红色 toast,准确区分 「视觉模型调用失败」还是「OCR 识别失败」;预览与图片数据保留,可直接重发。 - 转述进行中 → 预览条顶部显示「⏳ 正在解析图片…」,此期间的新发送会被拦截(防止重复/插队)。 ③ 设置视觉转述模型 打开 设置 → 通用 → 视觉转述模型 ,从下拉框选择支持图片输入的模型(如 dashscope/qwen3.6-plus )。 - 必须选择 :未选择时,🖼️/粘贴 的视觉转述会报「请先在设置中选择视觉转述模型」。 - OCR 模式不依赖模型,无需设置。 前置要求 - 视觉转述 : /.dsh/.credentials.yaml 中配置 DASHSCOPE API KEY (阿里云百炼),并在设置中选择支持图片输入的模型(如 qwen3.6-plus )。 - 纯 OCR :Windows 10+(Windows.Media.Ocr),无需任何配置。 - 平台:Windows(OCR 依赖 PowerShell 5.1 + Wind…
在 GitHub 查看完整 README →分类
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 2,047
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 920
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 457