wangxiang0605qvq/dsh-vision-ocr
wangxiang0605qvq★ 0JavaScript最后同步: 2026-08-14
DSH 图片识别插件:输入框一键选图发送识别请求(需自备支持图像输入的模型与 API Key)
README 摘要
dsh-vision-ocr — 图片识别插件 Image Recognition Plugin DeepSeek Harness(DSH)图片识别插件:在对话输入框左侧添加「识别图片」按钮,选中图片后自动发送识别请求,让模型描述图中物品、场景、颜色及文字内容。 功能 - 输入框识别按钮 :在对话输入框左侧( conversation.input.left 槽位)显示图片图标按钮。 - 多图选择 :点击后弹出文件选择器,支持一次选择多张图片。 - 一键发送 :选中图片后立即通过对话服务的草稿图片管线发送识别请求,消息携带真实的 image parts(需当前模型支持图像输入)。 - 错误提示 :发送失败(如模型不支持图片、无活动会话)时在按钮上方显示错误气泡。 - 纯浏览器实现 :宿主端为空占位,无任何密钥逻辑,全部行为在前端完成。 安装 1. 复制包文件 将本仓库整体复制到 DSH 的 plugins 目录下(按你的部署方式,也可能在 profile 的 node modules 下): 2. 注册插件 在 profile 的补丁配置(例如 /.dsh/profiles/web/cordis.patch.yml )中插入: 3. 重启并刷新 重启 DSH,然后在浏览器中硬刷新(Ctrl+F5)页面。对话输入框左侧会出现图片图标按钮。 使用前提:自行配置支持图像的模型与 API Key 本插件 不附带任何模型或密钥 ,识别请求通过你当前会话已配置的模型发送。使用前请确保满足以下条件,否则发送会被 DSH 拒绝并提示 attachment-error: Model "xxx" does not support image input. : 1. 选择支持图像输入的模型 :在 DSH 的模型设置(Models 设置页)中,为当前会话选择一个支持 image 输入模态的视觉模型,例如: - 智谱 GLM-5V-Turbo 等 GLM-4V/5V 系列 - 其他任何声明支持图像输入的模型(如部分多模态开源/云端模型) 2. 配置该模型的 API Key :通过 DSH 的 credentials 服务(Models 设置页)保存对应提供商的 API Key,或在启动 DSH 的环境变量中导出。 3. 当前会话使用该模型 :识别按钮发送的请求走当前会话的模型选择,请确认会话已切换到视觉模型再使用。 本插件本身不读取、不存储、不传输任何 API Key——密钥仅由 DSH 的凭据体系管理与调用。 说明 - 模型要求 :识别请求通过当前会话的模型发送,需要支持图像输入。若模型不支持图片,发送会被 DSH 拒绝并提示 attachment-error 。 - 依赖 DSH 内置包: @deepseek-ai/dsh-client-runtime 、 @deepseek-ai…
在 GitHub 查看完整 README →分类
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 1,700
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 884
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 405