wangxiang0605qvq/dsh-vision-ocr

wangxiang0605qvq★ 0JavaScript最后同步: 2026-08-14

在 GitHub 打开

DSH 图片识别插件:输入框一键选图发送识别请求(需自备支持图像输入的模型与 API Key)

README 摘要

dsh-vision-ocr — 图片识别插件 Image Recognition Plugin DeepSeek Harness(DSH)图片识别插件:在对话输入框左侧添加「识别图片」按钮,选中图片后自动发送识别请求,让模型描述图中物品、场景、颜色及文字内容。 功能 - 输入框识别按钮 :在对话输入框左侧( conversation.input.left 槽位)显示图片图标按钮。 - 多图选择 :点击后弹出文件选择器,支持一次选择多张图片。 - 一键发送 :选中图片后立即通过对话服务的草稿图片管线发送识别请求,消息携带真实的 image parts(需当前模型支持图像输入)。 - 错误提示 :发送失败(如模型不支持图片、无活动会话)时在按钮上方显示错误气泡。 - 纯浏览器实现 :宿主端为空占位,无任何密钥逻辑,全部行为在前端完成。 安装 1. 复制包文件 将本仓库整体复制到 DSH 的 plugins 目录下(按你的部署方式,也可能在 profile 的 node modules 下): 2. 注册插件 在 profile 的补丁配置(例如 /.dsh/profiles/web/cordis.patch.yml )中插入: 3. 重启并刷新 重启 DSH,然后在浏览器中硬刷新(Ctrl+F5)页面。对话输入框左侧会出现图片图标按钮。 使用前提:自行配置支持图像的模型与 API Key 本插件 不附带任何模型或密钥 ,识别请求通过你当前会话已配置的模型发送。使用前请确保满足以下条件,否则发送会被 DSH 拒绝并提示 attachment-error: Model "xxx" does not support image input. : 1. 选择支持图像输入的模型 :在 DSH 的模型设置(Models 设置页)中,为当前会话选择一个支持 image 输入模态的视觉模型,例如: - 智谱 GLM-5V-Turbo 等 GLM-4V/5V 系列 - 其他任何声明支持图像输入的模型(如部分多模态开源/云端模型) 2. 配置该模型的 API Key :通过 DSH 的 credentials 服务(Models 设置页)保存对应提供商的 API Key,或在启动 DSH 的环境变量中导出。 3. 当前会话使用该模型 :识别按钮发送的请求走当前会话的模型选择,请确认会话已切换到视觉模型再使用。 本插件本身不读取、不存储、不传输任何 API Key——密钥仅由 DSH 的凭据体系管理与调用。 说明 - 模型要求 :识别请求通过当前会话的模型发送,需要支持图像输入。若模型不支持图片,发送会被 DSH 拒绝并提示 attachment-error 。 - 依赖 DSH 内置包: @deepseek-ai/dsh-client-runtime 、 @deepseek-ai…

在 GitHub 查看完整 README →
内容/媒体dsh-pluginocrvision

分类