moon09300731/dsh-vision-tools

moon09300731★ 0JavaScriptLast synced: 2026-08-14

Open on GitHub

DeepSeek Harness 视觉能力全家桶:vision_understand 工具 + 粘贴/拖拽/按钮三入口识图

README excerpt

dsh-vision-tools DeepSeek Harness(DSH)视觉能力全家桶 —— 让 DeepSeek 纯文本模型"看得见"。 - vision understand 工具 :调用 OpenAI 兼容视觉大模型 API 理解本地图片(描述画面、识别文字、回答问题),注册为全局工具,所有会话可用。 - 三入口识图 : Cmd/Ctrl+V 粘贴截图、拖图到按钮、点按钮选文件 → 图片自动落盘到 $DSH HOME/pasted-images/ → 输入框填入 请识别这张图片: → 发送后模型自动调用识图工具。 默认使用 智谱 GLM-4V-Flash(免费) ,支持 4 家 provider 切换。 安装 重启 dsh web 后生效。 配置(vision understand 工具需要) 创建 /.dsh/vision.env (全局生效,推荐): 可选覆盖: provider 默认模型 说明 zhipu glm-4v-flash 智谱,免费 dashscope qwen-vl-plus 阿里百炼 siliconflow Qwen/Qwen2.5-VL-7B-Instruct 硅基流动 openai gpt-4o-mini OpenAI 工作区回退:在项目目录放 .dsh-vision.env (同格式),仅该项目生效。配置每次调用实时读取,改完无需重启。 使用 1. 粘贴 :直接 Cmd/Ctrl+V 粘贴剪贴板截图(捕获阶段拦截,优先于 GUI 自身附件处理) 2. 拖拽 :拖图片到输入框左侧的「📷 识图」按钮 3. 选择 :点「📷 识图」按钮选文件 发送后 agent 会自动调用 vision understand 识别图片。 安全边界 - 图片会 经外部视觉 API 出网 (base64 传输),敏感数据请改用本地 OCR(tesseract/paddleocr),或自建内网视觉服务用 VISION BASE URL 指向 - vision.env 含 API Key, 不要提交到 git (本仓库 .gitignore 已忽略) - 粘贴路由仅监听 DSH 本机端口,图片保存于 $DSH HOME/pasted-images/ 技术说明 ⚠️ 依赖约定 : @deepseek-ai/dsh-tools 是 DSH 宿主运行时自带(bundle 机制提供),本插件 不声明为 dependencies 。若声明, dsh plugin add 触发 npm install 会在 profile 里装出第二份 dsh-tools,与宿主全局那份形成 模块双实例 ,导致工具执行层 scheduler.prepare 崩溃( Cannot read properties of undefined (reading 'prepare') )…

View full README on GitHub →
Media / Contentdeepseek-harnessdsh-pluginvision

Category