DDDFXYqiming/dsh-vision-skill

DDDFXYqiming★ 1JavaScript最后同步: 2026-08-16

在 GitHub 打开

Vision skill plugin for DeepSeek Harness (image analysis and OCR)

README 摘要

dsh-plugins / dsh-vision-skill DeepSeek Harness(DSH)标准插件版识图技能 —— 把本仓库 General skills/vision-skill (源自 Qwen 官方动态分辨率方法)包装成 DSH 原生插件。 零框架补丁:插件本身只使用官方扩展接缝( ctx.skills.register / ctx.tools.register / ctx.credentials / ctx.sessions / ctx.webServer / client 注入),可随 DSH 版本升级。 v0.4 起直接贴图走 paste-to-path,不再需要 pi-ai 补丁 ;旧补丁只作为兼容保留,并附带还原脚本。 能力一览(8 工具 + 1 运行时 skill) 名称 说明 vision (运行时 skill) 模型按需加载的识图指令;加载后自动激活下列工具(渐进式暴露) vision analyze 识别本地图片(6 模式:general/ocr/table/code/error/ evidence 结构化证据 + budget 含 mega 超高清 16M 像素) vision ocr 独立 OCR:提取全部可见文字,保持原始排版 vision ground 定位目标(如「微信图标」),返回像素坐标框 + 归一化坐标 vision detect 枚举一类元素(默认所有 UI 元素),编号 + 像素坐标框 vision dominant colors 主色分析(本地像素算法,无需视觉 API) vision long screenshot ocr 超长截图分块 OCR:切块(带重叠)→ 本地 tesseract 优先 → VLM 兜底 → 合并全文 vision clipboard 剪贴板图片兜底识别(paste-to-path 失败/特殊场景的手动通道) vision activate 渐进式暴露兜底:skill 加载后工具未自动出现时调用一次 工程化特性 - 渐进式工具暴露 :全局只挂 1 个轻量激活工具,完整工具集在 skill 加载成功后按 Agent 挂载(省上下文); progressive: false 可回退为全局注册。 - paste-to-path 直贴(v0.4.2 起输入框显示 📎 chip) :client 插件在 capture 阶段截获粘贴图片,用 input.insertReference 插入图片 chip;发送时 codec.serialize 才同源 POST 到 /dsh-vision-skill/paste 、落盘工作区 .dsh-vision/pasted/ ,并把路径文本交给模型。消息里没有 image 块,因此 DSH 不再报 MODEL DOES NOT SUPPORT…

在 GitHub 查看完整 README →
内容/媒体agent-skillsdeepseek-harnessdshdsh-pluginimageocrvision

分类