DDDFXYqiming/dsh-pseudo-vision

DDDFXYqiming★ 1TypeScript最后同步: 2026-08-21

在 GitHub 打开

Local OCR, color-statistics, pixel-scan, and metadata bridge for text-only DeepSeek Harness models; no external vision API.

README 摘要

简体中文 English dsh-pseudo-vision 给 DeepSeek Harness 的 text-only provider 装上"工具层视觉":把图片在落地到模型前,自动拆解成 OCR 文字 + 颜色统计 + 像素扫描 + 元信息,让任意纯文本模型也能"看图"。 实机验证通过 (dsh 0.1.0-rc.8 / deepseek-v4-flash 实测:模型收到图片后正确读出 OCR 文字、颜色占比、图片尺寸并回答)。 它在做什么 当 deepseek-v4-flash (text-only)收到 read image 失败错误时,可以用 bash + Python 拼出 OCR、像素分析、颜色统计和元信息,再把图片转换为结构化文本。 dsh-pseudo-vision 将这套本地证据链封装为插件能力 : 1. 通过 cordis.patch.yml 接管官方 deepseek-official 路由,保持现有 DeepSeek 行为 2. 按 bridgeProviders 白名单(或显式 bridgeOtherProviders )为其他已注册 provider 生成兄弟路由,例如 dsh-pseudo-vision/kimi-for-coding 、 dsh-pseudo-vision/openrouter 3. 自动标识为识图 :兄弟路由的 resolveModel / listModels 强制声明 inputModalities: ["text", "image"] ,先通过 DSH 的图片 admission 门 4. 请求时伪视觉 :原生视觉模型原样透传;text-only 模型读附件 → 本地 4 工具转文本 → 替换 image block + 注入 ,再委托回原 provider 全程本机执行,无外部视觉 API 。原始 provider 的 HTTP 请求只含文本,text-only 网关不会 400;原始 provider 路由本身不被修改。 提供的能力 工具 作用 实现 vision ocr 提取图中所有文字(带归一化坐标) tesseract.js(chi sim + eng,本地语言包) vision color stats 像素占比分析(白/黑/灰/红/绿/蓝/黄/青/品红/其他) sharp + 直方图统计 vision pixel scan 自动桥接下逐行/逐列检测多色桶像素密度;手动调用仍可指定目标色 sharp raw pixel access vision meta 尺寸、格式、色彩空间、四角/中心颜色采样 sharp metadata 本地证据管线(v0.5.0) 图片证据仍然全部在本机生成;OCR 按预算走一条可追溯的预处理管线,像素扫描也已通用化: 原图证据与 OCR 预处理边界 四项视觉证…

在 GitHub 查看完整 README →
内容/媒体deepseek-harnessdsh-pluginocrvision

分类