jing-hy/picturereader

jing-hy★ 0JavaScript最后同步: 2026-08-16

在 GitHub 打开

DSH plugin: pixel-to-text image reading for text-only models. image_scan/image_ocr/image_sample tools + image-reading skill (34-image trained methodology). Pure local, optional PaddleOCR.

README 摘要

picturereader DSH 插件( dsh-plugin )— 给纯文本模型(如 deepseek-v4-flash)的"读图"能力。 把图片 降分辨率 + 降色深 + 结构/色彩指纹提取 ,渲染成文本网格喂回对话, 让模型像多模态模型一样"看"图:描述场景、主体、环境、光线与语义内容。 纯本地、零外部模型依赖、零 API key、零 Python(PaddleOCR 为可选增强) 。 这是什么 DeepSeek 等纯文本模型没有视觉编码器,无法直接看图。picturereader 把"看图"翻译成 模型能理解的 结构化文本证据 ,并提供一套经过真实图片训练验证的 读图方法论 skill(image-reading) ,让模型像人一样分步看图: 1. 全局定调 :hue families(纯色相指纹)→ structure(条带/对称)→ texture(写实度)→ regions(色块结构) 2. 主动找主体 :px per cell 定向放大(深色/低对比/小色块不会漏) 3. 文字验证 :PaddleOCR 实读(防多模态幻觉) 4. 材质判断 :image sample 像素取样 5. 综合描述 :带证据等级的连贯画面描述 工具 工具 作用 image scan 全局/区域扫描:亮度/颜色网格 + regions 色块 + shade diversity + texture mix + structure(条带/对称)+ 像素级 colors + hue families 纯色相指纹 ;支持 focus / region 局部放大、 px per cell 像素密度定向放大 image ocr 文字识别双引擎: windows (内置,默认)/ paddle (选装,发光/弯曲/游戏字远强),失败自动降级不崩溃 image sample 8×8 精确像素取样,判断材质/纹理(金属/木纹/织物/皮肤/雾) 读图方法论 skill(image-reading) skills/image-reading.md 是经 34 张真实游戏截图训练 + gemma-4-12b 对照验证 沉淀的 读图方法论(按 experience / skill / principle / insight 分层),安装后模型自动掌握: - hue 场景指纹 :cyan 高=水/雾/湖泊,green 高=森林,orange/red 高=暖色人物/火光, blue 高=夜晚科幻,achromatic+rough=废墟,green+yellow=翠绿能量/浮空仙境 - 多模态模型校验规则 :游戏名/品牌必须 OCR 实读(gemma 会猜"原神/崩坏3"); 发光元素颜色以 hue 实测为准(多模态模型系统性误标成"粉红/紫") - 主动验证 :低对比主体(暗色人物/小色块)必…

在 GitHub 查看完整 README →
内容/媒体deepseek-harnessdsh-pluginimage-readingocrpixel-artvision

分类