jing-hy/picturereader
jing-hy★ 0JavaScriptLast synced: 2026-08-16
DSH plugin: pixel-to-text image reading for text-only models. image_scan/image_ocr/image_sample tools + image-reading skill (34-image trained methodology). Pure local, optional PaddleOCR.
README excerpt
picturereader DSH 插件( dsh-plugin )— 给纯文本模型(如 deepseek-v4-flash)的"读图"能力。 把图片 降分辨率 + 降色深 + 结构/色彩指纹提取 ,渲染成文本网格喂回对话, 让模型像多模态模型一样"看"图:描述场景、主体、环境、光线与语义内容。 纯本地、零外部模型依赖、零 API key、零 Python(PaddleOCR 为可选增强) 。 这是什么 DeepSeek 等纯文本模型没有视觉编码器,无法直接看图。picturereader 把"看图"翻译成 模型能理解的 结构化文本证据 ,并提供一套经过真实图片训练验证的 读图方法论 skill(image-reading) ,让模型像人一样分步看图: 1. 全局定调 :hue families(纯色相指纹)→ structure(条带/对称)→ texture(写实度)→ regions(色块结构) 2. 主动找主体 :px per cell 定向放大(深色/低对比/小色块不会漏) 3. 文字验证 :PaddleOCR 实读(防多模态幻觉) 4. 材质判断 :image sample 像素取样 5. 综合描述 :带证据等级的连贯画面描述 工具 工具 作用 image scan 全局/区域扫描:亮度/颜色网格 + regions 色块 + shade diversity + texture mix + structure(条带/对称)+ 像素级 colors + hue families 纯色相指纹 ;支持 focus / region 局部放大、 px per cell 像素密度定向放大 image ocr 文字识别双引擎: windows (内置,默认)/ paddle (选装,发光/弯曲/游戏字远强),失败自动降级不崩溃 image sample 8×8 精确像素取样,判断材质/纹理(金属/木纹/织物/皮肤/雾) 读图方法论 skill(image-reading) skills/image-reading.md 是经 34 张真实游戏截图训练 + gemma-4-12b 对照验证 沉淀的 读图方法论(按 experience / skill / principle / insight 分层),安装后模型自动掌握: - hue 场景指纹 :cyan 高=水/雾/湖泊,green 高=森林,orange/red 高=暖色人物/火光, blue 高=夜晚科幻,achromatic+rough=废墟,green+yellow=翠绿能量/浮空仙境 - 多模态模型校验规则 :游戏名/品牌必须 OCR 实读(gemma 会猜"原神/崩坏3"); 发光元素颜色以 hue 实测为准(多模态模型系统性误标成"粉红/紫") - 主动验证 :低对比主体(暗色人物/小色块)必…
View full README on GitHub →Category
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 2,047
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 920
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 457