zjsthmjialin/pdf-background-gray-codex-skill
zjsthmjialin★ 1Python最后同步: 2026-08-16
Codex skill for removing gray backgrounds from scanned PDFs without changing resolution or anti-aliased text.
README 摘要
PDF 去底灰(原分辨率)Codex Skill remove-pdf-background-gray 是一个用于扫描型 PDF 的 Codex Skill。它可以去除纸张扫描产生的灰底或偏白底色,同时保持页面尺寸、嵌入图像的原始像素尺寸和文字的连续抗锯齿边缘。 这个项目既可以作为 Codex Skill 自动调用,也可以直接运行其中的 Python 脚本。 DeepSeek Harness (DSH) 插件安装 remove-pdf-background-gray 也是 DeepSeek Harness (DSH) 插件 ,一条命令安装: 重启 DSH Web 后,向 Agent 说"把这份扫描 PDF 去底灰"即自动走技能工作流(要求本机 Python 3.10+ 与 python -m pip install pypdf Pillow numpy )。 - npm: https://www.npmjs.com/package/dsh-pdf-background-gray - 插件源码:本仓库 dsh-pdf-background-gray/ 目录 核心特点 - 保持原分辨率 :直接处理 PDF 内嵌图像,不缩放图像。 - 不整页重绘 :不先把 PDF 页面渲染成新图片再重新组装。 - 保护文字边缘 :使用连续的高光映射,不使用容易产生锯齿的硬阈值或黑白二值化。 - 无损写回 :处理后的图像使用 Flate 无损压缩写回 PDF,避免再次 JPEG 压缩文字边缘。 - 内置验证 :输出后检查页数、页面框和嵌入图像像素尺寸是否改变。 - 安全中止 :遇到内联图像或透明蒙版时停止处理,避免悄悄破坏复杂页面。 适用范围 适合以下情况: - 扫描书籍、档案、讲义或合同的纸张底色发灰。 - 希望背景变白,但不希望文字被二值化或出现明显锯齿。 - 需要保持原始 DPI、图像宽高和 PDF 页面尺寸。 - PDF 页面主要由 JPEG、灰度图或 RGB 扫描图组成。 不建议直接用于: - 以矢量文字、复杂插画或透明图层为主的 PDF。 - 灰色本身就是内容的一部分,例如铅笔画、浅灰表格、医学影像或艺术作品。 - 需要极致压缩体积,而不是优先保证文字边缘质量的场景。 - 带有透明蒙版、内联图像或特殊色彩空间且尚未人工检查的文件。 处理前建议使用 pdfinfo 、 pdffonts 和 pdfimages -list 检查 PDF 结构,并先对一页代表性内容做测试。 已验证效果 本 Skill 最初用于处理一份真实扫描 PDF,验证结果如下: 项目 结果 PDF 页数 194 页 处理的独立图像对象 713 个 页面数量 处理前后相同 页面尺寸与页面框 处理前后相同 嵌入图像像素尺寸 处理前后相同 文字边缘 保留连续灰阶抗锯齿,未做黑白二值化 原文件大小 48,838…
在 GitHub 查看完整 README →分类
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 2,047
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 920
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 457