zjsthmjialin/pdf-background-gray-codex-skill

zjsthmjialin★ 1PythonLast synced: 2026-08-16

Open on GitHub

Codex skill for removing gray backgrounds from scanned PDFs without changing resolution or anti-aliased text.

README excerpt

PDF 去底灰(原分辨率)Codex Skill remove-pdf-background-gray 是一个用于扫描型 PDF 的 Codex Skill。它可以去除纸张扫描产生的灰底或偏白底色,同时保持页面尺寸、嵌入图像的原始像素尺寸和文字的连续抗锯齿边缘。 这个项目既可以作为 Codex Skill 自动调用,也可以直接运行其中的 Python 脚本。 DeepSeek Harness (DSH) 插件安装 remove-pdf-background-gray 也是 DeepSeek Harness (DSH) 插件 ,一条命令安装: 重启 DSH Web 后,向 Agent 说"把这份扫描 PDF 去底灰"即自动走技能工作流(要求本机 Python 3.10+ 与 python -m pip install pypdf Pillow numpy )。 - npm: https://www.npmjs.com/package/dsh-pdf-background-gray - 插件源码:本仓库 dsh-pdf-background-gray/ 目录 核心特点 - 保持原分辨率 :直接处理 PDF 内嵌图像,不缩放图像。 - 不整页重绘 :不先把 PDF 页面渲染成新图片再重新组装。 - 保护文字边缘 :使用连续的高光映射,不使用容易产生锯齿的硬阈值或黑白二值化。 - 无损写回 :处理后的图像使用 Flate 无损压缩写回 PDF,避免再次 JPEG 压缩文字边缘。 - 内置验证 :输出后检查页数、页面框和嵌入图像像素尺寸是否改变。 - 安全中止 :遇到内联图像或透明蒙版时停止处理,避免悄悄破坏复杂页面。 适用范围 适合以下情况: - 扫描书籍、档案、讲义或合同的纸张底色发灰。 - 希望背景变白,但不希望文字被二值化或出现明显锯齿。 - 需要保持原始 DPI、图像宽高和 PDF 页面尺寸。 - PDF 页面主要由 JPEG、灰度图或 RGB 扫描图组成。 不建议直接用于: - 以矢量文字、复杂插画或透明图层为主的 PDF。 - 灰色本身就是内容的一部分,例如铅笔画、浅灰表格、医学影像或艺术作品。 - 需要极致压缩体积,而不是优先保证文字边缘质量的场景。 - 带有透明蒙版、内联图像或特殊色彩空间且尚未人工检查的文件。 处理前建议使用 pdfinfo 、 pdffonts 和 pdfimages -list 检查 PDF 结构,并先对一页代表性内容做测试。 已验证效果 本 Skill 最初用于处理一份真实扫描 PDF,验证结果如下: 项目 结果 PDF 页数 194 页 处理的独立图像对象 713 个 页面数量 处理前后相同 页面尺寸与页面框 处理前后相同 嵌入图像像素尺寸 处理前后相同 文字边缘 保留连续灰阶抗锯齿,未做黑白二值化 原文件大小 48,838…

View full README on GitHub →
Media / Contentcodex-skilldeepseek-harnessdshdsh-pluginimage-processingpdfagent

Category