Nigel211/dsh-text2img-compress

Nigel211★ 0TypeScript最后同步: 2026-08-22

在 GitHub 打开

把长文本渲染成图片发送,利用每图 384 token 封顶压缩 LLM 输入 token,专为DeepSeek Harness设计的插件;Pack long text into images to cut LLM input tokens (384/image cap) — a DeepSeek Harness plugin.

README 摘要

dsh-text2img-compress dsh-text2img-compress — 把 长文本渲染成图片 发送给 DeepSeek 视觉模型, 利用 每张图片 384 token 封顶 的计费规则压缩输入 token( text-as-image token compression )。 English · npm 效果示例 下图即插件渲染出的文字图片页(800×800 原图,18px,token 计费 = 384 ): 一个 DeepSeek Harness(DSH)插件: 输入框右侧出现「图」开关,开启后, 超过阈值的长消息 在发送给模型前会被自动渲染为 文字图片(每张 800×800,恰好吃掉 384 token 上限);模型看到的输入从上万 token 降到 几百到几千 ,而内容一字不差(所有文字都在图里)。由此带来两点直接收益: - ① 输入 token 大幅下降(约 4 5×),成本随之降低 ——消息之前的对话前缀逐字节不变, 而缓存命中不会因此降低 ; - ② 上下文窗口占用大幅压缩 ——同样的窗口能装下几十倍内容,为指令、推理步骤与工具结果 留足空间,长文档场景不再轻易被截断,模型表现更稳定。 原理 DeepSeek 视觉 API 对输入图片有固定计费规则(官方文档): - 每张图片进入模型前自动缩放:更大图片等比缩到总像素约 800×800 等效; - 每张图片 token 数存在上限:384 个 —— 2000×2000 和 5000×5000 的图,缩放后一样是 384; - 多张图每张独立计费。 对长文本: 按文本发 → N 个 token;渲染成 800×800 的图 → 每 384 token/[页] 。 实测(2026-08, deepseek-v4-flash-vision-exp ,18px 字号):约 9000+ 字的 DeepSeek 更新日志 (含大量日期、基准分数、模型名、URL)→ 7 页 ≈ 2688 token ,而文本约 10000+ token, 压缩约 4 5× 。字号越小越密(16px 约 1,600 字/页、18px 约 1,250 字/页,按中文全角估算); 页数上限默认 10 (可在设置中调为 1–20)。 安装 然后重启 DSH、打开/刷新页面:输入框右侧、发送按钮左边出现「图」按钮。 需要当前模型是 视觉模型 (如 deepseek-v4-flash-vision-exp );模型名不含 vision 时 插件自动跳过转换(避免给纯文本模型发图片块导致报错)。 使用 1. 点击「图」→ 变为「图·开」(状态持久化,重启不丢); 2. 旁边可选字号 14/16/18/20/22/24px( 越大越易读、每页字数越少 ); 3. 发送 ≥ 默认 600 字 的文本 —— 聊天里显示一条提示…

在 GitHub 查看完整 README →
内容/媒体deepseekdeepseek-harnessdeepseek-harness-plugindeepseek-harness-pluginsdshdsh-plugindsh-pluginstoken-compression

分类