DDDFXYqiming/dsh-ocr1-memory

DDDFXYqiming★ 1JavaScriptLast synced: 2026-08-16

Open on GitHub

Optical compression memory using DeepSeek-OCR (OCR1)

README excerpt

@dsh-external/dsh-ocr1-memory 基于 DeepSeek-OCR: Contexts Optical Compression (arXiv:2510.18234)思想实现的 DSH 光学记忆系统。 记忆不再只存文本——它被 渲染成图像(SoM 编号分段)并保留下来 ;按年龄把旧记忆 降分辨率(越久远越模糊) ;检索命中低清记忆后通过 active recall 恢复高清 ;最终返回 原始 verbatim 片段 (Locate-and-Transcribe),避免生成式幻觉。 能力 工具 说明 ocr1 mem status 状态:存储目录 / OCR 后端 / 条目数 / 渲染依赖 / 层级 ocr1 mem store 文本 → 自动分段 → 渲染 SoM 图像 → 存入记忆库 ocr1 mem update 更新已有记忆,替换为新内容并重置为 vivid(冲突消解) ocr1 mem retrieve 按查询检索,OCR 读回图像 + 分段召回;命中低清记忆自动 active recall ocr1 mem list 列出记忆条目(id / 来源 / 段数 / 层级 / 命中数) ocr1 mem metrics 查看压缩比指标:文本 token 数 / 视觉 token 数 / 实测 prompt tokens ocr1 mem calibrate 校准 OCR 文本基线 prompt tokens,用于更准确的视觉 token 估算 ocr1 mem forget 按 id 删除记忆 ocr1 mem render test 渲染管线自测 ocr1 mem embed test 视觉 embedding 自测:返回真实 1280 维 DeepSeek-OCR embedding 与直接视觉 token 数 设计(对应 OCR1 论文) OCR1 概念 本插件实现 长文本 → 光学 2D 映射 文本按段落自动分段,渲染为图像 visual tokens 承载信息 分辨率模式对应 OCR1 官方设计: vivid 1280(≈400) → normal 1024(≈256) → fuzzy 640(≈100) ;会记录接口级视觉 token 数 记忆随时间模糊 按 createdAt 年龄衰减,旧记忆降到低分辨率 人类记忆的 vivid-to-fuzzy 越旧越低清,但保留语义 gist 记忆刷新 命中低清记忆 → active recall 恢复高清,并在一段时间内豁免再衰减 避免幻觉 Locate-and-Transcribe 风格:返回原始 verbatim 片段;当前定位由文本打分 + OCR 证据完成,不是模型直接输出 SoM 编号 OCR 驱动召回 原始 token 未命中但 DeepSeek-OCR 从图像读到关…

View full README on GitHub →
Media / Contentagent-skillsdeepseek-harnessdeepseek-ocrdshdsh-pluginmemoryocr1optical-memory

Category