DDDFXYqiming/dsh-ocr1-memory
DDDFXYqiming★ 1JavaScript最后同步: 2026-08-16
Optical compression memory using DeepSeek-OCR (OCR1)
README 摘要
@dsh-external/dsh-ocr1-memory 基于 DeepSeek-OCR: Contexts Optical Compression (arXiv:2510.18234)思想实现的 DSH 光学记忆系统。 记忆不再只存文本——它被 渲染成图像(SoM 编号分段)并保留下来 ;按年龄把旧记忆 降分辨率(越久远越模糊) ;检索命中低清记忆后通过 active recall 恢复高清 ;最终返回 原始 verbatim 片段 (Locate-and-Transcribe),避免生成式幻觉。 能力 工具 说明 ocr1 mem status 状态:存储目录 / OCR 后端 / 条目数 / 渲染依赖 / 层级 ocr1 mem store 文本 → 自动分段 → 渲染 SoM 图像 → 存入记忆库 ocr1 mem update 更新已有记忆,替换为新内容并重置为 vivid(冲突消解) ocr1 mem retrieve 按查询检索,OCR 读回图像 + 分段召回;命中低清记忆自动 active recall ocr1 mem list 列出记忆条目(id / 来源 / 段数 / 层级 / 命中数) ocr1 mem metrics 查看压缩比指标:文本 token 数 / 视觉 token 数 / 实测 prompt tokens ocr1 mem calibrate 校准 OCR 文本基线 prompt tokens,用于更准确的视觉 token 估算 ocr1 mem forget 按 id 删除记忆 ocr1 mem render test 渲染管线自测 ocr1 mem embed test 视觉 embedding 自测:返回真实 1280 维 DeepSeek-OCR embedding 与直接视觉 token 数 设计(对应 OCR1 论文) OCR1 概念 本插件实现 长文本 → 光学 2D 映射 文本按段落自动分段,渲染为图像 visual tokens 承载信息 分辨率模式对应 OCR1 官方设计: vivid 1280(≈400) → normal 1024(≈256) → fuzzy 640(≈100) ;会记录接口级视觉 token 数 记忆随时间模糊 按 createdAt 年龄衰减,旧记忆降到低分辨率 人类记忆的 vivid-to-fuzzy 越旧越低清,但保留语义 gist 记忆刷新 命中低清记忆 → active recall 恢复高清,并在一段时间内豁免再衰减 避免幻觉 Locate-and-Transcribe 风格:返回原始 verbatim 片段;当前定位由文本打分 + OCR 证据完成,不是模型直接输出 SoM 编号 OCR 驱动召回 原始 token 未命中但 DeepSeek-OCR 从图像读到关…
在 GitHub 查看完整 README →分类
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。
★ 2,376
Anionex/agent-vision-toolkit为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
★ 947
Anionex/dsh-vision-toolkit让纯文本模型更好地做视觉任务的DeepSeek Harness插件:带意图的图片问答、长截图 OCR、UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
★ 532