HongzhongL/dsh-grayprint

HongzhongL★ 3JavaScriptLast synced: 2026-08-21

Open on GitHub

GrayPrint — dsh web plugin for live reasoning-style fingerprints. Scores paragraph openers against grayscale/current references and independently tracks Let me ↔ We need. 94.2% holdout.

README excerpt

GrayPrint · dsh 思考文字双指纹面板 中文 English DeepSeek Harness(dsh)网页端插件,默认从会话页右下角打开两条彼此独立的实时指纹:① 当前思考文字更像灰度样本还是当前版样本;② 段落开头更偏 Let me 逐步试探,还是 We need 规划执行。两条读数都只描述文字形态,不直接证明模型版本或能力。 极点 写法 证据来源 🟢 灰度指纹 第一人称叙述: I'm planning out… I'll set up… I've got… opncd.ai 分享的 dsv4 灰度 opencode 会话 41 个 / 1749 个 raw reasoning block / 7870 个内部段落 🔵 当前版指纹 集体人称速记: We need answer likely… Let's inspect… ,不成句 本机 DSH 导出的当前版 standard preset 会话 41 个 / 3021 个 raw reasoning block / 53994 个内部段落 为什么是这两极 起因是检验 NoLetMe 的判据在这批语料上是否成立。结论是 极性相反 : let me 的总命中并不能稳定区分两极,因此不参与灰度得分;只有每个内部段落的段首 Let me / We need 会进入另一条独立的组织方式指纹。GrayPrint v0.4 将所有判据统一到同一个口径: 先取 reasoning block,按 Markdown 空行拆出实际段落,再只检查每段开头 。 对照组的一次重大修正 v0.1 的对照组是错的。 当时的"当前极"取自 anchored-standard preset —— 而那个 preset 的设计目的本就是把模型锚回 minimal 的电报体轨迹,等于把结论写进前提。用 169 个真实会话分层复测后发现: 同一个当前模型,只换 preset,得分从 10% 跳到 86% ,8 个当前版会话被误判成「灰度指纹」(其中一个还是本插件的开发会话自己)。 改用 standard preset 作对照,并把每个 reasoning block 拆成内部段落后,真实分离度是这样: 判别轴(每个内部段落归一) 灰度 当前版 standard 单轴准确率 权重 : : : : 段首第一人称( I'm / I'll / I've / I ) 22.15% 3.76% 93.9% 49% 段首 I'm / I'll 14.94% 1.28% 96.3% 51% 段首 we / let's (仅保留计数) 0.0% 1.13% 54.9% (≈随机) — 段首 We / Let's / Need (仅保留计数) 0.0% 1.35% 54.9% (≈随机) — 各会话内部段落中位长均值(只展示) 342 字 198…

View full README on GitHub →
Tools / Devchain-of-thoughtdeepseekdeepseek-harnessdshdsh-pluginreasoning

Category