NLeRWantFly/dsh-HoldThatBigBlueFatFish

NLeRWantFly★ 2JavaScriptLast synced: 2026-08-15

Open on GitHub

约束蓝色大肥鱼过度思考暂时的方案~模型测试opencode go实现

README excerpt

dsh-HoldThatBigBlueFatFish 让 DeepSeek Harness 的蓝色大肥鱼先拿一条证据,再动整片池塘。 dsh-plugin · DeepSeek Harness community preset · MIT 本工作区汇总了 deepseek-official/deepseek-v4-pro 、 reasoningEffort: max 的 Git-style Anchored Standard、Project2 长测和 V2–V6 省 Token 消融,并提供已安装到当前 DeepSeek Harness 的生产预设: 这是社区实验,不是 DeepSeek 官方 preset,也不代表 DeepSeek 的认可或背书。当前 composition 基于 DeepSeek Harness 47f943859bef60e4160492346772ded9b24f765a 的 Standard preset 生成;Harness 升级后应重新运行验证。 快速安装 克隆仓库后,将生产 preset 目录完整复制到你的 DSH 用户 preset 根目录。PowerShell: Linux/macOS: 完整重启 DeepSeek Harness,新建空白 session,选择 DSV4 Progressive Guarded 。不要在已有轨迹的会话中途切换 preset。 验证发布包: 总结 工具 schema 与运行时 guard 对实际动作的影响大于 prompt;它们能约束仓库盘点风险,但当前实验没有证明能同步缩短模型内部 reasoning。 - Persona/context:Standard 换成 46 字符 Minimal 后,首步 reasoning 从 81 增至 166,动作广度仍为 2。 - 首轮 schema:Minimal Fixed/Anchored 在短探针把广度降至 1,但 reasoning 增至 294/227;通用 shell 仍能绕回递归盘点。 - 显式 prompt:动作更合规,但模型会在 reasoning 中复述规则,V2/V3 为 248/370 字符。 - 能力过窄:只开放 read 导致 1778 字符的能力焦虑;告知后续会开放工具后降至 442。 - 上下文预取:V6 reasoning 降至 328,但工具调用增至 3、广度回到 2。 - 长任务:Minimal 两组 Ability 为 91.0,对比 Standard 90.5;但 Ship 从 90.5 降到 72,未证明总体质量提升。 完成数据均来自 Windows native;Linux Docker 没有形成完整可评分 run,因此不作跨 OS 结论。 全部评分数据 总计 14 条结果、634 次模型请求、858,0…

View full README on GitHub →
Tools / Devdsh-pluginagent

Category