suyoumo/deepseekharnesseval

suyoumo★ 2Last synced: 2026-08-17

Open on GitHub

README excerpt

SWE-bench Pro 151 · dsh 单轮四跑横向对比分析 - Agent : dsh (deepseekharness headless) - 模型 : deepseek-v4-flash effort=max - 基准 : swebench-pro 151 (zh release v30 aligned) ,共 151 题、6 个仓库 - 对比口径 : 四个 单轮 成绩横向比较 —— 标准第 1 轮、标准第 2 轮、极简模式、代码模式 - 数据来源 : dsh-swepro-results 目录下的 3 份 md 报告及配套 JSON(2026-08-14 2026-08-17) 一、总览:四个单轮对比 单轮 工具面 solved 比例 标准 1(a1) 全部原生工具(bash/read/edit/subagent/...) 102 67.5% 标准 2(a2) 全部原生工具(bash/read/edit/subagent/...) 96 63.6% 极简 bash + str replace editor 109 72.2% 代码 run code + 生成 SDK 104 68.9% ⚠️ 标准 3(a3) 全部原生工具 83 55.0% 标准 3 为异常低分轮次(大量空补丁集中在个别仓库批次),已标记剔除,不纳入对比。 四轮并集 121 题(80.1%),四轮全过 78 题(51.7%)。 二、按仓库对比 repo 总数 标准1 标准2 极简 代码 四轮并集 ansible 33 24 28 25 24 30 flipt 45 21 19 21 19 27 vuls 24 24 22 24 23 24 openlibrary 35 26 19 27 26 27 navidrome 5 5 4 5 5 5 qutebrowser 9 2 4 7 7 8 合计 151 102 96 109 104 121 四轮全败题目分布:flipt 18/45、openlibrary 8/35、ansible 3/33、qutebrowser 1/9、vuls 和 navidrome 为 0。 三、核心发现 1. 极简模式是四个单轮中最高的 工具面最窄的极简模式(仅 bash + str replace editor)拿到 109 分(72.2%),高于标准 1(102)、标准 2(96)和代码模式(104)。砍掉大部分原生工具不仅没有损失单轮解题能力,反而略优于全套工具的标准模式——工具面宽度不是单轮成绩的决定因素。 2. 标准模式自身的两轮方差就有 6 个百分点 标准 1 与标准 2 差 6 题,且仓库级趋势互相矛盾:ansible 24→28、qutebrowser 2→4(变好),而 openlibrary 26→19、vuls 24→22(变差)…

View full README on GitHub →
Tools / Devdeepseekdeepseek-harnessdeepseek-harness-plugindshdsh-bundledsh-plugindsh-plugin-marketdsh-plugins

Category