suyoumo/deepseekharnesseval
suyoumo★ 2最后同步: 2026-08-17
—
README 摘要
SWE-bench Pro 151 · dsh 单轮四跑横向对比分析 - Agent : dsh (deepseekharness headless) - 模型 : deepseek-v4-flash effort=max - 基准 : swebench-pro 151 (zh release v30 aligned) ,共 151 题、6 个仓库 - 对比口径 : 四个 单轮 成绩横向比较 —— 标准第 1 轮、标准第 2 轮、极简模式、代码模式 - 数据来源 : dsh-swepro-results 目录下的 3 份 md 报告及配套 JSON(2026-08-14 2026-08-17) 一、总览:四个单轮对比 单轮 工具面 solved 比例 标准 1(a1) 全部原生工具(bash/read/edit/subagent/...) 102 67.5% 标准 2(a2) 全部原生工具(bash/read/edit/subagent/...) 96 63.6% 极简 bash + str replace editor 109 72.2% 代码 run code + 生成 SDK 104 68.9% ⚠️ 标准 3(a3) 全部原生工具 83 55.0% 标准 3 为异常低分轮次(大量空补丁集中在个别仓库批次),已标记剔除,不纳入对比。 四轮并集 121 题(80.1%),四轮全过 78 题(51.7%)。 二、按仓库对比 repo 总数 标准1 标准2 极简 代码 四轮并集 ansible 33 24 28 25 24 30 flipt 45 21 19 21 19 27 vuls 24 24 22 24 23 24 openlibrary 35 26 19 27 26 27 navidrome 5 5 4 5 5 5 qutebrowser 9 2 4 7 7 8 合计 151 102 96 109 104 121 四轮全败题目分布:flipt 18/45、openlibrary 8/35、ansible 3/33、qutebrowser 1/9、vuls 和 navidrome 为 0。 三、核心发现 1. 极简模式是四个单轮中最高的 工具面最窄的极简模式(仅 bash + str replace editor)拿到 109 分(72.2%),高于标准 1(102)、标准 2(96)和代码模式(104)。砍掉大部分原生工具不仅没有损失单轮解题能力,反而略优于全套工具的标准模式——工具面宽度不是单轮成绩的决定因素。 2. 标准模式自身的两轮方差就有 6 个百分点 标准 1 与标准 2 差 6 题,且仓库级趋势互相矛盾:ansible 24→28、qutebrowser 2→4(变好),而 openlibrary 26→19、vuls 24→22(变差)…
在 GitHub 查看完整 README →分类
DeepSeek Harness: Everything is a Plugin.
★ 145,755
anywhere-labs/deepseek-harness-desktop为 DeepSeek Harness (DSH) 插件生态打造的现代化桌面端解决方案。万物皆「插件」,桌面本身也是「插件」。
★ 11,175
awesome-dsh-plugin/awesome-dsh-pluginA curated list of plugins for DeepSeek Harness (dsh) · DeepSeek Harness 插件精选列表
★ 7,291