基准对比LoopArena × SWE-bench

SWE-bench 测「整体行不行」,
LoopArena 把「控制能力」单独拆出来测

SWE-bench 是编程智能体领域使用最广的基准:给 Agent 一个真实 GitHub issue 和仓库快照, 让它产出补丁,然后跑仓库测试看问题是否被解决。它回答的是「整套系统端到端行不行」, 但无法区分功劳属于模型、还是属于外围 scaffold。 LoopArena 的核心差异在于把 Controller(决策)与 Worker(执行)分开: 固定同一个 Worker 后,不同 Controller 之间的分数差只反映控制能力的差异。 两个基准并不矛盾——SWE-bench 适合验收系统整体,LoopArena 适合定位「控制」这一层的强弱。

逐项对比

两个基准,两种测量目标

下表按双方公开论文的口径整理:左列为对比维度,中列为 SWE-bench(含 Verified 子集),右列为 LoopArena。

维度SWE-benchLoopArena
提出方 / 时间普林斯顿大学团队,2023 年 10 月(arXiv 2310.06770)LoopArena 论文(arXiv 2608.28281)
任务来源12 个流行 Python 开源仓库的 2,294 个真实 GitHub issue;Verified 版为 OpenAI 人工筛选的 500 条子集(2024 年 8 月)编程任务经任务切片器拆解,以 Loop Contract 分片下发给 Worker 执行
被评测对象Agent 系统整体(模型 + scaffold 混合,不区分谁在做决策、谁在执行)Controller 只决策、Worker 只动手;固定 Worker(Qwen3.7-Plus)后分数差只反映控制能力
任务接口issue 描述 + 代码仓库快照,Agent 自由探索并产出补丁Evidence Packet(证据包)+ Loop Contract(循环合同):Controller 必须显式选择合同并给出验收条件
评测方式应用补丁后运行仓库测试(FAIL_TO_PASS + PASS_TO_PASS),二值判定Type I 合同选择 / Type II 任务切片 / Type III 完整任务三级评测,成本递减逼近同一结论
核心指标% Resolved(解决率)严格成功率(SSR)+ 估算推理成本($/run),排名一致性 Spearman ρ 0.9747
对 scaffold 的敏感度高:同一模型换 scaffold(Agent 框架)后排名可能明显变化,难以归因低:Worker 与执行环境统一固定,差异可归因到 Controller 的决策能力
回答的问题这套 Agent 系统整体能不能把真实 issue 修好?Agent 的「控制能力」(拆解、选合同、验收、纠偏)本身有多强?
能力隔离

为什么「拆开测」重要

在端到端基准里,一次失败可能是模型判断力不行,也可能只是工具封装或提示词脚手架的问题—— 分数本身不会告诉你。LoopArena 用 Evidence Packet(证据包)统一信息输入、用 Loop Contract(循环合同)统一任务下发与验收, 再把 Worker 固定为同一模型,让「控制」成为唯一变量。 三级评测让预算不同的团队都能参与:从秒级的合同选择,到完整任务的严格成功率。

Type I
合同选择

给 Evidence Packet,Controller 从候选 Loop Contract 中选正确的一份。秒级出分,成本最低。

Type II
任务切片

Controller 按选定的 Loop Contract 指挥固定 Worker 完成单个任务切片,测单步控制质量。

Type III
完整任务

从零跑完整个编码任务,按严格成功率(SSR)计分——本站主榜即按 Type III SSR 排名。

怎么选

两个基准各自的适用场景

选 SWE-bench,当你要——
  • · 验收一套完整 Agent 系统(模型 + scaffold + 工具链)在真实 issue 上的端到端表现;
  • · 与社区已有的大量公开结果横向对照(SWE-bench 已积累多个公开榜单与复现数据);
  • · 在 12 个流行 Python 仓库的真实维护场景中做发布前回归。
选 LoopArena,当你要——
  • · 单独比较不同模型的控制与决策能力,排除 scaffold 差异的干扰;
  • · 用 Type I / II 低成本档位快速初筛,再用 Type III 严格成功率定榜;
  • · 同时关注「做不做得完」和「花多少钱做完」(估算推理成本 $/run)。
!
口径提醒:SWE-bench 的 % Resolved 与 LoopArena 的 SSR 测量目标不同,分数不可直接互换或合并排名; 同一模型在两个基准上的名次差异,往往反映的是评测口径而非能力矛盾。
参考来源