LoopArenaController / Worker 分开测Type I / II / III

LoopArena 评测机制

LoopArena 把「编程智能体」拆成两个 Agent:Controller只做决策、Worker 只动手。被评测、被排序的是 Controller——它读结构化证据,输出「下一步该干嘛」的 Loop Contract,全程不碰代码。

Worker 固定为 Qwen3.7-Plus,隔离出 Controller 的纯控制能力
三级评测用成本递减的方式逼近完整任务结论
严格成功率(SSR)= 通过测试 + 遵守协议
Roles

三个角色:谁决策,谁动手

Controller · 被评测模型

只读 Evidence Packet(结构化摘要),输出 Loop Contract,不持有任何编码工具。它的唯一职责是 「决定下一步」——这正是被排序、被打分的对象。

Worker · 固定编码 Agent

唯一能读写代码、运行命令的角色。全榜单统一用 Qwen3.7-Plus,把「执行能力」固定住,让分数差只反映控制能力。

Reporter · 临时报告者

复用 Worker 同款模型配置,从 Worker 对话副本 + 只读工作区生成四段式报告(任务上下文 / 已完成工作 / 验证证据 / 遗留问题),作为下一轮 Evidence Packet 的原料。

Core Objects

两个核心对象

Evidence Packet · 证据包

Controller 收到的结构化只读摘要。它不读原始长对话,只看 Reporter 提炼的浓缩证据—— 控制模型不背「读长上下文」的锅。

Loop Contract · 循环契约

Controller 的输出契约,三种动作: advance(继续,附下一条 assignment)、 verify(要求验证)、 stop(判断已达成/已放弃)。advance 会被渲染成 Worker 的下一条指令。

Three Tiers

三级评测:Type I / II / III

论文 Table 2 的真实结果。Type II 与 Type III 的排名高度一致(Spearman's ρ = 0.9747)。

ControllerType I · 合同准确率Type II · SSRType II · 成本Type III · SSRType III · 成本
GPT-5.5OpenAI87.78%51.85%$5.0024.69%$18.84
Claude Opus 4.8Anthropic76.67%48.15%$5.8720.99%$16.82
Qwen3.7-Plus阿里云72.22%48.15%$4.3023.46%$6.89
DeepSeek-V4-Flash-0731深度求索77.78%45.68%$2.1019.75%$10.24
GLM 5.2智谱74.44%37.04%$1.6316.05%$4.86
Type I 合同选择:四选一,候选答案在构建时已真实执行 验证,评测时零 Worker 运行——只测「单个控制决策」。
Type II 任务切片:从准备好的中间工作区开始,跑真实 闭环但范围更短,成本约比 Type III 低 64.4%。
Type III 完整任务:从原始状态开始,是最终标准;最强 Controller 也只有 24.69% SSR。
Reference Policies

参考策略与指标口径

参考策略(不参与排名)

Fixed controlType II 46.91% · Type III 18.52%

不读取 Evidence Packet,重复重申任务目标

No controlType II 39.51% · Type III 18.52%

无 Controller,Worker 直接自主执行

指标口径

  • SSR(Strict Success Rate):既通过任务 evaluator、 又遵守 LoopArena 协议才算成功。
  • 估算推理成本:$/run,无缓存口径,含 Worker / Reporter / Controller。
  • Spearman ρ:Type II 与 Type III 排名相关性 = 0.9747。
Reproduce

复现入口

官方仓库提供 Type I / Type III 的运行命令,支持 --preflight-onlyno-control fixed-control 等参数。

looparena-type1-run   # Type I 合同选择(零 Worker 执行)
looparena-type3-run   # Type III 完整任务(最终标准)
# 支持 --preflight-only 预检、no-control / fixed-control 参考策略