LoopArenaController / Worker 分开测Type I / II / III
LoopArena 评测机制
LoopArena 把「编程智能体」拆成两个 Agent:Controller只做决策、Worker 只动手。被评测、被排序的是 Controller——它读结构化证据,输出「下一步该干嘛」的 Loop Contract,全程不碰代码。
Worker 固定为 Qwen3.7-Plus,隔离出 Controller 的纯控制能力
三级评测用成本递减的方式逼近完整任务结论
严格成功率(SSR)= 通过测试 + 遵守协议
Roles
三个角色:谁决策,谁动手
Controller · 被评测模型
只读 Evidence Packet(结构化摘要),输出 Loop Contract,不持有任何编码工具。它的唯一职责是 「决定下一步」——这正是被排序、被打分的对象。
Worker · 固定编码 Agent
唯一能读写代码、运行命令的角色。全榜单统一用 Qwen3.7-Plus,把「执行能力」固定住,让分数差只反映控制能力。
Reporter · 临时报告者
复用 Worker 同款模型配置,从 Worker 对话副本 + 只读工作区生成四段式报告(任务上下文 / 已完成工作 / 验证证据 / 遗留问题),作为下一轮 Evidence Packet 的原料。
Core Objects
两个核心对象
Evidence Packet · 证据包
Controller 收到的结构化只读摘要。它不读原始长对话,只看 Reporter 提炼的浓缩证据—— 控制模型不背「读长上下文」的锅。
Loop Contract · 循环契约
Controller 的输出契约,三种动作: advance(继续,附下一条 assignment)、 verify(要求验证)、 stop(判断已达成/已放弃)。advance 会被渲染成 Worker 的下一条指令。
Three Tiers
三级评测:Type I / II / III
论文 Table 2 的真实结果。Type II 与 Type III 的排名高度一致(Spearman's ρ = 0.9747)。
| Controller | Type I · 合同准确率 | Type II · SSR | Type II · 成本 | Type III · SSR | Type III · 成本 |
|---|---|---|---|---|---|
| GPT-5.5OpenAI | 87.78% | 51.85% | $5.00 | 24.69% | $18.84 |
| Claude Opus 4.8Anthropic | 76.67% | 48.15% | $5.87 | 20.99% | $16.82 |
| Qwen3.7-Plus阿里云 | 72.22% | 48.15% | $4.30 | 23.46% | $6.89 |
| DeepSeek-V4-Flash-0731深度求索 | 77.78% | 45.68% | $2.10 | 19.75% | $10.24 |
| GLM 5.2智谱 | 74.44% | 37.04% | $1.63 | 16.05% | $4.86 |
Type I 合同选择:四选一,候选答案在构建时已真实执行 验证,评测时零 Worker 运行——只测「单个控制决策」。
Type II 任务切片:从准备好的中间工作区开始,跑真实 闭环但范围更短,成本约比 Type III 低 64.4%。
Type III 完整任务:从原始状态开始,是最终标准;最强 Controller 也只有 24.69% SSR。
Reference Policies
参考策略与指标口径
参考策略(不参与排名)
Fixed controlType II 46.91% · Type III 18.52%
不读取 Evidence Packet,重复重申任务目标
No controlType II 39.51% · Type III 18.52%
无 Controller,Worker 直接自主执行
指标口径
- SSR(Strict Success Rate):既通过任务 evaluator、 又遵守 LoopArena 协议才算成功。
- 估算推理成本:$/run,无缓存口径,含 Worker / Reporter / Controller。
- Spearman ρ:Type II 与 Type III 排名相关性 = 0.9747。
Reproduce