Controller 与 Worker 分开测
LoopArena 把「控制」和「执行」拆成两个 Agent:Controller 只决策、Worker 只动手。被评的是 Controller,不是整个系统。
只读 Evidence Packet,输出 Loop Contract(advance / verify / stop)。不持有任何编码工具,唯一职责是「决定下一步干什么」——这正是被排序、被打分的对象。
唯一能读写代码、运行命令的角色。全榜单统一用 Qwen3.7-Plus,从而把「执行能力」固定住,隔离出 Controller 的纯控制能力差异。
复用 Worker 同款模型配置,从 Worker 对话副本 + 只读工作区生成四段式报告(任务上下文 / 已完成工作 / 验证证据 / 遗留问题),作为下一轮 Evidence Packet 的原料。
Evidence Packet · 证据包
Controller 收到的结构化只读摘要。它不读原始长对话,只看 Reporter 提炼的浓缩证据——控制模型不背「读长上下文」的锅。
Loop Contract · 循环契约
Controller 的输出契约,三种动作:advance(继续,附下一条 assignment)、verify(要求验证)、stop(判断已达成/已放弃)。advance 会被渲染成 Worker 的下一条指令。
三级评测:从「单决策」到「完整任务」
同一批 Controller 在三个档位上各测一次,用成本递减的方式逼近同一结论。
四选一:给定同一 Evidence Packet,Controller 从四个候选 Loop Contract 里挑最正确的一个。候选答案在构建时已真实执行验证,评测时零 Worker 运行,成本最低、最快。
从准备好的中间工作区起步,跑真实 Controller–Worker 闭环,但执行范围更短。它是「低成本、仍保留闭环」的替代档位,用于快速比较。
从原始状态开始跑完整编码任务,是最终标准。Controller 必须全程在实现、验证、恢复、停止之间自适应切换,难度最高。
双层循环:内层执行,外层控制
一个分数的诞生,是「Controller 决策 → Worker 执行 → Reporter 汇报」反复闭环的结果。
控制闭环
每一轮都经过五个环节,直到 Controller 输出 stop
内循环 vs 外循环
二者分工,隔离出「控制能力」这个被评对象
Worker 自己思考—行动—观察,反复迭代直到完成当前 assignment 或无法继续。这一步被固定住,所有 Controller 共享同一个 Worker。
Controller 每轮收到最新 Evidence Packet,决定 advance / verify / stop。它决定整个任务何时继续、何时验收、何时收手——这才是被评测的能力。
指标口径与参考策略
SSR 判「强不强」,成本判「省不省」,参考策略判「控制到底有没有用」。
三个核心指标
每个分数都有明确定义与口径
既通过任务 evaluator、又符合 LoopArena 协议(Controller 恰当时机 stop、Worker 未越界)才算成功。比传统「通过测试」更严。
$/run,无缓存口径,把 Worker、Reporter、Controller 三者的推理成本都算进去。强度相近时,便宜者胜。
Type II 与 Type III 排名相关性,论文实测 0.9747——用于证明低成本档位不失真。
参考策略(不参与排名)
两条基线共用同一个 Worker,用于定位「Controller 的价值」
没有 Controller,Worker 直接自主执行。用于回答「闭环控制到底有没有用」。
不读 Evidence Packet、不调模型,只机械重申任务目标。用于区分「真控制」与「假装控制」。
论文观察:Fixed control 在 Type II 上把 No control 的 39.51% 拉到 46.91%,但 Type III 两者都只有 18.52%——机械重申目标只能帮有限切片,完整任务需要能自适应切换的控制。
为什么榜单只评编程智能体
LoopArena 是一个面向「编程任务」的基准——它的 Worker 动作空间是编码与运行命令。把范围收窄到编程智能体,才能保证口径一致、可比。
拿编码基准去评客服/研究 Agent 没有意义。LoopArena 的 Worker 只会「写代码 + 跑命令」,只有编程智能体落在这个动作空间里。
固定 Worker 后,分数差只来自 Controller 的控制能力。跨场景会引入完全不同的动作空间,破坏这一隔离。
Claude Code、Codex、Cursor 等当前主流智能体都以「编程」为核心场景,聚焦这里对用户最有参考价值。