编程智能体评测与排行Controller / Worker 分开测

把「控制」和「执行」拆开,
Agent 行不行用数据说话

LoopArena 机制:Controller 只决策、Worker 只动手,固定 Worker 后分数差只反映控制能力。用严格成功率(SSR)+ 估算推理成本 + Type I / II / III 三级评测,只对目前主流的编程智能体排序打分。

3
评测档位

Type I / II / III,成本递减逼近同一结论

5
已评测模型

论文 Table 2 真实结果,参与排名

9
待评测产品

Claude Code / Codex / Cursor 等,待接入

!
数据口径声明:榜单中已标注来源的分数来自 LoopArena 论文(arXiv 2608.28281) Table 2 的公开发布快照,仅代表论文口径与当时复现环境;其余主流编程智能体产品暂为 「待评测」占位,尚未在 LoopArena 统一口径下跑分。本站为第三方评测榜单,与论文作者 及各家模型/产品厂商无隶属关系。
Mechanism

Controller 与 Worker 分开测

LoopArena 把「控制」和「执行」拆成两个 Agent:Controller 只决策、Worker 只动手。被评的是 Controller,不是整个系统。

Controller被评测模型

只读 Evidence Packet,输出 Loop Contract(advance / verify / stop)。不持有任何编码工具,唯一职责是「决定下一步干什么」——这正是被排序、被打分的对象。

Worker固定编码 Agent

唯一能读写代码、运行命令的角色。全榜单统一用 Qwen3.7-Plus,从而把「执行能力」固定住,隔离出 Controller 的纯控制能力差异。

Reporter临时报告者

复用 Worker 同款模型配置,从 Worker 对话副本 + 只读工作区生成四段式报告(任务上下文 / 已完成工作 / 验证证据 / 遗留问题),作为下一轮 Evidence Packet 的原料。

Evidence Packet · 证据包

Controller 收到的结构化只读摘要。它不读原始长对话,只看 Reporter 提炼的浓缩证据——控制模型不背「读长上下文」的锅。

Loop Contract · 循环契约

Controller 的输出契约,三种动作:advance(继续,附下一条 assignment)、verify(要求验证)、stop(判断已达成/已放弃)。advance 会被渲染成 Worker 的下一条指令。

一句话理解:传统基准把「模型 + 工具 + 提示」捆成一个 黑盒一起打分;LoopArena 把 Controller(决策)单独拎出来测,Worker 固定,于是分数差只反映「控制能力」的差。
Three Tiers

三级评测:从「单决策」到「完整任务」

同一批 Controller 在三个档位上各测一次,用成本递减的方式逼近同一结论。

Type I合同选择

四选一:给定同一 Evidence Packet,Controller 从四个候选 Loop Contract 里挑最正确的一个。候选答案在构建时已真实执行验证,评测时零 Worker 运行,成本最低、最快。

指标Contract Accuracy(合同准确率)
成本0(无 Worker 执行)
Type II任务切片

从准备好的中间工作区起步,跑真实 Controller–Worker 闭环,但执行范围更短。它是「低成本、仍保留闭环」的替代档位,用于快速比较。

指标SSR(严格成功率)+ 估算成本
成本约比 Type III 低 64.4%
Type III完整任务

从原始状态开始跑完整编码任务,是最终标准。Controller 必须全程在实现、验证、恢复、停止之间自适应切换,难度最高。

指标SSR(严格成功率)+ 估算成本
成本最贵 · 主排序档位
关键结论:Type II 与 Type III 的 Controller 排名高度一致 (Spearman's ρ = 0.9747),说明任务切片能大幅省成本、 又不失真地复现完整任务结论;但 Type III 仍是最终标准。
Pipeline

双层循环:内层执行,外层控制

一个分数的诞生,是「Controller 决策 → Worker 执行 → Reporter 汇报」反复闭环的结果。

控制闭环

每一轮都经过五个环节,直到 Controller 输出 stop

Evidence Packet结构化摘要Controller输出 Loop ContractWorker执行 assignmentReporter四段式报告下一轮循环或 stop

内循环 vs 外循环

二者分工,隔离出「控制能力」这个被评对象

内循环 · Worker ReAct

Worker 自己思考—行动—观察,反复迭代直到完成当前 assignment 或无法继续。这一步被固定住,所有 Controller 共享同一个 Worker。

外循环 · Controller 控制

Controller 每轮收到最新 Evidence Packet,决定 advance / verify / stop。它决定整个任务何时继续、何时验收、何时收手——这才是被评测的能力。

Metrics

指标口径与参考策略

SSR 判「强不强」,成本判「省不省」,参考策略判「控制到底有没有用」。

三个核心指标

每个分数都有明确定义与口径

SSR · Strict Success Rate

既通过任务 evaluator、又符合 LoopArena 协议(Controller 恰当时机 stop、Worker 未越界)才算成功。比传统「通过测试」更严。

估算推理成本

$/run,无缓存口径,把 Worker、Reporter、Controller 三者的推理成本都算进去。强度相近时,便宜者胜。

Spearman ρ

Type II 与 Type III 排名相关性,论文实测 0.9747——用于证明低成本档位不失真。

参考策略(不参与排名)

两条基线共用同一个 Worker,用于定位「Controller 的价值」

No control

没有 Controller,Worker 直接自主执行。用于回答「闭环控制到底有没有用」。

Fixed control

不读 Evidence Packet、不调模型,只机械重申任务目标。用于区分「真控制」与「假装控制」。

论文观察:Fixed control 在 Type II 上把 No control 的 39.51% 拉到 46.91%,但 Type III 两者都只有 18.52%——机械重申目标只能帮有限切片,完整任务需要能自适应切换的控制。

Scope

为什么榜单只评编程智能体

LoopArena 是一个面向「编程任务」的基准——它的 Worker 动作空间是编码与运行命令。把范围收窄到编程智能体,才能保证口径一致、可比。

动作空间匹配

拿编码基准去评客服/研究 Agent 没有意义。LoopArena 的 Worker 只会「写代码 + 跑命令」,只有编程智能体落在这个动作空间里。

隔离控制能力

固定 Worker 后,分数差只来自 Controller 的控制能力。跨场景会引入完全不同的动作空间,破坏这一隔离。

主流产品聚焦

Claude Code、Codex、Cursor 等当前主流智能体都以「编程」为核心场景,聚焦这里对用户最有参考价值。