← 返回排行榜
Claude Opus 4.8
已评测Anthropic被评测模型
claude-opus-4-8
数据来源LoopArena Table 2Type II 任务切片,Worker 固定为 Qwen3.7-Plus · arXiv 2608.28281 · 2026-08
LoopArena Results
三级评测结果
Type I 测「单个控制决策」,Type II 测「任务切片上的闭环控制」,Type III 测「完整任务上的最终能力」。SSR 越高越强,成本越低越省。
Type I · 合同选择
四选一 · 构建时已执行验证 · 零 Worker 运行
该档位无分数(不适用)。
90 题响应成本$13.68
Type II · 任务切片
从准备好的中间工作区开始
SSR(严格成功率)
48.15%
95% CI:30.86% – 65.43%
平均估算推理成本$5.87
来源拆分(成功 / 样本)
BeyondSWE
17/4835.42%
SCBench
22/3366.67%
Type III · 完整任务
从原始状态开始 · 最终标准
SSR(严格成功率)
20.99%
95% CI:7.41% – 35.80%
平均估算推理成本$16.82
来源拆分(成功 / 样本)
BeyondSWE
14/4829.17%
SCBench
3/339.09%
关键发现
官网 findings · v0.1.0 · 校验于 2026-08-28Type II ↔ Type III 一致性
Spearman ρ = 0.9747
任务切片与完整任务的 Controller 排名高度一致。
Type II 相对 Type III
成本 -64.4%
切片评估显著降低推理成本,仍是有效代理指标。
核心策略发现
Core checks
跟踪进度、指导下一步、要求验证是 Controller 的关键能力。