← 返回排行榜
Codex
已评测OpenAI待评测产品
CLI / IDE 编码代理(codex exec 非交互模式)
数据来源内置评测套件 v0(CLI 真实跑分)研究与操作任务:文件系统与命令行操作场景,同一五维口径 · AgentBench CLI 评测 · 2026-09-04 · 被测=codex · 裁判=claude · trials=1
LoopArena Results
三级评测结果
Type I 测「单个控制决策」,Type II 测「任务切片上的闭环控制」,Type III 测「完整任务上的最终能力」。SSR 越高越强,成本越低越省。
五维能力雷达图
两类场景对比(0–100)
多轮对话研究与操作
| 维度 | 多轮对话 | 研究与操作 |
|---|---|---|
| 任务成功率权重 35% | 66.7 | 100.0 |
| 工具调用准确率权重 20% | 35.0 | 85.0 |
| 进度率权重 20% | 86.7 | 91.7 |
| 效率权重 10% | 0.0 | 24.7 |
| 可信与安全权重 15% | 80.0 | 93.3 |
| 加权综合分 | 59.7 | 86.8 |
总体综合分 73.2 · AgentBench CLI 评测 · 2026-09-04 · 被测=codex · 裁判=claude · trials=1