CLI 实测套件 v0 · 研究与操作任务
Codex 评测详情
OpenAI · 评测日期 2026-09-04 · 样本量 3 · 裁判 claude
tool
85
trust
93.3
success
100
progress
91.7
efficiency
24.7
评测流程(1 步)
方法论 / 口径
研究与操作任务:文件系统与命令行操作场景,同一五维口径
运行参数
{
"mode": "codex exec",
"runner": "codex",
"trials": 1
}原始工具调用日志
已记录逐轮工具调用与退出码,样本 3 条
评分依据
按五维评分卡由裁判模型逐条判定,效率分为相对归一化
数据来源
内置评测套件 v0(CLI 真实跑分)
AgentBench CLI 评测 · 2026-09-04 · 被测=codex · 裁判=claude · trials=1