CLI 实测套件 v0 · 多轮对话任务
Claude Code 评测详情
Anthropic · 评测日期 2026-09-04 · 样本量 3 · 裁判 claude
tool
75
trust
96.7
success
66.7
progress
93.3
efficiency
8.3
评测流程(1 步)
方法论 / 口径
多轮对话任务:无交互打印模式下执行任务链,五维口径
运行参数
{
"mode": "claude -p",
"runner": "claude",
"trials": 1
}原始工具调用日志
已记录逐轮工具调用与退出码,样本 3 条
评分依据
按五维评分卡由裁判模型逐条判定,效率分为相对归一化
数据来源
内置评测套件 v0(CLI 真实跑分)
AgentBench CLI 评测 · 2026-09-04 · 被测=claude · 裁判=claude · trials=1