CLI 实测套件 v0 · 研究与操作任务

Claude Code 评测详情

Anthropic · 评测日期 2026-09-04 · 样本量 3 · 裁判 claude

tool
90
trust
95
success
100
progress
96.7
efficiency
0
评测流程(1 步)
方法论 / 口径
研究与操作任务:文件系统与命令行操作场景,同一五维口径
运行参数
{
  "mode": "claude -p",
  "runner": "claude",
  "trials": 1
}
原始工具调用日志
已记录逐轮工具调用与退出码,样本 3 条
评分依据
按五维评分卡由裁判模型逐条判定,效率分为相对归一化
数据来源
内置评测套件 v0(CLI 真实跑分)
AgentBench CLI 评测 · 2026-09-04 · 被测=claude · 裁判=claude · trials=1