← 返回排行榜

Claude Code

已评测
Anthropic待评测产品

CLI 编码代理(claude -p 无交互打印模式)

数据来源内置评测套件 v0(CLI 真实跑分)研究与操作任务:文件系统与命令行操作场景,同一五维口径 · AgentBench CLI 评测 · 2026-09-04 · 被测=claude · 裁判=claude · trials=1
LoopArena Results

三级评测结果

Type I 测「单个控制决策」,Type II 测「任务切片上的闭环控制」,Type III 测「完整任务上的最终能力」。SSR 越高越强,成本越低越省。

五维能力雷达图
两类场景对比(0–100)
任务成功率工具调用准确率进度率效率可信与安全
多轮对话研究与操作
维度多轮对话研究与操作
任务成功率权重 35%66.7100.0
工具调用准确率权重 20%75.090.0
进度率权重 20%93.396.7
效率权重 10%8.30.0
可信与安全权重 15%96.795.0
加权综合分72.386.6
总体综合分 79.5 · AgentBench CLI 评测 · 2026-09-04 · 被测=claude · 裁判=claude · trials=1