CLI 实测套件 v0 · 多轮对话任务
OpenCode 评测详情
opencode · 评测日期 2026-09-04 · 样本量 3 · 裁判 claude
tool
20
trust
83.3
success
66.7
progress
66.7
efficiency
0
评测流程(1 步)
方法论 / 口径
多轮对话任务:纯运行模式,五维口径
运行参数
{
"mode": "opencode run --pure",
"runner": "opencode",
"trials": 1
}原始工具调用日志
已记录逐轮工具调用与退出码,样本 3 条
评分依据
按五维评分卡由裁判模型逐条判定,效率分为相对归一化
数据来源
内置评测套件 v0(CLI 真实跑分)
AgentBench CLI 评测 · 2026-09-04 · 被测=opencode · 裁判=claude · trials=1