← 返回排行榜
DeepSeek-V4-Flash-0731
已评测深度求索被评测模型
temperature 0 · 20,480 输出 token
数据来源LoopArena Table 2Type III 完整任务,严格成功率口径 · arXiv 2608.28281 · 2026-08
LoopArena Results
三级评测结果
Type I 测「单个控制决策」,Type II 测「任务切片上的闭环控制」,Type III 测「完整任务上的最终能力」。SSR 越高越强,成本越低越省。
Type I · 合同选择
四选一 · 构建时已执行验证 · 零 Worker 运行
该档位无分数(不适用)。
90 题响应成本$0.31
Type II · 任务切片
从准备好的中间工作区开始
SSR(严格成功率)
45.68%
95% CI:28.40% – 62.96%
平均估算推理成本$2.10
来源拆分(成功 / 样本)
BeyondSWE
17/4835.42%
SCBench
20/3360.61%
Type III · 完整任务
从原始状态开始 · 最终标准
SSR(严格成功率)
19.75%
95% CI:6.17% – 34.57%
平均估算推理成本$10.24
来源拆分(成功 / 样本)
BeyondSWE
13/4827.08%
SCBench
3/339.09%
关键发现
官网 findings · v0.1.0 · 校验于 2026-08-28Type II ↔ Type III 一致性
Spearman ρ = 0.9747
任务切片与完整任务的 Controller 排名高度一致。
Type II 相对 Type III
成本 -64.4%
切片评估显著降低推理成本,仍是有效代理指标。
核心策略发现
Core checks
跟踪进度、指导下一步、要求验证是 Controller 的关键能力。