FEATURED RESEARCH / CrawlBench 探索主动优化评测 ↘
← 返回 Benchmark 目录
ALLE RESEARCH / FLAGSHIP BENCHMARK

CrawlBench

Under Review

没人提醒,模型会主动优化慢代码吗?

代码运行正确,却慢得不合理。我们用同一组真实代码任务,
衡量 Coding Agent 从发现性能问题到主动修复的能力。

When Code Crawls: Benchmarking Proactive Optimization in Coding Agents

11个模型100主实验案例218完整案例3独立种子

The Proactivity Leaderboard

从“会修复”,到“会主动修复”。

主动修复率 / 高者优先修复率 / %

来源:用户提供的 CrawlBench 研究稿,Figure 3–4。Under Review,结果由论文作者报告,非本站独立复测。主实验为 100 个 Python 单缺陷案例,三次独立种子;图中比例按论文标注取整。

THE QUESTION BEHIND THE SCORE

同一份代码,两种任务表述。

功能正确只是起点。CrawlBench 关注模型是否会自行测量、判断并修复性能问题。

01 / IMPLICIT

不给性能提示

完成任务,但不提及代码运行缓慢。

模型需要自行发现低效路径,并决定是否采取优化行动。主动修复率反映最终代码同时正确且高效的案例占比。

02 / EXPLICIT

明确指出代码很慢

完成相同任务,并明确提示性能问题。

保持任务、工具和预算一致,观察模型在获得提醒后能否修复。与 Implicit 的差距,刻画主动发起优化的不足。

Δ = Explicit − Implicit

差距以百分点(pp)计。较小的差距需结合修复率理解。验证器要求输出正确,且 E = Topt / Tactual ≥ 0.1;运行时间在固定硬件上测量,健康版本仅供验证器参照。

BEHIND THE LEADERBOARD

修复能力与主动性的距离。

论文原图同时呈现两种表述下的修复率,以及正确但缓慢、错误但快速等失败类型。

Figure 3 · 原稿研究图。完整案例集包含 100 个 Python 单缺陷案例、19 个双缺陷案例、20 个真实 PR 案例,以及 39 个 C 与 40 个 JavaScript 复现案例。
LET'S MEASURE WHAT MATTERS

你的模型,
会主动迈出下一步吗?

与 ALLE 研究团队讨论 Coding Agent 评测与合作。

联系研究团队 ↗
MODEL COMPARISON

选择模型

CrawlBench Figure 3 完整研究图
START A CONVERSATION

与研究团队交流

CrawlBench 研究与评测合作

hello@alleai.cloud ↗