FEATURED RESEARCH / CrawlBench 探索主动优化评测
ALLE RESEARCH / FLAGSHIP BENCHMARK

CrawlBench

没人提醒,模型会主动优化慢代码吗?

代码运行正确,却慢得不合理。我们用同一组真实代码任务,
衡量 Coding Agent 从发现性能问题到主动修复的能力。

When Code Crawls: Benchmarking Proactive Optimization in Coding Agents

11个模型100主实验案例218完整案例3独立种子

The Proactivity Leaderboard

从“会修复”,到“会主动修复”。

主动修复率 / 高者优先修复率 / %

来源:用户提供的 CrawlBench 研究稿,Figure 3–4。ICLR 2027 在审,结果由论文作者报告,非本站独立复测。主实验为 100 个 Python 单缺陷案例,三次独立种子;图中比例按论文标注取整。

THE QUESTION BEHIND THE SCORE

同一份代码,两种任务表述。

功能正确只是起点。CrawlBench 关注模型是否会自行测量、判断并修复性能问题。

01 / IMPLICIT

不给性能提示

完成任务,但不提及代码运行缓慢。

模型需要自行发现低效路径,并决定是否采取优化行动。主动修复率反映最终代码同时正确且高效的案例占比。

02 / EXPLICIT

明确指出代码很慢

完成相同任务,并明确提示性能问题。

保持任务、工具和预算一致,观察模型在获得提醒后能否修复。与 Implicit 的差距,刻画主动发起优化的不足。

Δ = Explicit − Implicit

差距以百分点(pp)计。较小的差距需结合修复率理解。验证器要求输出正确,且 E = Topt / Tactual ≥ 0.1;运行时间在固定硬件上测量,健康版本仅供验证器参照。

BEHIND THE LEADERBOARD

修复能力与主动性的距离。

论文原图同时呈现两种表述下的修复率,以及正确但缓慢、错误但快速等失败类型。

Figure 3 · 原稿研究图。完整案例集包含 100 个 Python 单缺陷案例、19 个双缺陷案例、20 个真实 PR 案例,以及 39 个 C 与 40 个 JavaScript 复现案例。
MORE FROM ALLE / RESEARCH ARCHIVE

完整 Benchmark 研究目录

12 项既有研究,覆盖图推理、算法、科学预测与语言金融;与上方主打 CrawlBench 共同构成 13 项研究展示。

GraphArena 研究配图
GRAPH / REASONING

GraphArena

Evaluating LLMs on Graph Computation

10 项图计算任务,覆盖多项式时间与 NP-complete 挑战。

GrAlgoBench 研究配图
GRAPH / REASONING

GrAlgoBench

Graph Algorithm Problems for Reasoning Models

9 类图算法任务,覆盖多级难度,观察长上下文与过度思考。

GADBench 研究配图
GRAPH / ANOMALY

GADBench

Supervised Graph Anomaly Detection

10 个真实图异常检测数据集与 29 类模型。

BatteryLife 研究配图
SCIENCE / FORECASTING

BatteryLife

Battery Life Prediction

整合 16 个数据集,覆盖多种电池格式、化学体系与充放电协议。

AlgBench 研究配图
ALGORITHM / REASONING

AlgBench

Understanding Algorithms

3,000 多道原创题,覆盖 27 种算法,评估推理模型的算法理解。

ProG 研究配图
GRAPH / PROMPT LEARNING

ProG

A Graph Prompt Learning Benchmark

组合 6 种预训练方法、5 种 Prompt 方法与 15 个数据集。

GRAPH / LLM

GLBench

A Comprehensive Benchmark for Graph with Large Language Models

覆盖监督与 zero-shot 场景,统一比较 GraphLLM 方法与传统基线,评估大语言模型在图学习任务中的表现。

SCIENCE / VISION

SimXRD-4M

Big Simulated X-ray Diffraction Data and Crystalline Symmetry Classification Benchmark

提供 4,065,346 条模拟粉末 XRD 图谱,覆盖 119,569 个晶体结构和 33 种模拟条件,用于晶体对称性分类。

GRAPH / DYNAMIC ANOMALY

BAG

Benchmarking Anomaly Detection on Dynamic Graphs

面向动态图异常检测,覆盖 10 个数据集与 25 类模型,系统比较不同模型在时间变化图结构中的检测能力。

FINANCE / LLM

Golden Touchstone

A Comprehensive Bilingual Benchmark for Evaluating Financial Large Language Models

中英文金融 LLM 综合 Benchmark,覆盖 8 类金融 NLP 任务,用于评估金融知识、理解、推理与生成能力。

SCIENCE / FORECASTING

ProbTS

Benchmarking Point and Distributional Forecasting across Diverse Prediction Horizons

统一评测点预测与分布预测,覆盖多种时间序列、预测跨度与不确定性建模设置。

LANGUAGE / MRC

Orca

A Few-shot Benchmark for Chinese Conversational Machine Reading Comprehension

中文对话式机器阅读理解 Benchmark,包含 831 段对话、4,742 个对话轮次,覆盖 33 个领域与 few-shot 泛化设置。

LET'S MEASURE WHAT MATTERS

你的模型,
会主动迈出下一步吗?

与 ALLE 研究团队讨论 Coding Agent 评测与合作。

联系研究团队
MODEL COMPARISON

选择模型

CrawlBench Figure 3 完整研究图
START A CONVERSATION

与研究团队交流

CrawlBench 研究与评测合作

hello@alleai.cloud ↗