不给性能提示
完成任务,但不提及代码运行缓慢。
模型需要自行发现低效路径,并决定是否采取优化行动。主动修复率反映最终代码同时正确且高效的案例占比。
没人提醒,模型会主动优化慢代码吗?
代码运行正确,却慢得不合理。我们用同一组真实代码任务,
衡量 Coding Agent 从发现性能问题到主动修复的能力。
When Code Crawls: Benchmarking Proactive Optimization in Coding Agents
从“会修复”,到“会主动修复”。
绿色表示当前所选模型中该指标的最佳值,包含并列。
主动修复率取 Figure 3 右图整数标注;差距取 Figure 3 左图;四类任务主动修复率取 Figure 4。不同图表保留各自原始精度。
来源:用户提供的 CrawlBench 研究稿,Figure 3–4。ICLR 2027 在审,结果由论文作者报告,非本站独立复测。主实验为 100 个 Python 单缺陷案例,三次独立种子;图中比例按论文标注取整。
功能正确只是起点。CrawlBench 关注模型是否会自行测量、判断并修复性能问题。
完成任务,但不提及代码运行缓慢。
模型需要自行发现低效路径,并决定是否采取优化行动。主动修复率反映最终代码同时正确且高效的案例占比。
完成相同任务,并明确提示性能问题。
保持任务、工具和预算一致,观察模型在获得提醒后能否修复。与 Implicit 的差距,刻画主动发起优化的不足。
差距以百分点(pp)计。较小的差距需结合修复率理解。验证器要求输出正确,且 E = Topt / Tactual ≥ 0.1;运行时间在固定硬件上测量,健康版本仅供验证器参照。
论文原图同时呈现两种表述下的修复率,以及正确但缓慢、错误但快速等失败类型。
12 项既有研究,覆盖图推理、算法、科学预测与语言金融;与上方主打 CrawlBench 共同构成 13 项研究展示。

10 项图计算任务,覆盖多项式时间与 NP-complete 挑战。

9 类图算法任务,覆盖多级难度,观察长上下文与过度思考。

10 个真实图异常检测数据集与 29 类模型。

整合 16 个数据集,覆盖多种电池格式、化学体系与充放电协议。

3,000 多道原创题,覆盖 27 种算法,评估推理模型的算法理解。

组合 6 种预训练方法、5 种 Prompt 方法与 15 个数据集。
覆盖监督与 zero-shot 场景,统一比较 GraphLLM 方法与传统基线,评估大语言模型在图学习任务中的表现。
提供 4,065,346 条模拟粉末 XRD 图谱,覆盖 119,569 个晶体结构和 33 种模拟条件,用于晶体对称性分类。
面向动态图异常检测,覆盖 10 个数据集与 25 类模型,系统比较不同模型在时间变化图结构中的检测能力。
中英文金融 LLM 综合 Benchmark,覆盖 8 类金融 NLP 任务,用于评估金融知识、理解、推理与生成能力。
统一评测点预测与分布预测,覆盖多种时间序列、预测跨度与不确定性建模设置。
中文对话式机器阅读理解 Benchmark,包含 831 段对话、4,742 个对话轮次,覆盖 33 个领域与 few-shot 泛化设置。