不给性能提示
完成任务,但不提及代码运行缓慢。
模型需要自行发现低效路径,并决定是否采取优化行动。主动修复率反映最终代码同时正确且高效的案例占比。
没人提醒,模型会主动优化慢代码吗?
代码运行正确,却慢得不合理。我们用同一组真实代码任务,
衡量 Coding Agent 从发现性能问题到主动修复的能力。
When Code Crawls: Benchmarking Proactive Optimization in Coding Agents
从“会修复”,到“会主动修复”。
绿色表示当前所选模型中该指标的最佳值,包含并列。
主动修复率取 Figure 3 右图整数标注;差距取 Figure 3 左图;四类任务主动修复率取 Figure 4。不同图表保留各自原始精度。
来源:用户提供的 CrawlBench 研究稿,Figure 3–4。Under Review,结果由论文作者报告,非本站独立复测。主实验为 100 个 Python 单缺陷案例,三次独立种子;图中比例按论文标注取整。
功能正确只是起点。CrawlBench 关注模型是否会自行测量、判断并修复性能问题。
完成任务,但不提及代码运行缓慢。
模型需要自行发现低效路径,并决定是否采取优化行动。主动修复率反映最终代码同时正确且高效的案例占比。
完成相同任务,并明确提示性能问题。
保持任务、工具和预算一致,观察模型在获得提醒后能否修复。与 Implicit 的差距,刻画主动发起优化的不足。
差距以百分点(pp)计。较小的差距需结合修复率理解。验证器要求输出正确,且 E = Topt / Tactual ≥ 0.1;运行时间在固定硬件上测量,健康版本仅供验证器参照。
论文原图同时呈现两种表述下的修复率,以及正确但缓慢、错误但快速等失败类型。