Research archive / Benchmark

让模型能力
可以被证明。

Benchmark 不只是排行榜。它帮助模型公司在训练前选数据、训练中找回归、发布前做验收,并把每一次实验变成可复用的能力证据。

Benchmark systems / Research overviewFigure 01
Benchmark 研究与评测框架Task · Data · Programmatic verification
Core evidence

围绕训练与发布决策,保留可复查的评测记录。

12Benchmark
训练前 / 训练中 /
发布前决策节点
1统一任务、版本、测试
与成本记录协议
Selected research archive

研究项目清单

Graph / ReasoningR / 01

GraphArena

Evaluating and Exploring Large Language Models on Graph Computation

10 项图计算任务,覆盖多项式时间与 NP-complete 挑战,并将结果区分为正确、次优、幻觉和缺失。

图任务Agent 评测10 项任务