覆盖真实科学来源
结合学科关键词扩展,发现带有数据、代码与研究背景的公开仓库。
将真实科研工作流,变成模型可学习的世界。
从公开科学仓库出发,交付有数据、有沙盒、
有参考解、有验证器的训练环境。
占收集仓库的比例
学科占比据论文 Figure 3;流线为合成过程示意,不表示各任务类别的实际流量。
完整复现、局部执行、缺失补全、科学纠错。
每一种任务,训练科研 Agent 的不同能力。
基于输入数据,独立规划并执行完整科学工作流,产出可验证的分析结果。
仓库发现 → 任务合成 → 质量验证。
可修复的失败样本,经诊断与修订后重新验证。
结合学科关键词扩展,发现带有数据、代码与研究背景的公开仓库。
提取可执行种子程序,依据数据依赖关系,派生四类互补任务。
检查数据完整性、执行与答案复现、评分逻辑,以及科学任务和程序的一致性。
六个科学 Agent Benchmark。
三种模型规模,一致的训练前后提升。
来源:POSEIDON 稿件 Table 2(第 7 页)。图中为成功率(%),pp 表示百分点;SciCode 主任务与子任务、BixBench MCQ 与开放回答分别计列,共 8 列,归属 6 个 Benchmark。论文处于 ICLR 2027 在审状态,结果为作者报告,非已录用结论或客户效果保证。
咨询 PEARL 目录、样例、数据许可和交付方式。
与研究团队交流 ↗97,659 个环境为论文研究规模;可提供范围与许可按项目确认。