训练前:买 Benchmark
用统一任务和指标判断训练数据与能力方向是否值得投入。
为模型公司建设支撑训练与验证、可持续采购的数据基础设施与 Benchmark。我们从 Coding Agent 起步,把真实任务、执行环境和评测体系沉淀为长期可复用的能力资产,并沿着 Code2World 逐步扩展到空间智能场景。
客户向我们购买三类可交付产品:Benchmark、Agent 轨迹与测试数据,以及在我们环境中的训练服务。
我们卖的不是一次性的测试报告,而是基模公司可以持续采购的 Benchmark、数据与训练服务。
用统一任务和指标判断训练数据与能力方向是否值得投入。
购买 Agent 在 Benchmark 中产生的轨迹、测试用例和结果证据。
基模公司直接使用执行环境训练和迭代 Agent,获得真实反馈。
所有基础模型公司、Agent 公司、云厂商、模型应用平台,以及需要模型验收和能力对比的大型企业。
模型推理成本、工具使用、视觉交互和长期规划都需要新的评价尺度。Benchmark 还可以持续产出高价值的 Agent 训练数据。
中国公司过去更多投入蒸馏和模型训练,如今开始把预算前移到数据采集、任务构造和动态评测;美国 Frontier labs 的投入也在逐年上升。
统一人民币口径 · 1 USD ≈ ¥7.2
美元数据同时标注原值
模型越强,越需要可信的能力证据来指导训练、迭代和采购。
我们用可部署的任务系统承接真实交互,用核心数据管线沉淀为 Benchmark 产品。
Coding Agent、OJ 和多模态 AI 游戏开发平台。
操作轨迹、版本、测试、工具调用、成本与环境反馈。
设计任务、约束、指标、难度和可复现的评测协议。
面向训练、回归测试、模型选型和客户验收提供产品。
构建可生成、可执行、可回放、可验证的交互式世界,为下一代空间智能和 Agent 模型提供环境、数据与 Benchmark。
用 Coding + OJ 验证任务执行、轨迹记录和评测闭环。
用代码、规则和任务描述生成可执行、可回放、可验证的交互式世界。
记录状态、动作、观测、环境转移、反馈和任务结果。
条件成熟后增加世界状态生成、模拟和策略评测能力。
从代码生成走向完整任务完成:规划、编辑、运行、修复和验证。
从代码、规则和任务描述生成可执行、可回放、可验证的交互式世界,为 Agent 提供环境、数据与 Benchmark。
面向世界状态表征、行动、反馈和长期规划的下一阶段评测体系。
团队组合覆盖教育场景、Agent 系统、数据工程、模型推理和 Benchmark 研究;团队中有港科大(广州)十余位博士生,适合从真实任务切入构建长期数据资产。
AI Researcher、连续创业者和产品负责人。研究领域涉及 Agent reasoning、Physical AI、图表示学习和 AI infrastructure / data commerce。
清华本科背景,现为 HKUST(GZ) 博士生,同学青云计划,研究覆盖 Scalable ML、Agent推理、图算法和参数高效训练。
香港科技大学(广州)数据科学与分析学域副教授、DSAIL 教授,与 CreateLink 联合实验室联合主任。
世界状态数据不是抽象的“视频数据”,而是可生成、可执行、可回放、可验证的交互式世界中的 Agent 任务轨迹:系统知道发生了什么、采取了什么动作、环境如何变化,以及任务是否完成。
用统一结构记录每一步的状态、动作、观测、环境转移、反馈和最终结果。
面向模型公司、AI 游戏公司、Computer Use 团队和机器人团队,提供数据、评测或环境使用权。
每条轨迹都要能重放、能复现、能解释失败,并在训练或 Benchmark 中产生可观测增益。
产品、真实部署、客户订单和产业合作共同验证:我们能把研究成果转化为可交付的 Benchmark 与源数据系统。
已有 AITA + Coding Agent + OJ 系统设计,支持任务、轨迹、版本、测试和评分证据的统一记录。
系统已由香港科技大学(广州)DSA 系主任推广,并获得校长肯定及支持;目前已有 5 位老师、300+ 学生准备使用。
Coding Agent 数据相关订单总额已超过百万元,多位中国顶级基模公司为潜在客户;合同主体、回款与交付情况以尽调材料为准。
正在与 Unity 中国围绕 AI 游戏开发、可控场景生成和多模态数据开展合作,共同探索面向世界状态建模的真实交互场景。
港科大(广州)顶级科研团队
围绕竞争性编程、执行反馈、风险控制和成本-准确率权衡。
围绕共享预算、资源理性推理和模型能力评估。
包括 GraphArena、GLBench、GADBench、BatteryLife、SimXRD-4M、AlgBench 等。
融资节奏围绕能力建设分阶段推进:本轮融资后进入 Coding Benchmark 规模化和 Code2World 环境原型,后续轮次再扩大世界状态数据;模型层升级以数据规模、客户需求和算力条件成熟为前提。
把已经打通的 Coding 数据管线变成可规模化的生产系统,同时启动 Code2World 环境原型和世界状态数据研究。
路线不是从 Coding 数据直接跳到 World Model,而是沿着 Code2World 逐步建设:先验证 Agent 完成软件任务,再让代码、规则和任务描述生成可执行环境,最终沉淀世界状态、动作轨迹与评测能力。
把 Coding Agent 场景做成可重复交付、可持续采购的 Benchmark 产品。
把 Coding Agent 的执行能力延伸到可生成、可执行、可回放、可验证的交互式世界。
把 Agent 在环境中的观察、动作和环境变化沉淀为世界状态数据。
在数据规模和客户需求成熟后,为 Agent 和 World Model 提供生成、模拟和策略评测能力。
Coding Agent Benchmark → Code2World → 世界状态与动作轨迹 → Agent / World Model 基础设施。