01 · WHAT WE SELL

alleai.cloud

ALLE AI Lab
我们是一个
高质量基模数据基础设施团队

为模型公司建设支撑训练与验证、可持续采购的数据基础设施与 Benchmark。我们从 Coding Agent 起步,把真实任务、执行环境和评测体系沉淀为长期可复用的能力资产,并沿着 Code2World 逐步扩展到空间智能场景。

数据生产 × 能力测量 × 结果交付
一句话解释客户为“证明模型能做什么”付费,我们把证明过程做成可持续采购的基础设施。
02 · VALUE CREATED

我们的价值在哪里?

客户向我们购买三类可交付产品:Benchmark、Agent 轨迹与测试数据,以及在我们环境中的训练服务。

我们卖的不是一次性的测试报告,而是基模公司可以持续采购的 Benchmark、数据与训练服务

01 · BENCHMARK

训练前:买 Benchmark

用统一任务和指标判断训练数据与能力方向是否值得投入。

02 · TRAJECTORY + TEST

训练中:买轨迹与测试数据

购买 Agent 在 Benchmark 中产生的轨迹、测试用例和结果证据。

03 · TRAIN IN ENVIRONMENT

在我们的环境里训练

基模公司直接使用执行环境训练和迭代 Agent,获得真实反馈。

客户是谁

所有基础模型公司、Agent 公司、云厂商、模型应用平台,以及需要模型验收和能力对比的大型企业。

客户为什么愿意买

模型推理成本、工具使用、视觉交互和长期规划都需要新的评价尺度。Benchmark 还可以持续产出高价值的 Agent 训练数据。

03 · WHY NOW

为什么是现在?
中国模型公司数据预算从蒸馏转向采购

中国公司过去更多投入蒸馏和模型训练,如今开始把预算前移到数据采集、任务构造和动态评测;美国 Frontier labs 的投入也在逐年上升。

数据采购与 Benchmark 评测预算增长趋势

统一人民币口径 · 1 USD ≈ ¥7.2
美元数据同时标注原值

中美数据采购与 Benchmark 评测预算增长趋势 按实际金额绘制的增长曲线,统一换算为人民币亿元。按 1 美元约合 7.2 元人民币计算,中国预算从十亿元增长到五十亿元以上,美国预算从约一百零八亿元人民币增长到约二百一十六亿元人民币。 ¥240 亿 ¥180 亿 ¥120 亿 ¥60 亿 ¥0 ¥10 亿¥20 亿¥50 亿+ $15 亿$22 亿$30 亿 202420252026
中国:数据采购 + Benchmark 评测预算(人民币)美国:数据采购 + Benchmark 评测预算(按汇率折算为人民币)
THE SHIFT

预算从蒸馏,转向数据

模型越强,越需要可信的能力证据来指导训练、迭代和采购。

过去两年蒸馏优先
现在开始采集数据
新的刚需动态 Benchmark
为什么预算会持续增加:模型升级越快,评测迭代越频繁;从训练前选数据、训练中找回归,到发布前验收和上线后采购,每一个节点都需要新的任务和新的 Benchmark。
05 · MOAT

怎么样做到壁垒?
公司核心能力:数据管线

我们用可部署的任务系统承接真实交互,用核心数据管线沉淀为 Benchmark 产品。

01

进入任务场景

Coding Agent、OJ 和多模态 AI 游戏开发平台。

02

记录执行证据

操作轨迹、版本、测试、工具调用、成本与环境反馈。

03

构造评测体系

设计任务、约束、指标、难度和可复现的评测协议。

04

交付 Benchmark

面向训练、回归测试、模型选型和客户验收提供产品。

从 Coding Agent 走向 Code2World

构建可生成、可执行、可回放、可验证的交互式世界,为下一代空间智能和 Agent 模型提供环境、数据与 Benchmark。

01

Coding Agent 环境

用 Coding + OJ 验证任务执行、轨迹记录和评测闭环。

02

Code2World / 交互式世界平台

用代码、规则和任务描述生成可执行、可回放、可验证的交互式世界。

03

世界状态数据

记录状态、动作、观测、环境转移、反馈和任务结果。

04

World Model Infrastructure

条件成熟后增加世界状态生成、模拟和策略评测能力。

Coding

Coding Agent Benchmark

从代码生成走向完整任务完成:规划、编辑、运行、修复和验证。

Environment platform

Code2World Environment Platform

从代码、规则和任务描述生成可执行、可回放、可验证的交互式世界,为 Agent 提供环境、数据与 Benchmark。

World model

世界模型 Benchmark

面向世界状态表征、行动、反馈和长期规划的下一阶段评测体系。

04 · WHY US

为什么是我们?

团队组合覆盖教育场景、Agent 系统、数据工程、模型推理和 Benchmark 研究;团队中有港科大(广州)十余位博士生,适合从真实任务切入构建长期数据资产。

资琛义

CEO · Founder

AI Researcher、连续创业者和产品负责人。研究领域涉及 Agent reasoning、Physical AI、图表示学习和 AI infrastructure / data commerce。

  • GaussDB 铜牌 · ICM/MCM F奖(1%)
  • 国家奖学金 · 全国数学联赛一等奖
  • 第一篇 CCF-A 论文发表在 NIPS,为首个图提示 Benchmark

个人主页 ↗

陈傲川

CTO

清华本科背景,现为 HKUST(GZ) 博士生,同学青云计划,研究覆盖 Scalable ML、Agent推理、图算法和参数高效训练。

  • 清华奖学金 · 青山资本优秀创业者
  • 美国利弗莫尔国家实验室实习
  • ICASSP Top 3% · 多篇顶会一作

OpenReview 主页 ↗

李佳

CSO · Research Lead

香港科技大学(广州)数据科学与分析学域副教授、DSAIL 教授,与 CreateLink 联合实验室联合主任。

  • Google AI · 腾讯微信支付风控经历
  • KDD 2023 Best Paper
  • 百篇 CCF-A 论文 · 长期产出 Benchmark 与数据集研究

个人主页 ↗

Founder-Market Fit:CEO 理解真实用户场景,CTO 能把 Agent 研究落成系统,CSO 能定义任务和评测标准。职历、职务和论文状态以正式简历、任职证明及论文页面为准。
APPENDIX · WORLD STATE DATA

下一步要做的——世界状态数据

世界状态数据不是抽象的“视频数据”,而是可生成、可执行、可回放、可验证的交互式世界中的 Agent 任务轨迹:系统知道发生了什么、采取了什么动作、环境如何变化,以及任务是否完成。

01 · DATA FORM

一条可回放的任务轨迹

用统一结构记录每一步的状态、动作、观测、环境转移、反馈和最终结果。

  • 代码 / 视觉 / 工具调用
  • 规则、对象、相机与任务目标
02 · BUYERS

模型公司与交互产品团队

面向模型公司、AI 游戏公司、Computer Use 团队和机器人团队,提供数据、评测或环境使用权。

  • 训练与后训练团队
  • 模型验收和策略评测团队
03 · QUALITY

用结果验证数据质量

每条轨迹都要能重放、能复现、能解释失败,并在训练或 Benchmark 中产生可观测增益。

  • 转移一致性与回放确定性
  • 任务成功率、人工复核与模型增益
06 · WHAT WE HAVE DONE

现在已经做了什么?

产品、真实部署、客户订单和产业合作共同验证:我们能把研究成果转化为可交付的 Benchmark 与源数据系统。

商业与产品证据

Product

Coding 数据管线已打通

已有 AITA + Coding Agent + OJ 系统设计,支持任务、轨迹、版本、测试和评分证据的统一记录。

Deployment

真实教学场景落地

系统已由香港科技大学(广州)DSA 系主任推广,并获得校长肯定及支持;目前已有 5 位老师、300+ 学生准备使用。

Orders

已有业务验证

Coding Agent 数据相关订单总额已超过百万元,多位中国顶级基模公司为潜在客户;合同主体、回款与交付情况以尽调材料为准。

Partnership

Unity 中国合作探索

正在与 Unity 中国围绕 AI 游戏开发、可控场景生成和多模态数据开展合作,共同探索面向世界状态建模的真实交互场景。

十篇以上 CCF-A 论文 Benchmark

港科大(广州)顶级科研团队

CP-Agent

反馈驱动的编程 Agent

围绕竞争性编程、执行反馈、风险控制和成本-准确率权衡。

R³-Bench

预算约束下的推理 Benchmark

围绕共享预算、资源理性推理和模型能力评估。

Track record

多项公开 Benchmark 成果

包括 GraphArena、GLBench、GADBench、BatteryLife、SimXRD-4M、AlgBench 等。

APPENDIX · SEED FINANCING

第一轮种子轮 1,000 万,先把Benchmark 做成基础设施

融资节奏围绕能力建设分阶段推进:本轮融资后进入 Coding Benchmark 规模化和 Code2World 环境原型,后续轮次再扩大世界状态数据;模型层升级以数据规模、客户需求和算力条件成熟为前提。

Round 01 · Seed¥1,000 万

计划融资额 · 用于进入第 1-2 轮阶段

本轮资金要买到的核心能力

把已经打通的 Coding 数据管线变成可规模化的生产系统,同时启动 Code2World 环境原型和世界状态数据研究。

研究与工程团队Coding 规模化Code2World 原型合规与交付基础设施
建议资金配置 · 可按报价调整
合规数据生产与采购¥350 万 · 35%
Researcher 与工程团队¥300 万 · 30%
环境平台、算力与执行环境¥200 万 · 20%
合规、交付与预备金¥150 万 · 15%
APPENDIX · STAGED ROADMAP

阶段目标:从 Coding Agent 到交互式世界基础设施

路线不是从 Coding 数据直接跳到 World Model,而是沿着 Code2World 逐步建设:先验证 Agent 完成软件任务,再让代码、规则和任务描述生成可执行环境,最终沉淀世界状态、动作轨迹与评测能力。

阶段 1 · Seed → Pre-ASCALE

Scale Coding Agent Benchmark

把 Coding Agent 场景做成可重复交付、可持续采购的 Benchmark 产品。

产品形态 Coding Agent + OJ 执行环境 + 任务、轨迹、测试和评分数据。
阶段 2 · Pre-A → Series ABUILD

Build Code2World

把 Coding Agent 的执行能力延伸到可生成、可执行、可回放、可验证的交互式世界。

产品形态 Code2World 环境平台,支持环境生成、Agent 操作、状态观测、回放和评测。
阶段 3 · Series A → Series BSCALE

Scale World-State Data

把 Agent 在环境中的观察、动作和环境变化沉淀为世界状态数据。

产品形态 世界状态数据集、动作轨迹、Benchmark 和环境使用权。
阶段 4 · Series B 以后OPTIONAL LAYER

Agent / World Model Infrastructure

在数据规模和客户需求成熟后,为 Agent 和 World Model 提供生成、模拟和策略评测能力。

产品形态 环境 API、世界状态生成、动作后果预测和策略评测服务。

Coding Agent Benchmark → Code2World → 世界状态与动作轨迹 → Agent / World Model 基础设施。