ALLE AI LAB / PHYSICAL AI 研究与评测 ↗
ALLE AI LAB / GAME AGENT BENCHMARK

让 Agent
在世界里行动。

FROM SPATIAL SCENES TO GAME RUNTIMES
把“理解世界”,变成可验证的行为。

Physical AI 需要的不只是视觉输入。它需要在有几何、有时间、有状态的环境中观察、行动、等待反馈,并把结果交给验证器。

81游戏运行时环境
3D空间、运动与模拟世界
7引擎与运行时生态
100%运行时可观察结果
01 / ENVIRONMENT ATLAS

一个世界,四层行为证据。

一台运送货物的机械体,一段有障碍的路。空间关系、感知、行动与验证,在同一个世界里接续发生。

MISSION / DELIVERY

带着货物绕开障碍,
进入绿色交付区。

自建行为示意 · 非评测轨迹
01 / SCENE GRAPH空间与对象
AGENT / 货物OBSTACLE / 禁入GOAL / 交付区
OBJECTS03
EXTENT12 × 8 m
FRAMEWORLD
场景已建立 · 对象边界可读取t = 0.00 s
WORLD / OBJECT GRAPH

先有一个可以行动的世界。

机械体、障碍和目标区拥有独立的几何边界;网格中的位置与场景对象一一对应。

POSITION · GEOMETRY · TARGET
SCENEOBSERVEACTADVANCE TIMECHECK RESULT
02 / VERIFICATION PIPELINE

从真实需求,到可回归证据。

每个环境都有 starter、受限修改范围、运行入口和 verifier。任务开放实现路径,但结果必须通过行为检查。

01 / SOURCE

真实工作流

从游戏开发意图中提取可运行任务。

02 / CONTRACT

行为契约

记录状态、时序、边界与隔离条件。

03 / PROBE

运行探针

施加输入,读取运行时状态变化。

04 / REWARD

诊断奖励

用 verifier 判定通过、拒绝与回归。

STARTER MUST FAILREFERENCE MUST PASSSTATE ISOLATIONORDER MATTERSNO STATIC SHORTCUT
03 / WHY THIS IS PHYSICAL AI

不只是写代码,而是让世界继续运行。

题目把一个真实工作流放回引擎:角色要移动,物体要碰撞,HUD 要更新,服务端要拒绝非法状态,时间要按规则前进。

01 / GEOMETRY

空间有约束

相机边界、墙体、Chunk、锚点、射线和刚体让“位置”成为真正的系统状态,而不是 UI 上的一行数字。

02 / DYNAMICS

行动会改变世界

点击、移动、冲量、购买、拖拽和远程事件会触发后果。错误动作必须被拒绝,重复动作不能制造第二份状态。

03 / FEEDBACK

结果可以回放

探针读取位置、遥测、回调、快照、日志和实体状态,验证 agent 是否完成了行为链,而不是只检查文件内容。

04 / MEASURED ON SCIENTIFIC TASKS

让训练带来的进步,看得见。

游戏检验长期决策,3D 检验空间与状态契约。两类环境,共同构成可回放的行为证据。

01 / GAME AGENT BENCHMARKQWEN3.5

游戏中的决策能力。

公开基准任务集 · Qwen 实验结果 · 指标为任务完成率(%)

训练前训练后0–100
Qwen3.5-9B+15.9 pts
32.3
48.2
Qwen3.5-27B+18.9 pts
32.6
51.5
Qwen3.5-35B-A3B+20.8 pts
34.9
55.7
Qwen3.5-122B-A10B+21.4 pts
43.5
64.9

Game Agent Benchmark 是公开任务基准;左侧展示 Qwen 在同一任务集上的训练前后实验对比,不代表该基准的官方榜单成绩。

02 / 3D EMBODIED BENCHMARKICML 2025 ORAL

EmbodiedBench:Qwen 的空间推理。

四个模拟环境 · 1,128 个测试实例 · 指标为 task success rate(%)

训练前 / paper训练后 / measuredsuccess rate %
EB-ALFRED高层规划 / 拾取、打开、放置
72B
39.7
51.2
+11.5
7B
4.7
28.4
+23.7
EB-Habitat长程规划 / 导航与物体重排
72B
37.7
49.6
+11.9
7B
14.3
35.2
+20.9
EB-Navigation低层控制 / 视觉导航与空间关系
72B
40.0
57.3
+17.3
7B
20.3
39.2
+18.9
EB-Manipulation机械臂操作 / 7D action vector
72B
16.2
37.5
+21.3
7B
9.6
27.1
+17.5

训练前数据来自 EmbodiedBench 论文;训练后数据来自同四项任务的复测结果。

PAPER / EMBODIEDBENCH ↗OFFICIAL RESULTS ↗
81 GAME TASKS4 EMBODIEDBENCH ENVIRONMENTS3D TASKSREPLAYABLE VERIFIERS
05 / CAPABILITY MAP

从空间控制,到长期状态。

81 道游戏环境按 agent 要恢复的能力聚合,而不是按题号逐题陈列。3D 世界与游戏世界在这里共享同一套行为标准。

服务端与多人系统17Remote、玩家、插件、房间与权威状态。
持久化与状态15存档、身份、背包、快照与恢复。
物理与空间行为14移动、碰撞、射线、几何与相机。
UI 与输入交互12HUD、菜单、输入、拖拽与玩家反馈。
渲染与资产管线12材质、模型、粒子、灯光与资源。
时序与运行时控制11生命周期、波次、事务、逐帧推进与场景执行。
28Unity22Godot16Luau / Roblox11Minecraft Paper02C++01Node.js01HTML5
START A CONVERSATION

你的下一个任务是什么?

选择方向,整理一份合作需求。

此预览暂未接入联系渠道。需求仅在本地生成,不会发送或上传。