真实工作流
从游戏开发意图中提取可运行任务。
Physical AI 需要的不只是视觉输入。它需要在有几何、有时间、有状态的环境中观察、行动、等待反馈,并把结果交给验证器。
一台运送货物的机械体,一段有障碍的路。空间关系、感知、行动与验证,在同一个世界里接续发生。
带着货物绕开障碍,
进入绿色交付区。
机械体、障碍和目标区拥有独立的几何边界;网格中的位置与场景对象一一对应。
POSITION · GEOMETRY · TARGET每个环境都有 starter、受限修改范围、运行入口和 verifier。任务开放实现路径,但结果必须通过行为检查。
从游戏开发意图中提取可运行任务。
记录状态、时序、边界与隔离条件。
施加输入,读取运行时状态变化。
用 verifier 判定通过、拒绝与回归。
题目把一个真实工作流放回引擎:角色要移动,物体要碰撞,HUD 要更新,服务端要拒绝非法状态,时间要按规则前进。
相机边界、墙体、Chunk、锚点、射线和刚体让“位置”成为真正的系统状态,而不是 UI 上的一行数字。
点击、移动、冲量、购买、拖拽和远程事件会触发后果。错误动作必须被拒绝,重复动作不能制造第二份状态。
探针读取位置、遥测、回调、快照、日志和实体状态,验证 agent 是否完成了行为链,而不是只检查文件内容。
游戏检验长期决策,3D 检验空间与状态契约。两类环境,共同构成可回放的行为证据。
Game Agent Benchmark 是公开任务基准;左侧展示 Qwen 在同一任务集上的训练前后实验对比,不代表该基准的官方榜单成绩。
训练前数据来自 EmbodiedBench 论文;训练后数据来自同四项任务的复测结果。
PAPER / EMBODIEDBENCH ↗OFFICIAL RESULTS ↗81 道游戏环境按 agent 要恢复的能力聚合,而不是按题号逐题陈列。3D 世界与游戏世界在这里共享同一套行为标准。