记者刚刚从大晓机器人获悉,该公司近日联合南洋理工大学 S-Lab 等机构发布并开源统一多模态世界模型框架 Puffin-World。它首次将物理、几何和外观统一为三种原生 3D 世界状态,一个模型即可完成空间仿真、3D 生成重建和机器人闭环探索,四项评测达到 SOTA;代码、模型及 Puffin-16M 数据集同步开放。
Puffin-World 同步开源代码、模型和 Puffin-16M 数据集,包括 1500 万组视觉—语言—相机三元组和 100 万条具有挑战性的旋转轨迹,并开放覆盖 28 个公开数据集、约 4450 万张图像的绝对相机位姿标注,为机器人仿真、合成数据生产与具身智能训练提供可复现、可扩展的技术底座。
统一构建三种原生状态——物理、几何与外观
Puffin-World 从三维世界状态本身出发,将其建模为三种相互关联的原生状态:
物理状态:描述相机和观测视角在真实世界中的绝对朝向,包括重力场与纬度图。
几何状态:通过深度信息表达场景的三维结构、空间远近和表面关系。
外观状态:对应相机最终观察到的 RGB 图像。
三种状态共同构成从 " 世界如何存在 " 到 " 世界如何被交互 " 的完整表达。模型生成新视角时,不仅要回答画面应该是什么样,还要保证该画面在物理方向和三维结构上成立。

即使相机经历连续旋转和长轨迹移动,整个生成过程也拥有一个稳定的物理参照系。地平线不会随意漂移,场景的上下关系不会在运动中失真,生成视角与目标相机轨迹也能保持一致。
Puffin-World 还在同一次生成过程中联合输出 RGB 外观和深度几何,使生成结果能够直接用于三维重建,而不必在视频生成之后再依赖独立的深度估计模块补充空间结构。由此,世界生成与世界重建不再是前后割裂的两个步骤,而成为同一个状态预测过程。
一个模型完成四件事,从理解世界走向闭环探索
Puffin-World 可以在一个模型中统一四类过去往往需要不同系统分别完成的任务。
第一,单图理解相机物理信息。输入一张图片,模型能够结合地平线、垂直结构和场景构图进行空间推理,预测相机相对于真实物理世界的横滚角、俯仰角和垂直视场角,同时生成场景语义描述。模型不仅识别 " 图中有什么 ",还理解 " 当前视角以怎样的姿态看到了它 "。
第二,自由视点空间仿真。除文字描述外,用户还可以明确指定相机方向和视场角。模型据此生成符合目标机位的画面,使文生图从内容控制进一步走向精确的空间控制。
第三,三维世界生成与重建。模型可以从文字、单张图像或少量参考图像出发,按照指定相机轨迹生成多个新视角,并同步预测每个视角的外观和深度。不同视角随后可以汇聚为具有一致空间结构的三维世界。
第四,闭环自校准探索。当相机姿态偏离重力方向时,模型可以先感知当前物理状态,再推理需要执行的修正动作,并生成动作执行后的目标观察,由此形成 " 状态感知—动作预测—结果生成—再次校准 " 的闭环,高效扮演 World Action Model (WAM)角色。技术报告还展示了模仿式世界探索能力,即从同一初始视角出发,按照给定相机轨迹扩展并探索新的三维世界。
这四类能力并非四个模型的简单拼接,而是由同一套视觉、语言、相机和世界状态表征共同支撑。任务的变化不再依赖切换系统,而由输入内容、相机条件和视图角色决定。这种统一性,使 Puffin-World 更接近机器人从感知、推理到行动的完整工作链路。
1600 万核心数据与 4450 万开放标注,扩大世界模型训练底座
世界模型能否理解复杂空间,很大程度上取决于训练数据是否同时具备视觉内容、场景语义、绝对相机信息和多样化运动。为此,团队构建了 Puffin-16M 数据集,包含两个组成部分。
Puffin-Cam-15M 提供 1500 万组视觉—语言—相机三元组,覆盖室内、室外、真实和合成等多种场景,并包含不同分辨率、宽高比、相机姿态和视场角。它不仅告诉模型图像中有什么,还告诉模型这张图像是在怎样的相机观测条件下形成的。
Puffin-Traj-1M 则提供 100 万条具有挑战性的旋转轨迹,覆盖连续俯仰、横滚、偏航、复合运动以及 360 度环视等复杂情况,重点补足传统三维数据集在大幅旋转和长轨迹探索方面的不足。
与主要描述视角之间相对变化的数据不同,Puffin-16M 进一步引入相机相对于重力和真实世界的绝对方向。模型不仅学习 " 相机从上一帧移动了多少 ",还要理解 " 相机当前在世界中处于什么方向 "。
除自建数据集外,团队还利用 Puffin-World 精准的物理世界感知能力为 28 个公开数据集补充绝对相机位姿标注,覆盖约 4450 万张图片,包括 ImageNet、CC12M、Objects365、ScanNet、DL3DV 和 GPIC 等。标注内容包括横滚角、俯仰角和视场角,可用于研究不同视觉数据中的机位偏差,也可为相机条件生成、物理世界理解和空间智能训练提供大规模监督。
更重要的是,Puffin-World 同步开放代码、模型和数据集。开源的不只是一个算法实现,而是一套从数据、标注、训练到评测的完整技术链路,使研究机构和产业开发者可以围绕机器人仿真、合成数据、虚拟现实、三维内容生产与具身智能开展后续开发。
四项 SOTA,从相机理解到三维生成
Puffin-World 的统一能力在四项 Benchmark 中取得 SOTA 成绩。
在相机到真实世界理解任务上,Puffin-World 在 Stanford2D3D、MegaDepth、TartanAir 和 LaMAR 四个公开基准上取得最佳或并列最佳的中位误差,并在大多数 AUC 指标上领先。

从 " 生成一段看起来合理的视频 ",到 " 预测一个具有物理、几何和外观一致性的世界状态 ",Puffin-World 推动世界模型从视觉内容生成进一步走向可感知、可校准、可探索和可重建的三维环境。这也是世界模型真正进入机器人训练与具身智能应用所需要完成的一次范式转变。
项目链接:
https://kangliao929.github.io/projects/puffin-world/
代码链接:
https://github.com/KangLiao929/Puffin
Arxiv 链接:
https://arxiv.org/abs/2609.04196
Hugging Face 链接:
https://huggingface.co/blog/KangLiao/puffin-world