
作者丨幸丽娟
编辑丨岑 峰
2026 年,具身智能无疑迎来了最受瞩目的 " 爆发期 " 与 " 大考年 "。当大模型的浪潮席卷物理世界,那些在仿真环境中看似完美的算法,究竟能否在真实的复杂环境中存活?
2026 年 7 月 13 日至 17 日,带着对这一终极问题的探索,第 22 届 RSS 2026 在澳大利亚悉尼隆重举行。作为机器人领域公认的三大顶会之一,RSS 以其严苛的录用标准和独特的单轨制报告模式著称:主会期间只有一个主会场,所有参会者同时聆听同一场主会报告,确保每一篇论文都经得起全场数百位顶尖研究者的审视。
雷峰网 & AI 科技评论报道小组已抵达悉尼现场。在开幕首日,我们不仅看到了硬核的学术交锋,看到了中国产业力量的强势登场,更感受到了一种属于机器人研究者的独特氛围。
01
开幕式:一场 " 唠嗑式 " 开场致辞
7 月 13 日,RSS 2026 在悉尼国际会议中心开幕。大会主席 Luca Carlone 走上讲台,没有一板一眼地展示论文数据,而是像唠家常一样,把大家最关心的议程安排交代得明明白白。

接着,他将目光投向台下的学生群体,特别是第一次参会的年轻人,分享了两条发自内心的建议。
第一条建议关于社交:他鼓励大家,不仅要主动去和大牛搭话,更要珍惜和身边同龄人相处的机会。" 你今天认识的同龄人,可能就是未来这个领域的推动者,你正在为整个职业生涯积累人脉 "。
他风趣地分享了一个跟大牛做朋友的万无一失的办法,那就是 "等你现在的朋友变成大牛 "。他拿自己举例: 2012 年也是在悉尼,他和 Kris Hauser 等人都是谁也不认识谁的 " 无名小卒 ",大家天天泡在一起,聊天、吃饭,而十年后,他们轮流当上了会议主席。(注:Kris Hauser 是 RSS 2022 程序主席)
第二条建议关于心态。他说,现在机器人领域发展太快了,每天都有令人惊叹的新成果冒出来,但千万别因此焦虑,别觉得自己跟不上。" 你看到的那些炫酷视频,真实效果并没有拍的那么好 "," 你看到的是全世界几千个研究者加起来的总成果,不是哪一个人比你厉害多少 "。
他还提到,能来 RSS,你就已经站在机器人领域最高水平的赛场上了。和世界上最厉害的人同台竞技,有时确实会觉得吃力,但反过来想——你其实也正在和世界上最厉害的人并肩作战。
在论文投稿压力与同辈竞争焦虑交织的学术生态里,有人告诉你 " 你看到的没那么好 "、" 你不是一个人在面对 ",本身就是一种宽慰。而 Luca Carlone 带着幽默给出的这两条朴实的建议,比任何技术层面的指导都更让人感到温暖。
02
Oral 论文:从 " 怎么动 " 到 " 怎么思考 "
▎ "Manipulation 1" Oral 报告
伴随着他宣布 "RSS 2026 正式开幕 ",首个 Oral 报告环节 "Manipulation 1" 随即展开,由新加坡国立大学讲座教授 David Hsu 与斯坦福大学助理教授 Jeannette Bohg 共同主持。
9 篇论文依次亮相,主题集中于双臂操作、灵巧操作和接触丰富的操作任务,与近年来 RSS 论文风向从 " 单臂抓取 " 向 " 灵巧操作 " 演变的趋势高度吻合。

这 9 篇论文大致归为三个方向。第一个方向是数据效率与泛化,这也是最受关注的方向之一。
BiDemoSyn(Huayi Zhou, Kui Jia)提出从单个真实世界演示中合成数千个多样化双臂演示,解决了遥操作劳动强度大与模拟数据存在 sim-to-real gap 的核心矛盾。
DexImit(Juncheng Mu 等)则将单目人类操作视频自动转换为物理上合理的机器人数据,首次实现了从任意互联网视频到机器人灵巧操作数据的端到端转换。
SID(Yicheng Ma 等)另辟蹊径,在六个真实世界任务中,仅用两次演示就在分布外初始化下实现约 90% 的成功率,为少样本操作提供了新范式。
第二个方向是触觉与接触建模。
Contact-Grounded Policy ( CGP ) (Zhengtong Xu 等)通过预测未来接触结果并将其映射为可执行的控制器目标,在多指手灵巧任务上显著优于纯视觉和视觉触觉扩散策略基线。
Semantic-Contact Fields ( SCFields ) (Kevin Yuchen Ma 等)将视觉语义与密集接触估计统一为 3D 表示,在刮削、绘制和剥离任务上实现了稳健的类别级泛化。
TactAlign(Youngsun Wi 等)则提出用修正流将人类与机器人的触觉观测映射到共享潜空间,无需配对数据即可实现跨本体触觉迁移。
第三个方向是学习与数据策略。
Supervised Mixture-of-Experts (Lorenzo Mazza 等)针对手术操作的结构化特点,让五个专家分别负责五个任务阶段,仅凭不到 150 个演示就学会了复杂的长时程操作。
A Systematic Study of Data Modalities(Fanqi Lin 等)大规模考察了五种共同训练数据模态,发现视觉 - 语言数据与跨本体机器人数据的组合最有效。
UMI-Underwater(Hao Li 等)则开辟了全新场景——在陆地上采集人类演示,零样本迁移到水下抓取,彻底摆脱了对水下遥操作的依赖。
值得一提的是,这 9 篇论文中 " 华人含量 " 极高,有 4 篇的作者均为华人(BiDemoSyn 、 DexImit、SCFields、SID)、另有 4 篇有华人学者参与(CGP、A Systematic Study、UMI-Underwater、TactAlign )。
也就是说,9 篇中有 8 篇涉及华人作者,这一数据从侧面印证了中国学者在具身智能与机器人操作前沿领域的活跃度与竞争力。
▎ "World Models & Memory" Oral 报告
紧随 "Manipulation 1" 之后,"World Models & Memory" Oral 报告环节继续登场,由澳大利亚昆士兰科技大学(QUT)教授 Michael Milford 与香港大学助理教授李弘扬(Hongyang Li) 共同主持。
如果说 "Manipulation 1" 关注的是机器人 " 如何动 ",那这个环节则聚焦于机器人 " 如何思考 " 与 " 如何记忆 " ——通过构建内部的 " 世界模型 " 来预测未来、模拟环境,并借助记忆机制应对长时序任务。

第一个方向是视频生成与隐空间世界模型。
LingBot-VA(Lin Li 等)将视频预测与动作推理统一为因果序列,是全球首个开源的自回归视频 - 动作世界模型,在 RoboTwin 2.0 的 50 个双臂操作任务中成功率达 92.0%。
Interactive World Simulator(Yixuan Wang 等)则利用一致性模型同时进行图像解码和隐空间动力学预测,在单张 RTX 4090 上实现了超过 10 分钟、15 FPS 的稳定长时程交互模拟。
ViPSim(Longyu Chen 等)通过视觉空间与参数空间的协同,将末端执行器姿态的像素对齐投影、深度场景几何等显式空间先验与原始动作序列、相机矩阵等参数空间驱动相结合,确保长时程生成中几何边界与数值指令的统一约束。
第二个方向是模拟到现实的迁移。
Simulation Distillation(Jacob Levy 等)将模拟器中的结构先验蒸馏到潜空间世界模型中,再通过在线规划和短时域动力学微调实现快速真实世界适应。
HAIC(Dongting Li 等)则针对人形机器人提出了动力学感知的世界模型,仅从本体感受历史估计高阶物体状态,实现全身控制与物体操作的协调。
第三个方向是记忆增强与检索。
Memory Retrieval(Rutav Shah 等)聚焦于视觉运动策略中的记忆检索机制,通过基于注意力的记忆检索模块,使策略能够在长时程任务中调用相关历史经验。
RAG-Diff(Ruolin Ye 等)则通过检索增强的引导机制,将扩散策略适配到动态约束中。
第四个方向是策略学习与自我改进。
RISE(Jiazhi Yang 等)通过组合式世界模型实现策略的自我改进,在动态积木分类任务中提升超过 35%,背包打包提升 45%,盒子关闭提升 35%。
Act2Goal(Pengfei Zhou 等)探索如何从世界模型中蒸馏出通用的目标条件策略,实现对新物体、新空间布局和新环境的强零样本泛化能力。
从作者来看,"World Models & Memory"口头报告 9 篇论文全部都有华人学者参与,其中 5 篇作者全部为华人,延续了 "Manipulation 1" 环节的高华人占比态势。
03
Workshop:
长时程执行与灵巧操作的双线并进
当天,11 场 Workshop 同时召开,我们特别前往了香港大学助理教授李弘扬等人组织的 "Towards Robust Execution of Long-Horizon Whole-Body Control Tasks"(面向长时程全身控制任务的鲁棒执行)。

其中,清华大学的弋力(Li Yi)教授作为特邀嘉宾,带来了题为 《Beyond Imitation: Executable, Correctable, and Adaptable Skills for Humanoid Robots》(超越模仿:人形机器人的可执行、可修正、可适应技能)的报告。

另一场是 "4th Workshop on Dexterous Manipulation: Scalable Learning for Human-Level Skills" (第四届灵巧操作研讨会:面向人类级技能的可扩展学习)。灵巧操作作为今年 RSS 绝对的主角之一,这场 Workshop 的氛围异常 " 热闹 "。

在学习、规划与控制的协同方面,探讨无模型学习与控制理论的混合方法、通用策略与专用策略的取舍;
在数据、模拟与真实世界迁移方面,关注复杂接触建模与仿真加速、低成本遥操作系统开发以及策略鲁棒性;
在感知层面,讨论触觉与视觉的关系以及触觉传感器的最优利用;
在硬件层面,聚焦灵巧手的紧凑设计与耐用性;
在动态与强力操作方面,则探讨高频控制下的学习策略与安全柔顺性问题。
值得一提的是,方浩树(Hao-Shu Fang)作为去年该论坛的 Best Paper 获奖者,也受邀在该论坛上发表了演讲。
04
展台:中国具身智能力量的集中亮相
除了学术报告和 workshop,展厅里的产业展台同样人头攒动。智元机器人(AGIBOT)、Sharpa 与 千寻智能(Spirit AI) 三家中国公司,以铂金赞助商的身份亮相本届 RSS,收获了 Top 级关注。
智元机器人的展台前围了不少人。这次他们带来了完整的具身智能产品矩阵,全尺寸人形机器人 A2、紧凑型 X2、轮式工业机器人 G2、四足机器人 D1 都摆了出来。

Sharpa 的展台同样热闹。这家机器人公司的联合创始人正是禾赛科技的三位创始人李一帆、向少卿和孙恺。

千寻智能的展台前,讨论的声音也不小。这家 2024 年成立的公司,定位是构建机器人的 " 通用大脑 "。

三家企业,三种路径:智元从整机到灵巧手全栈布局,Sharpa 以灵巧手为支点撬动整机与模型,千寻智能则专注 " 通用大脑 " 这条模型赛道。但共同点是——它们都在用各自的方式回答同一个问题:具身智能如何从实验室走进现实。
从论文到产业,从研究到产品,RSS 2026 的展台让我们看到,具身智能正在加速走向现实。 雷峰网 雷峰网 雷峰网
05
写在最后
充实而高密度的 RSS 2026 首日落幕了。
在这里,我们听到了大会主席 " 不要焦虑,并肩作战 " 的温情建议;见证了 Oral 报告环节华人学者独占鳌头,以及机器人 " 如何动 "、" 如何思考 " 的学术风向演进;也看到智元、Sharpa、千寻智能等中国企业站上展台 C 位,用产品回应 " 具身智能如何落地 " 的时代命题。
大模型赋能下的机器人,正在以前所未有的速度,跨越从实验室到真实世界的鸿沟。正如我们今天所看到的现场论文分享和令人震撼的展台所展示的:具身智能的奇点已现曙光,它不再是遥远的科幻,而是在这群全球最聪明的大脑的日夜打磨中,悄然降临。
接下来 4 天,AI 科技评论将在 RSS 2026 现场持续带来报道,敬请关注。雷峰网雷峰网雷峰网
一个人读论文太孤单,一群人刷顶会才好玩。
RSS 2026 召开在即,我们正在召集一波含金量极高的 AI 研究者。群内主打实时论文跟踪与硬核技术探讨,拒绝灌水。
? 进群传送门: 扫码进群或添加微信 Luyoyo_2026,备注:论文群 + 关注的 AI 方向。
搞科研 / 搞技术,信息差很重要。
来,一起快人一步!
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲 PPT
大会报告全文
热门论文解读
学术新星访谈
扫描上方二维码
或点击「阅读原文」关注专区。