关于ZAKER Skills 合作
太平洋电脑网 2小时前

机器人赛道开始卷大脑了!智元具身大模型登顶 DailyOmni 权威榜单

【太平洋科技快讯】7 月 28 日,智元官方公众号宣布,智元自研的具身原生全模态大模型 WITA-Omni Preview,凭借领先的音视频联合理解与时序推理能力,以 85.21 分综合成绩登顶具身全模态理解权威榜单 DailyOmni 榜首,超过千问、Gemini、豆包、英伟达等国内外领先模型,并在八项细分指标中的六项取得第一。

图片来源:智元官方公众号,下同

据了解,DailyOmni 是业内公认衡量音视频时序匹配、跨模态联合推理能力的第三方权威榜单。和常规图文、短视频评测任务不同,榜单采用大量真实开放环境音视频素材,重点考核模型融合视觉、音频信息,分辨声画对应关系、事件时序与跨模态语义的能力,高度贴合人形机器人在真实环境人机交互所需的感知核心能力。

架构创新:拓展 Thinker – Talker 范式,新增 Actor 实现具身交互

对具身机器人而言,感知理解与动作反馈并非割裂流程,而是连贯的物理交互过程。 WITA-Omni 没有简单将通用对话模型移植至机器人,而是把肢体动作、面部表情提升至与语音同等优先级输出,打造端到端原生具身交互架构 Thinker – Talker – Actor。

性能优势:分层数据集搭配三阶段训练策略

WITA-Omni 的性能领先并非依靠盲目扩充模型参数,而是来自一套围绕具身全模态交互构建的分层 数据体系与针对性训练方法。

在中训练阶段,WITA-Omni 整合千万小时级自有与开源多模态数据,强化图文基础能力,构建可完成视听联合推理的全模态底座。

模型采用 SFT-OPD-RL 三段式训练流程,让模型自主判断场景中该不该回应、何时回应、对谁回应。

行业价值:端到端架构推动具身智能落地

智元此次登顶 DailyOmni 榜单,证明 WITA-Omni 在物理世界视听时序理解任务具备差异化优势,也是行业首款面向机器人原生打造的端到端多模态交互大模型。

该模型的突破不止拓展模态覆盖范围,而是让机器人在统一时序、统一认知框架下同步完成感知、决策、输出。

太平洋科技

太平洋科技

PConline官方号,以科技敬生活。

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容