关于ZAKER Skills 合作
36氪 8分钟前

对话前华为智驾 AI 一号位黄青虬:数据质量第一,模型架构第二

" 大数据是机器学习的驱动力 "。"AI 教母 " 李飞飞的这一结论,正被越来越多 AI 从业者接受和认同。其中也包括前华为 " 天才少年 "、墨奇智能 CTO 黄青虬。

在墨奇智能完成了十几亿元的天使轮系列融资后,36 氪在上海见到了黄青虬。他对 36 氪表示:" 假设数据质量无限高,再简单的模型也能训出很好的结果。"

在一众具身智能创企讲述的眩目故事中,黄青虬这套围绕数据的解题思路,显得很朴素,也很务实。

黄青虬是华为第二届 " 天才少年 ",2020 年他以这一身份加入华为车 BU,担任自动驾驶 AI 部门负责人。在华为期间,黄青虬先后主导攻克了激光感知的 AI 化、感知融合系统的 AI 化,以及在 ADS 4.0 阶段,整个辅助驾驶系统的 AI 化。

此外,他带领团队完成了华为自动驾驶数据工程从 0-1 的搭建。这项工作从 ADS 2.0 时期启动," 在 3.0 已经算是比较成型了 "。

在 ADS 2.0 时代,黄青虬主导搭建的数据体系只服务 GOD(通用障碍物检测网络),到了 3.0 时代除了 GOD,还服务所有的静态感知、红绿灯,甚至服务预测。到 4.0 时代,这套数据闭环体系已能够服务整个端到端。

正是这段深度介入数据工程的经历,为他如今投身具身智能创业,积攒了宝贵的方法论。

几乎所有具身智能创业者都认可,具身智能的终局是大规模走入家庭。而当前的具身机器人,之所以无法实现这点,一个重要原因在于,具身模型的泛化能力不够,也就是说,机器人的大脑还不够智能。

而要解决智能化的问题,黄青虬将数据工程视为破局的关键。在黄青虬看来," 模型架构其实是越简单越好 "," 假设数据质量无限高,再简单的模型,也能训出很好的结果 "。

他对 36 氪解释,模型的本质,其实是做信息的压缩、模态的转换,模型的能力上限,取决于参数量。大家对模型架构所做的改进,其作用更多的是在提高模型吸收数据的效率,对模型的能力上限影响相对低。而效率是能够用更多的数据、更长的训练时间弥补的。

因此,黄青虬提出,在当前高质量具身数据稀缺的阶段,数据工程的优先级要高于模型架构创新。

基于这样的认知,黄青虬为墨奇智能搭建了一套数据飞轮:

在数据采集环节,墨奇智能自研了轻便的穿戴式设备,在酒店或者商住公寓等各种商用场景,雇了许多保洁员进行数采。

" 采回来之后,就需要做严格的数据质量筛选。因为可能有些数据存在动作不准确、佩戴不规范等各种各样的情况,你需要把里面有效的数据筛出来。"

" 筛出来之后还要给它们做归类,保证我的数据虽然是海量的,但最终训练每一个模型要用哪些数据,我能精准地检索出来。"

归类之后,企业还对数据进行自动标注,打上训练需要的真值,最后用来训练模型。同时墨奇智能设计了多道防线,对模型做规模化的评测," 评测完后那些觉得不太好的场景,我们又重新回去采集、挖掘。"

黄青虬承认,自己这套数据工程的理念并不算少见,不久的将来,也会有越来越多从业者意识到,具身智能 " 需要一套类似于自动驾驶的数据闭环系统 "。

行业的数采方式也都在从遥操向便携式采集演进,因为遥操适合快速做出特定场景下的 demo,而泛化性有限。

可这并不等于,每家公司都能做好数据闭环。

黄青虬告诉 36 氪,能决定数据闭环体系的,有时正是 " 一些细节的问题 "。

他对 36 氪举了智驾里 " 重定位 " 这个例子。" 重定位 " 指的是,做真值的标注时,两辆车经过同样的地方,企业都希望第二辆车,可以复用此前标注过的数据,但这未必总能做到。因为这 " 需要第二辆车跟第一辆车的定位精度都足够高,保证它们之间能够严格匹配上 ",而许多公司 " 不一定能做到厘米级的重定位 "。

而在数据闭环系统里," 有成千上万这样的细节,每个细节都要做到极致,每个细节都有可能导致各家拉开差距 "。黄青虬对数据工程的深刻理解,正是得益于自动驾驶经历的赋能。在他的技术路线里,数据闭环是底层根基,自研原生具身模型,则是将数据价值最大化的必然一步。

在模型技术路线的选择上,黄青虬不希望给墨奇智能的模型,贴上世界模型或 VLA 的标签。他认为更应该关注的是两点,第一是输入什么、输出什么,第二是是否遵循端到端的训练范式。只要把这两大基础打牢,训练模型的手段可以随时换,无论 VLA 还是世界模型," 本质上只是阶段性的工具和插件 "。

黄青虬的理念是,未来墨奇智能一定要做自己的预训练,做一个原生的具身模型。

但在抵达这个阶段之前,墨奇智能会先通过后训练,快速积累真机经验和系统能力," 这个阶段已经过去了 "。目前,墨奇智能正基于开源模型去做预训练,大约在今年底,墨奇智能已积累足够数据时,便会从零开始训练自己的原生模型。

在公认与具身智能高度接近的自动驾驶行业,已经有 Momenta 等头部自动驾驶公司,在一定程度上印证了,借助数据工程抵达智能化这条路径的可行性,而在具身智能行业,这条路径是否仍能复用?这有待更多具身创企来验证。

以下是 36 氪与墨奇智能联合创始人兼 CTO 黄青虬的对话实录,内容经编辑:

谈自动驾驶经历:华为尝试过 VLA,发现不如 VA 系统后才暂停

36 氪汽车:华为 ADS 的 AI 化经历了什么样的过程?

黄青虬:华为最先开始 AI 化的是视觉感知跟激光感知。20 年的时候我进去,就是去做这个,大概在 20 年底、21 年初。最后落在了极狐上面。

当时我们把那种机械式激光雷达换成了半固态的激光雷达,就是现在车上大家看到的小帽檐。一开始大家都是顶着在脑袋上转的,就是我们说的机械式激光雷达。后来换成了半固态激光雷达之后,发现原来那套算法的性能下降非常明显,于是让我去搞定这个问题。

所以在 ADS 1.0 里面,我负责的事情主要就是把激光感知整个 AI 化了。AI 化之后确实发现效果很好,让我们坚定了后面一定要做多传感器融合、一定要自研激光。

到 ADS 2.0,我们开始做基于 AI 的融合感知,就是把原来激光、视觉各自 AI 化的东西融合到一起,让整个目标感知变成 AI 模型。

当时我们叫 BEV 前融合感知,有两个关键词,一个叫前融合,一个叫 BEV。前融合就是把视觉、激光全部放到神经网络,让神经网络自己去决定该信谁。BEV 就是给感知找到一个统一的表达空间。

这就把整个目标感知给 AI 化了,同时静态的感知也是 follow BEV 这一套,所以有动静态两个网络。同时在 2.0 时代我们还把高精地图去掉了,第一个做到了全国都能开。

到 ADS 3.0 开始全面上线 GOD,把 BEV 升级成 GOD 之后,原来系统只能感知车、人这些白名单,到 GOD 时代就能感知所有的障碍物,地上扔个麻袋、掉个铁片都能感知到。这就相当于把整个感知的 AI 能力又往前提了一步。

然后在 ADS 4.0,我们又更近一步,把感知规控并到了一起,开始做端到端。所以整个系统就被 AI 化了。

它是从一个小的点——激光、视觉先 AI 化,到整个融合感知 AI 化,到最后把规控也并进来,把整个系统变成 AI 模型。

36 氪汽车:也就是从 AI 化一个点,然后扩展到一个两段式,再到一段式。你刚才提到全国都能开,这个是余承东对外宣传的,华为终端的对外产品化攻势,对你后面技术研发的节奏有没有什么影响?

黄青虬:我觉得肯定有比较大的影响。产品能起来,技术只是一方面,商业肯定也很重要。

比如说我们为什么能够去做后面的 GOD 跟端到端,核心是因为我们有数据,有数据的前提是你有车,有车的前提是能把车卖出去。所以这一切都是环环相扣的。

华为智驾开始爆发发生在 ADS 2.0,那时候除了技术上做到全国都能开,做到刚才说的前融合、把安全避障做到很好,此外就是问界 M7 那个车确实在那个阶段卖爆了。所以整个技术跟商业化都在那个阶段得到了比较大的进步。

36 氪汽车:我经常开华为 ADS,能体会到华为每一代的体验是线性往上的,有些车企的体验可能是忽上忽下的,一到技术代际更替,水平就倒退回去了。这背后是什么决定的?

黄青虬:我觉得背后有两个原因。第一个是华为的准出标准非常严格,不管你用什么,最终的准出标准就是用户体验跟安全等。

我们会经过内部的从单元测试、仿真测试,到实车的泛化测试,再到 Beta 用户的测试,中间测试流程可能持续好几个月。只有经过严格测试的版本才会去发,保证每个发出去的版本都是质量靠谱、比上一代有提升的。这是第一个,质量管控体系很严格。

第二个就是整体来讲,华为其实比较务实,不会说我觉得这个技术很 fancy,我就一定要用这个。

比如说大家都在炒 VLA 概念的时候,我们内部并不是没有试过。在内部我们也有预研的小组在尝试 VLA,跟以 VA 为核心的端到端一直在做对比。

最终对比出来发现,确实用了更大的参数量,但并没有额外的收益。或者说在同等的算力下,跑出来还不如 VA 这套系统。

基于这个,我们就判断,虽然 VLA 这个词在业界、学术界炒得很热,但可能现阶段并不是自动驾驶真正所需要的。

谈数据工程:假设数据质量无限高,再简单的模型也能训练出很好的结果

36 氪汽车:我看你之前的访谈里面也提到,对数据很重视。为什么现在大家都不怎么谈模型架构、技术路线这些东西,都在说数据,数据是现在解题的点吗?

黄青虬:首先,数据处理的工作量会比改模型结构更大。因为数据它需要更细致去分析,哪怕是自动驾驶,一上来就是 1000 万个 clip,或者说 10 万小时级的数据。这里面细节非常多,所以你需要深入分析,花的时间会更多。

但对模型来讲,可能我改一个结构,一个小时就改完了,剩下时间它其实都在跑实验。那等到实验出来之后,我再去分析结果。需要人投入的工作量其实不是特别大,需要的反而是灵感,以及有足够的卡(算力)去支撑我做实验。

其次,现阶段我认为数据确实会更重要一点。假设数据质量无限高,再简单的模型也能训出很好的结果。而我们在做模型架构的改进,更多的是提高它吸收数据的效率,对模型能力上限的影响其实没有那么大,可能远远不及参数量的影响。而现阶段,具身的高质量数据是远远不足的,相对来讲,模型的能力上限是过剩的。

也就是说数据才是当前的那个短板,那我们要提高整个系统的能力,自然应该花更多精力去补短板。

36 氪汽车:那现在墨奇整个数据团队或者数据的流程是怎么去搭建的?

黄青虬:我们搭了一套完整的数据闭环系统。首先单采集那个环节会跟车不太一样,我们自己做了这种穿戴式的设备,第一站是在这些酒店以及一些商住公寓,雇了很多阿姨去做数据的采集。

采回来之后,就需要做质量的筛选。因为可能有些动作不规范的,或者佩戴不正确的,反正各种各样的情况,你需要把里面有效的数据筛出来。

筛出来之后还要给它们做归类,保证我的数据虽然是海量的,但最终训练每一个模型要用哪些数据,我能精准地做搜索。比如今天要十万个叠衣服的,明天要一百万个放杯子的,我要有一个数据挖掘系统,给这些数据打上标签,保证随时能挖掘我想要的数据。

挖掘完之后,下一步我们叫 AutoLabel(自动标注),这也是在自动驾驶做过的,就是给所有数据打上自动标注,打上训练需要的真值 ground truth,最后送进训练。训练完之后还有这么多道防线做规模化的评测,评测完后那些觉得不太好的场景,我们又重新回去采集、挖掘。这就是整个数据飞轮。

36 氪汽车:你这套数据理念是现在具身行业里面比较少见的吗?

黄青虬:我觉得可能今天也不算少,大家都会慢慢意识到,需要这么一套类似于自动驾驶的数据闭环系统,大家都在搭,只是说各家搭得怎么样的问题。另外数据采集的方式,整个行业也基本在从遥操走向这种便携式采集的演进,就看谁跑得快。

而且大家都在做这个的情况下,其实也是有差距的。比如今天自动驾驶大家也都知道要建数据闭环系统,但其实各家的数据闭环系统还是有差距的。

36 氪汽车:差距主要来自于哪里?资源吗?

黄青虬:我觉得不只是资源,因为它里面可能有上千个模块,在这数据闭环系统里面,这上千个模块做得好跟不好,有时候就是一些细节的问题。

举个例子,我们有个东西叫重定位。因为做真值的标注时,比如今天这个地方有一辆车跑过去,我已经标注过一遍了,AutoLabel 跑过一遍了,人工 check 过一遍了,那下一辆车再从这里经过的时候,我肯定希望已经标注好的东西可以直接复用,而不是再去标一遍,因为是相同的地方。

这时候就需要第二辆车跟第一辆车的定位精度都足够高,保证它们之间能够严格匹配上。这个事我觉得很多公司不一定能做到厘米级的重定位。这个就是一些区别。

在这个数据闭环系统里,有成千上万这样的细节,每个细节都要做到极致,每个细节都有可能导致各家拉开差距。

36 氪汽车:其实还是要看公司对整个数据闭环体系的理解是不是够深刻,那你的理解来自于哪里?是因为在华为 ADS 深度介入过整个数据工程吗?

黄青虬:对,整个数据工程正好就是我们从零到一建起来的,在 ADS 2.0 时期开始建,在 3.0 已经算是比较成型了。

在 2.0 时代建立的时候是用于服务 GOD,在 3.0 时代就开始用数据闭环系统去服务其他感知模块,比如道路感知、红绿灯等等。

到 4.0 时代系统走向了端到端,数据闭环体系就去服务整个端到端。所以基本上从零到一、到能够支持百万规模量产的这么一个体系的数据闭环系统,全生命周期我正好都经历过,所以可能会更有心得。

谈具身智能模型:还不会数采,就碰预训练和原生模型意义不大

36 氪汽车:在模型上你愿意贴一个什么标签吗?比如世界模型还是 VLA?

黄青虬:我觉得模型上,所谓世界模型、VLA(视觉语言动作模型)这些东西,可能只是一些工具吧。我们其实不太倾向于说只能去押注某一个技术点,在我看来它们甚至都不矛盾。

比如说 VLA,它是什么含义呢?如果你是说模型需要有 vision(视觉),需要 language(语言),需要 action(动作),那这个显然是对的。因为具身里面就是需要看到画面,需要人给你一个指令让你去干啥,然后你去做一个动作,这个毫无疑问是正确的。

但是如果你说 VLA 是需要去靠一个 VLM(视觉语言动作模型),然后去增加一个 action 的头去做后训练,那我觉得这个肯定只是一个很短期的范式。

长期来讲,我不可能去依赖一个 VLM 作为我的 backbone(主干网络),因为 VLM 的优化目标天然就不是为机器人量身定制的,在它的基础上去做后训练,能得到的优化肯定是比较少的。我肯定是要原生去做自己的预训练,做一个具身的原生模型。

然后 World Model(世界模型),它的定义当然有很多。但比较常用的一种,在我看来它其实也只是一种辅助训练的工具。在自动驾驶的时候大家也会用,在输入 vision、language,输出 action 的同时,我再让它去输出另一个 vision,就是 next-frame prediction(下一帧预测),去做 3D 的生成也好、隐空间的生成也好、下一帧的视频生成也好,它本质上只是一个辅助训练的手段。

这个手段我当然可以用,但这并不排斥我的模型架构是什么。所以它们中间我觉得并没有矛盾的点,大家吵来吵去好像也没什么必要。

36 氪汽车:更应该关注的是用什么方式去实现什么样的结果。

黄青虬:对,我觉得核心要抓住的就两个点。第一个,你的输入输出要什么?比如输入要不要触觉?这个其实很关键,在我们看来是需要的。

输出你可能需要动作,但额外需要一些辅助输出去帮助模型收敛、加快收敛,你可以输出一些视频信息、语言信息,甚至输出一些感知信息,都是没问题的。输入输出是你模型设计的关键。

第二个关键是端到端,这个还是我们比较坚信的原则。端到端的好处就是能让你的梯度从最末端传到最前端,所以你可以让整个模型去做全局的最优,至少你在理论上有可能找到全局最优。相比分段式的,中间断了一层,你就不可能是系统的全局最优。

这两个是关键的:看输入什么输出什么,以及要去遵循端到端的训练范式。

至于说在下一层,你到底是多用一些 VLA 的训练手段和辅助任务,还是用 World Model 的辅助任务多一点,我觉得都不是特别关键。而且我相信明年还会有新的词出来。

但不管什么技术范式出现,只要你把基础打牢了,更本质地去讲,就是什么输入什么输出,以及整个端到端,那些东西其实随时也可以替换。

36 氪汽车:那墨奇智能现在的模型也是自己从零到一去做吗?还是也是 fine-tune(微调)一个开源的东西?

黄青虬:我们模型会分三阶段走,节奏会跟着数据积累的进度来推进。

第一阶段我们只做后训练,大概在成立一两个月的时候,快速通过后训练去积累真机以及做数据采集的能力,这是第一阶段的目标,这个阶段已经过去了。

第二阶段是从三、四月份到现在,我们会基于开源的模型权重做初始化,然后去做我们的基模训练。

然后第三阶段,等数据积累和预训练技术储备达标后,我们会进入第三阶段,完全从零开始训练原生具身模型,预计时间窗口在今年年内。原生基模我们也是从 3-7B 左右开始,再逐步扩大参数量。

36 氪汽车:你怎么看这里面各个模块的工作权重?比如预训练、模型搭建、后训练、数据工程。

黄青虬:我觉得不同阶段的权重是不一样的。

比如一开始上来你就去碰预训练,其实意义不是特别大,因为你都不知道数据怎么采,真机怎么调。你肯定得先把整个流程跑通。

能最快跑通的,就是我拿一个开源模型做后训练,能快速把整个 pipeline(流程链路)跑通,知道怎么调真机,知道真机训练需要什么数据,从而能去指导数采设备的设计,以及整套数据闭环链路的搭建。

这一过程完成之后,整个系统跑起来了,那就要去做进一步的优化。在做进一步优化的时候,发现数据量还不够,那能做的就是基于一个开源模型去开始做预训练,而不是从零开始。

这一阶段跑完之后,数据量也上来了,最后阶段我就可以连开源模型都不用了。它是层层递进的。

36 氪汽车:前几天 LeCun 对大语言模型有些抨击,他觉得这是学术界的太刻意划分的分野,您刚才说后期可能开源模型也不用了,那以后具身智能用的东西是不是跟大语言模型没什么关系了?有可能出现这种情况吗?

黄青虬:我觉得长远来讲,具身模型的路径会跟大语言模型不一样。因为具身的模型结构设计,我觉得其实比大语言模型要难很多。具身模型要用一个比大语言模型小一百倍、一千倍的参数量,去吸收一个比语言模型大一千倍、一万倍的输入。那我的模型吸收效率肯定要比大语言模型高好几万倍,甚至几千万倍,那具身模型结构设计肯定是需要更精巧一点的。

谈具身智能硬件:朝着百万级的量产目标设计关节

36 氪汽车:现在机器人硬件不成熟,你有想过抓住某一个关键环节切入吗?比如有些公司以灵巧手为切入点。

黄青虬:我们自己不会专门去投入一个硬件零部件,然后以这个零部件作为公司的核心壁垒。我们去做硬件的唯一目标是:如果哪个零部件对我们的研发进度造成了阻塞,我们可能会去碰这个零部件,但如果这个零部件当前不是瓶颈,我们就不会去碰。

比如说关节,我们其实自己在自研的,核心就是市面上的这些关节的一致性或者说质量没有达到我们想要的状态,同时如果跟外部供应商去做迭代又会比较慢,而关节的可靠性、一致性和响应速度,是我们算法执行的关键变量。所以我们选择了自研。

灵巧手我们暂时就没有在做,因为我们试了下人戴上一个夹爪其实可以完成一个房间清洁可能超过 70% 的任务,但算法当前只能完成不到 5%,所以我们判断执行器不是现阶段的阻塞点,我们可以用一个更成熟更便宜的执行器先让算法往前迭代。

36 氪汽车:关节怎么会影响算法迭代?

黄青虬:会的,比如三台机器,关节的一致性做得很不好,你跑上去发现算法在这台机器成功了,另一台机器失败了。那到底是硬件的问题还是算法的问题呢?。

36 氪汽车:但这个行业已经催生了这么多上市公司了,竟然还没解决一致性问题吗?

黄青虬:我觉得这个行业的成熟度,远没有大家想得那么高。

36 氪汽车:那墨奇智能设计的话,大概根据什么样的指标去设计?上千级别还是上万级别的一致性?

黄青虬:我们肯定是冲着百万量产级别的工艺去设计的,百万这个数字听着很吓人,但其实也并不夸张,一台机器人身上就有二三十个关节,百万关节对应到的也就是几万台机器人。

当然做的时候肯定也不是连里面的齿轮都自己去磨,肯定是联合供应链,只是说我们会从买整个成品关节,推进到把它打开,自己去做里面的设计。所以我们更多的是在设计跟质量的管控上,我们能够更深入地去做,并不是说真的要从设计、制造、生产全部自己做。

谈商业化:工业积累不出家庭智能,泛化能力强的模型需要泛化的场景

36 氪汽车:你们为什么会选择酒店场景呢?中国的保洁工资都很低。

黄青虬:当时我们在看的时候,大的行业就分这么几个:工业、物流、服务业、以及家庭,一共四个。

我们觉得选什么场景就意味着你能收回来什么数据,收回来什么数据就决定你能训出什么模型。

如果我要训练出泛化能力足够强的模型,就需要场景的泛化性足够高。那显然工业跟物流是不满足这个要求的,因为工业跟物流都是很垂直的单个原子动作。能选的就只有服务行业跟家庭。

但现在要进家里,一个是能力确实不够,一个是家里其实有隐私安全的问题,能回流回来的数据会比较少,所以家庭现阶段进入太早了。

最后就是剩下的就是服务行业。服务行业好处是任务的泛化性比较高、而且具备渐进式进入的可行性,就是你前期干得慢没关系,因为里面是很多任务的集合,一个机器人干得慢,可以上多个。

36 氪汽车:墨奇智能预计多少年之内能走向大批量的商业化?

黄青虬:我们是朝着酒店和公寓这个相对比较难的场景在做,在提高基础模型的能力,但实际上在基础模型能力不断变强的过程中,会有一些能力外溢到其他场景。

比如酒店里面要放矿泉水、要把矿泉水摆好,这个动作在零售里面就是补货,实际上也可以去覆盖零售行业。比如酒店里面要把毛巾摆好、把脏的东西放到布草车、放到垃圾桶,这个跟物流行业的分拣其实是类似的。

所以这些能力的外溢,我们从今年下半年开始,就会根据在酒店的进展去积累能力,不断去找一些垂直场景做落地。

今年我们会启动酒店场景的 POC (项目前期概念验证)验证,在跑通单店模型后逐步推进规模化落地。

36 氪汽车:有人跟雷军交流后,雷军给他的建议是,你要先从工业开始做,因为工业是最难的,把工业做好之后再一步一步往轻量化的商业走,最后走向家庭、酒店。这个路径你怎么看?

黄青虬:这个路径我们其实并不是很认同,核心是我认为工业难以涌现家庭智能。

工业场景的很多工位本身多样性比较弱,以工业数据为主要来源,我觉得是难以训练出一个泛化性很强的基础模型的。

工业场景可以积累技术标准,可以积累硬件的可靠性,在基础模型能力比较强之后去落地我觉得也没问题。

但如果在现阶段,在基础模型和能力不够强的情况下,强行去工业落地,可能会变成定制化算法开发,偏离我们做通用机器人的初衷。

作者微信:luckg17305264638

相关标签
36氪

36氪

让创业更简单

订阅

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容