APP下载

关于ZAKER

合作

量子位 09-11

李飞飞一年前究竟说了啥？怎么又火了

大语言模型的局限在哪里？

AI 教母李飞飞这样说：

大自然中是没有语言存在的，你不会从天空中直接看到文字。

语言是一种纯粹的生成的信号。

语言信号的输出主要基于人类给的输入信号，可以说，语言是不独立于人之外的。

然而，物理世界是客观存在的。所以提取、理解、生成 3D 世界的数据、实现空间智能和处理语言问题时截然不同。

没想到，李飞飞一年前的访谈被扒出来，又引发大量围观。

她这段话意味着，大语言模型或许还不是真正的智能。

真正的智能将是信号感知、物理以及和现实世界相结合的产物。

下面来看看大家还在热议些啥吧。

空间智能可以借鉴语言模型，但仍存在本质差异

这场讨论的焦点在于，现在基于语言信号训练的模型到底懂不懂物理世界的常识。

首先，回顾一下李飞飞的说法。

她认为语言模型及当今的多模态语言模型的底层表示是一维的。它们在根本上就是操作于离散 token 的一维序列上，所以模型对于书面文本这种一维序列的表示是非常自然的。

然而，在处理空间智能问题时，核心是世界的三维本质。

虽然多模态大语言模型也能看图像，但它是将其他模态硬塞进这种一维 token 序列的底层表示中，这种一维且由人类生成的数据，可能无法很好地表示物理世界，造成信息损失。

如果直接让模型处理 3D 数据，那么表示类型与模型旨在执行的任务类型之间将会有更好的匹配。

而空间智能的挑战就是在于从这个真实世界中提取、表示和生成信息。

除了这个维度上的差异，从更哲学的角度来说，她认为语言是一种纯粹由生成产生的信号。自然界中并不存在预设的语言形式，也就是说语言不能独立于人类之外。

大模型能够通过学习并反刍所输入的数据，无论输入什么样的数据，模型都能用足够的泛化能力处理语言任务。这是因为语言，或者说文本的本质允许模型在生成范式下表现得出色。

与语言不同，3D 世界是真实存在于外部的。这个世界遵循着物理定律，并因材料等多种因素而具有其自身的结构。

因此，要让模型倒推出 3D 世界的信息，并能够表示和生成它，在技术层面上，空间智能可以借鉴语言模型，但从哲学的范畴来看，这两者仍存在本质差异。

有人举了一堆例子来证明李飞飞的观点，同时说明语言模型在理解物理世界时确实有局限。

基于语言信号训练的模型在物理世界任务中表现差

比如用一个小实验来测试 Claude 3.5 Sonnet、GPT-4o、Gemini 1.5 Pro 三个多模态大模型的物理常识，并与人类儿童表现做对比。

研究用Animal-AI这个用来测试动物和人工智能体物理认知的 3D 环境来测试大模型，让大模型通过前进 / 后退、左转 / 右转、环境描述与规划控制三个指令控制一个小角色在虚拟环境中完成任务。

第一个实验是让大模型完成一些简单的任务，如直接找到小球，还有一些稍难的任务，如躲开障碍物找到小球。

结果发现模型只能搞定最简单的任务，稍难一点就不行了。

第二个实验是在第一个实验的基础上增加教学案例，比如演示正确做法，结果模型表现也没有明显的提升。

对比之后再看，这些大模型的表现远不及人类儿童，也比不上专门为这个环境测试的机器人。

还有其他研究团队设计了一个名为ABench-Physics的工具，专门用来测试大语言模型在物理推理方面的能力，核心就是想搞清楚这些模型到底能不能真的理解物理、解决物理问题。

测试分两部分，Phy A 由 400 道竞赛级别的物理难题组成，先给大模型来个基础测试。

Phy B 属于动态部分：修改 Phy A 中题目的数字，但不改变物理原理，用来测试大模型能不能进行灵活的物理推理。

结果显示，最厉害的模型在 Phy A 上的正确率只有 43%，而在 Phy B 中模型的平均准确率下降了 22.5%。

这说明模型并不是真懂物理。

还有团队用视觉任务测试大模型，比如让模型判断照片中哪些物体更近，或者匹配相同的事物。

人类对这些任务的正确率能达到 95.7%，而几个模型最高的正确率仅有 51%。在视觉感知上，大模型还远不及人类。

这些结果都进一步证明了李飞飞之前访谈中关于大模型理解真实物理世界局限性的观点。

也得到了网友们的认同。

模型的开发确实正在扩展到将模型建立在物理与多模态理解的基础上。

讨论升级

当然了，有正方就有反方。

有人先是反驳了关于语言的论述。

也有人认为，在某些情况下，语言描述现实的能力可能会比感知更优。

还有人说模型的语言不用局限于人类的语言、文本等，人工智能或许能创造出自己的语言来理解物理世界。

或者，我们该思考，用语言训练大模型取得现有成就的根本因素又是什么呢？

对于这场讨论，你又有什么样的看法呢？

参考链接：

[ 1 ] https://x.com/rohanpaul_ai/status/1965242567085490547

[ 2 ] https://www.youtube.com/watch?v=vIXfYFB7aBI

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法！

— 完 —

专属 AI 产品从业者的实名社群，只聊 AI 产品最落地的真问题 扫码添加小助手，发送「姓名 + 公司 + 职位」申请入群～

进群后，你将直接获得：

最新最专业的 AI 产品信息及分析

不定期发放的热门产品内测码

内部专属内容与专业讨论

点亮星标

科技前沿进展每日见

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

ZAKER旗下免费视频剪辑工具

全国首位机器人博士生入学上戏：跨界攻读戏剧与影视

快科技 2小时前

出口量第一自主汽车品牌奇瑞通过港交所聆讯；MiniMax全球发布音乐生成模型；追觅汽车德国建厂寻址

钛媒体 3小时前

支付宝推国内首个“AI 付”

21世纪经济报道 3小时前

AI时代入口竞争的巨变：从场景心智到角色心智

钛媒体 4小时前

给GPT-5泼冷水！谷歌DeepMind CEO：当前AI难达博士水平

快科技 4小时前

微软Windows 11任务栏将迎网速测试功能：但本质还是Bing工具

快科技 6小时前

微软Windows 11增加新全屏广告！提醒续费Microsoft 365

快科技 7小时前

“娃哈哈”商标争议？宗馥莉或启用新品牌“娃小宗”，半年前注册

21世纪经济报道 7小时前

王兴兴、朱啸虎们说了些AI创业真心话

36氪 7小时前

海盗船内存频率之争败诉！过去7年买过的美国人都能索赔

快科技 8小时前

AMD携手武汉纺织大学计算机与人工智能学院，共启AI+纺织创新篇章

快科技 10小时前

日本补贴7000亿日元美光将研发下一代DRAM内存

快科技 10小时前

加拿大留子回国买iPhone，“反向海淘”的苹果，有多香？

钛媒体 11小时前

果粉隐藏福利：iPhone Air单镜头内藏史上首见功能

快科技 11小时前

暴力熊首款显卡水冷头！专为ROG夜神RTX 5090定制比RTX 5070都要贵

快科技 11小时前

量子位

觉得文章不错，微信扫描分享好友

宙世代元宇宙

元宇宙党建解决方案

元宇宙文旅解决方案

元宇宙展厅解决方案

元宇宙行业峰会解决方案

元宇宙营销解决方案

元宇宙会展解决方案

元宇宙演艺节目解决方案

元宇宙博物馆解决方案

元宇宙图书馆解决方案

元宇宙校园解决方案

元宇宙企业展厅解决方案

元宇宙艺术展解决方案

元宇宙电商解决方案

融媒体解决方案

ZAKER智慧云

媒体解决方案

党建解决方案

公检法解决方案

智慧交通解决方案

高校解决方案

AI视频

AI视频剪辑

视频定制服务

AI智能客服

我的订阅

李飞飞一年前究竟说了啥？怎么又火了

宙世代

一起剪

相关阅读

全国首位机器人博士生入学上戏：跨界攻读戏剧与影视

出口量第一自主汽车品牌奇瑞通过港交所聆讯；MiniMax全球发布音乐生成模型；追觅汽车德国建厂寻址

支付宝推国内首个“AI 付”

AI时代入口竞争的巨变：从场景心智到角色心智

给GPT-5泼冷水！谷歌DeepMind CEO：当前AI难达博士水平

微软Windows 11任务栏将迎网速测试功能：但本质还是Bing工具

微软Windows 11增加新全屏广告！提醒续费Microsoft 365

“娃哈哈”商标争议？宗馥莉或启用新品牌“娃小宗”，半年前注册

王兴兴、朱啸虎们说了些AI创业真心话

海盗船内存频率之争败诉！过去7年买过的美国人 都能索赔

AMD携手武汉纺织大学计算机与人工智能学院，共启AI+纺织创新篇章

日本补贴7000亿日元 美光将研发下一代DRAM内存

加拿大留子回国买iPhone，“反向海淘”的苹果，有多香？

果粉隐藏福利：iPhone Air单镜头内藏史上首见功能

暴力熊首款显卡水冷头！专为ROG夜神RTX 5090定制 比RTX 5070都要贵

最新评论

量子位

热门推荐

热门订阅 换一批

布谷财经

Z科技

海盗船内存频率之争败诉！过去7年买过的美国人都能索赔

日本补贴7000亿日元美光将研发下一代DRAM内存

暴力熊首款显卡水冷头！专为ROG夜神RTX 5090定制比RTX 5070都要贵

热门订阅换一批