关于ZAKER Skills 合作
差评 30分钟前

全网最抽象科研项目,靠打游戏上 Nature 的机会真来了?

这可能是,普通人距离发 Nature 最近的一次。而且这篇 Nature,还和一个游戏有关?

事情是这样的,江江最近去了一趟西湖大学参观。在路过一个 AI 实验室的时候,发现了这样一幕:一哥们在工位上狂开火箭,导师来了也丝毫不慌。

江江询问之后才知道,他们真在搞正儿八经的科研,课题就是——如何让 AI 参与到真实的工程建造当中。

来自西湖大学的吴泰霖老师课题组,向全网发起了一个叫 BuildArena 的 AI 挑战赛,比赛规则说白了就一句话:AI 造飞机,你来当机长。

详细来说,是在《Besiege》这个物理沙盒游戏里,指挥 AI 给你造一架飞行器,然后由你亲手操控,完成起飞、入轨、环绕星球的连招。

现在,赛事奖池已达到 3000 美元,要是你的机器造得足够惊艳,甚至还可能跟着发篇 Nature。(哦对了,参加比赛免费送游戏)

听说,这还只是 S1 赛季,未来还可能有让 AI 星际旅行、流浪地球等更大的活儿。

可能有人没听过《Besiege》这个游戏,这么说吧,一个工程师模拟器。只要你够强,靠游戏里可用的元素,可以手搓出战车,火箭,机甲甚至歼 20。

主办方告诉我们,他们也考虑过《我的世界》《坎巴拉》等游戏,但还是觉得它们不够真实,不够硬核。

当然,大赛也欢迎啥也不会的小伙伴来参加,主办方专门设立了奖项,来奖励那些足够有趣,足够抽象的设计,有活的人可以挑战一下成为 AI 界的《牛来》。

简单来说,吴老师组主要是搞 AI for Engineering, AI for Science 等研究的,致力于让 AI 更好融入一些实际的工业领域,比如像聚变啊,流体领域等等。

对他们来说,这种游戏也算提供了一个仿真环境,让 AI 能更快、更好地学习实际物理世界的一些控制和建造。

而对这个比赛来说,不管你搓出什么,只要你参加,就可以看作推动了科研进展,因为这个项目,就是希望大家一起探索 AI 在工程制造方面的上限与下限。

主办方成员夏天,还给我们展示了他用 AI 做出的各种机械结构,包括桥梁,车辆,甚至可回收火箭,非常自由。

当然也有很多不知所云的东西,比如这根神秘电线杆,企图冒充飞行器。据他说,凶手来自 GPT-4。

夏天也是这游戏的老玩家了,不过在接入 AI 后,他最大的感受就是:AI 的脑洞,人类真的很难理解。

比如在 DeepSeek V3 时代,他们就对它进行过一次测试,发现它造桥的时候,给桥梁的两端加上了轮子。

看思维链才知道,它看到车轮内置了自动刹车功能,就想着把车轮放在桥梁两端,用来做一个自动阻尼。。

而让 GPT- 5 制造移动载具的时候,它反而会放弃使用轮子,而是直接造了一个火箭推力的滑橇,直接开始贴地飞行。。。

AI 的脑回路,很神奇吧。

所以为了感受 AI 的脑回路,我们也亲自动手,找来了几款热门模型,让它们在尽量相同的提示词下造飞行器,再由我亲自驾驶。

我们的规则是,每个模型测三组,分别为性能组,极简组,创意组,大概就是旗舰机,千元机,小众机的区别。

先来看旗舰机吧,做得最好的是 GPT-5.6 sol、DeepSeek V4 Flash 和 Kimi K3,三者都顺利进入了稳定的轨道。

GPT 5.6 的设计非常稳重,一共 52 块零件,可以说飞得很稳。

而 DeepSeek 这边只用了 40 块,我体感比 GPT 的更好开,一键就能入轨,梁叔依旧是你梁叔。

而 Kimi K3 这台属于是 GOAT 了,只用了 37 块零件,效果超越了所有玩家。

如果说成功的机器都非常相似,那么失败的机器,那就是各流各的口水。

被我们寄予厚望的 Fable5,做了一头会飞的猪,属于走地机。

Gemini3.6 不知道做了个啥,开始原地打滚。

豆包专业版放弃了点火,采用了水炮推进,企图 cos 消防车。

而 GLM5.2 的思路最为独特,选择用自爆把自己送上太空。。

还是不得不说啊,AI 太有活了。。

接着是极简组,提示词大意是,用最少的模块完成任务。

做的最好的,依旧是 Kimi K3,极简组唯一完赛的模型,只能说公司叫月之暗面不是没道理的,天选航天模型。

而剩下的,除开 GPT5.6 以头抢地,其余选手,全部燃料不足。

而真神是 Gemini3.6,居然采用了和性能组豆包相同的水炮打法,这也是本次实验里唯二的喷水打法,属于是高山流水遇知音了。

最后是创意组,大概就是让他们随便造,怎么有活怎么来。

只能说艺术和性能是无法兼顾的,这组没有一个模型完成比赛。

但大伙交的作业,还是太艺术了。

Deepseek V4Flash 在 Cos 生日蜡烛。

Fable 5 在 cos 飞天陀螺,于月之暗面坠机。

GLM5.2 放了个闷屁然后开了个伞。

Kimi K3 采用了散打的办法。

豆包与 Gemini 依旧同根同源。

而最艺术的,还得是 GPT5.6 sol,这形状你敢飞我都不敢看。。。。

测了一圈,大模型能完赛的概率小中之小,所以这比赛还是非常有难度的。

在我们看来,每个模型都有自己的工程能力,但确实不多。

更有意思的是,我们发现每家模型基本都有自己的 " 工程性格 ",GPT、kimi、DeepSeek 这样的模型的思路比较稳重,而 Fable 喜欢复杂、华丽却不实用的结构,而 Gemini 和豆包,可以用天马行空来形容。

在与夏天的交流中,他也给出了类似的评价。

" 我们发现 GPT 5 系列,很喜欢给机械上加非常多的钢筋,把它弄得很牢固。用 Fable 5 的时候,它会给出一些非常节俭的一些方案。GPT 4 系列则很抽象,它会试图用木板造机翼。而豆包,它造车、造火箭确实不太好,但它造大型桥梁造的非常的好。

所以 BuildArena 确实能发现不同的模型在建造这件事情上,它是有一定的个性,或者说偏好的。"

与 AI 的交流过程

你别说,在江江看来,这竞技场还真有意思啊。

首先,它可以成为一个新的 AI 测试题。想必大伙已经厌倦了那些跑分榜单了,那些数字代表啥,一般人根本认不全。

而 BuildArena 不一样,它要求 AI 把能力反映在一台机器上,操纵机器的每个人都能直观感受到,这个机器稳不稳定,好不好开,以及会不会坠机。

Fable5- 爆装备了

其次,我们还可以摸清一些模型的性格,搞清楚模型擅长什么,不擅长什么。

在操作的过程中,我也发现 AI 经常会犯错,比如把火箭的方向搞反,或者把模块互相卡在一起。

落地即散架的豆包

这也表明,AI 对物理世界的感知仍然有限。即使有些模型能想出很有意思的总体方案,但一进入需要精确对齐、多个结构配合的任务,就会明显变得抽象。

这就可以看出,现在的大模型,依旧存在更高理论上限,因为它们对世界的理解还在盘古开天时期呢。

或许未来的模型,被投喂更多关于空间的数据后,会有一个更好的性能提升,也会让 AI 离真实工程更近一步。

带着好奇,我们也找到了吴泰霖老师,聊了聊他对 BuildArena 的最终愿景。

吴老师与卡皮巴拉(卡皮巴拉是实验室的吉祥物)

他说,他们希望未来的任何的工程,我们人类只需给一个开头的任务目标,以及收尾的验收标准, AI 就能通过设计、建造和迭代来做出相应的东西。

" 就比如,可能未来人类如果还要登月,面对太空这种非常复杂的环境,我们希望 AI 能够根据实际的环境,进行自进化,再设计新的一些工程建造。而且我们认为游戏的话,它是一个很快的能够得到反馈的一个场景。我们先在游戏中来锻炼 AI,之后的话,我们也可以把这样的方法用在现实中。"

这个竞技场应该会一直办下去,可能今天是环绕星球,未来可能就是火箭回收、星际航行,甚至流浪地球了。

吴老师在向我们展示导师赠与他的签名版书籍

当然,江江看来,游戏只是第一步。机器为什么会飞、为什么会散架,背后的记录都会被留下来,帮助研究人员搞清楚 AI 到底缺了哪种能力。

等它学会根据物理结果不断修改自己的设计,这套方法也许就能慢慢走出游戏,进入更专业的设计软件和仿真环境,最后再去面对现实世界。

最后,咱也问了吴老师一个问题:" 如果您刚刚说的最终愿景是一百分的话,那么您觉得咱们现在大概是几分?"

" 我认为是 20 分。但我认为,它的上限不是 100 分,它的分数应该是无限的。因为我们能建的东西是无限的。"

可能这就是地球 Online 的魅力吧,它的上限还真是无限的。

所以表面上,这是一群研究者在游戏里搞耍;但实际上,他们是在和 AI 探索工程的未来,而且是无限开阔的未来。

或许在不久的将来,当我们回望这些在屏幕里令人发笑的飞船时,就会发现,正是从这些游戏开始,人类才摸索出了如何与 AI 并肩,然后创造一个前所未有的世界。

最后,感兴趣的大伙,欢迎在 tailin.org 主页联系吴老师,点击阅读原文(https://build-arena.github.io/ConstructionChallenge/)即可报名参赛!

撰文:不咕

编辑:江江 & 面线

美编:素描

图片、资料来源

BuildArena 官网

西湖大学实地探访

哔哩哔哩,沉默的风,《如何在 4 分钟造一架歼 20?最新宣传片曝光!》

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容