
过去几年,AI 已经越来越擅长处理生命科学数据。它可以识别医学影像、分析基因表达、预测蛋白质结构,也可以从海量论文里寻找潜在的药物靶点。这些能力已经很强,但大多数时候,它们回答的仍然是同一类问题:眼前这个生物状态是什么,它意味着什么。但更关键的问题是,如果我们主动改变它,会发生什么。
9 月 17 日,Ayush Noori、Nic Fishman、Ada Fang、Lukas Fesser 和 Marinka Zitnik 在 《Cell》发表文章《World Models for Biomedicine》,试图把近几年分散在不同领域的一批工作放进同一个框架里:生物医学世界模型(biomedical world models)。
AI 会看病了,但还不会做实验
当我们手上有一份数据时,今天的 AI 可以告诉我们,哪些基因异常活跃,这些细胞更接近哪一种类型,甚至哪些药物可能值得关注。但研究人员真正想知道的,并不只是 " 现在是什么 ",而是 " 如果我进行一个操作,结果会怎样 "?

因此,需求从识别问题变成了动态预测问题。而世界模型最早在强化学习和机器人领域受到关注,也是因为类似的原因。一个智能体如果想在环境里行动,光知道 " 眼前有什么 " 是不够的。它还需要对接下来可能发生的事情形成判断:我现在在这里,如果往左走会怎样,往右走又会怎样。
把这套思路放到生物医学里,环境变成了细胞、组织甚至患者,动作则可能是基因敲除、药物、剂量、手术或其他干预。模型需要学到的,也就不只是一个个静态状态,而是这些状态之间如何转移。换句话说,AI 开始被要求从 " 识别生命 " 走向 " 推演生命 "。
真正要学的是 " 规律 ",而不只是 " 数据 "
问题在于,静态数据和动态规律并不是一回事。比如,我们可以让 AI 看一万张城市地图,它很快可以学会哪里是道路、哪里是建筑,甚至能够估算两个地点之间通常需要多久。但如果突然封掉一条高速公路、下起暴雨,或者同一时间多出十万辆车,整个交通系统接下来会怎么变化,光靠这些静态地图,AI 未必能学出来。
生物系统也是如此,只不过更为复杂,因为医学真正关心的问题,往往发生在数据缺失的地方,比如:如果换一种治疗,三个月后会怎样?Noori 等人在论文中强调,想建立跨越分子、细胞、组织乃至临床尺度的世界模型,不能只依赖观察性数据。模型还需要看到干预数据、纵向数据,以及不同模态之间如何对应。简单来说,AI 不仅要见过很多生命状态,还得见过这些状态在被改变之后,到底发生了什么。
语言模型之所以可以从互联网里学到大量 " 下一步 ",是因为语言天然留下了丰富的连续轨迹。一个词后面跟什么,一个句子之后通常怎么发展,都存在大量现成样本。但生物学中的 " 下一步 " 昂贵得多:一次基因扰动可能需要真正培养细胞,一项湿实验可能持续数天甚至更久,而临床结果往往要几个月或几年之后才能看到。
每一条 " 状态—干预—结果 " 的轨迹,背后都可能对应真实的实验成本。因此,未来限制这类模型的,未必是参数量,也未必是算力,反而更可能是高质量干预数据本身。
生物医学世界模型已经从概念开始走向实验室
目前来说,这些想法已经有了初步的实践。今年 3 月,阿里巴巴达摩院发布细胞世界模型 Lingshu-Cell。它尝试直接模拟单细胞在受到基因或细胞因子扰动后,整个转录组状态会如何变化。这和传统的细胞分类任务有明显区别。
过去的模型可能拿到一组转录组数据,然后判断 " 这是什么细胞 ";Lingshu-Cell 面对的问题则更接近:给定这样一个细胞,如果现在改变某个基因,它之后可能变成什么样。它的模型覆盖约 1.8 万个基因,研究团队也在 Virtual Cell Challenge 的基因扰动任务和人类外周血单核细胞的细胞因子扰动预测上进行了测试。它距离真正意义上的 " 虚拟细胞 " 还有很远,但已经体现出这种思路的核心:不再只对现有状态进行描述,而是尝试预测干预后的新状态。
类似的尝试也开始往临床尺度延伸。2025 年,由香港科技大学(广州)、约翰斯 · 霍普金斯大学、南京医科大学第一附属医院、加州大学旧金山分校和香港科技大学研究人员组成的团队,提出了 Medical World Model(MeWM)。
这项工作由 Yijun Yang 等人完成,尝试让模型模拟肿瘤在不同治疗方案下会如何变化。研究人员把治疗方案作为条件,让模型生成接受相应治疗后的肿瘤影像,再根据模拟出的结果评估不同方案。也就是说,在真正实施治疗之前,模型先试着把几种可能的未来 " 演 " 出来。

论文报告称,在肝癌经动脉化疗栓塞术(TACE)方案选择的实验中,引入该系统后,介入医生选择最优治疗方案的 F1 分数提升了 13%。不过,这项结果来自特定数据集和实验条件,目前更适合被看作概念验证,距离模型可以可靠替代真实临床试验,还有很长的路要走。
不过,总的来说,今天被归入 " 生物医学世界模型 " 的系统差异非常大:有些只预测一次细胞扰动后的状态,有些生成治疗后的影像,有些尝试建模疾病随时间发展的过程。把它们都叫作世界模型,很容易让人产生一种错觉,仿佛一个能够从分子一路模拟到真实患者的 " 数字生命体 " 已经出现。
真正的难点在于评估
除此之外,医学世界模型还面对着一个更棘手的问题:怎么判断一个世界模型到底有没有学对?毕竟,AI 很容易制造出一个逼真的结果:一张治疗后的肿瘤影像可以看起来非常自然,一组模拟出来的基因表达数据也可能与真实细胞的统计分布高度接近。但对于生物医学世界模型来说,视觉上或统计上的逼真远远不够。
因为它最终需要回答的是干预问题。如果模型预测敲掉某个基因后,细胞会沿着某个方向变化,那么真正需要验证的并不是这组结果看起来是否合理,而是现实中真的敲掉这个基因之后,细胞是否会出现相似的变化。

一张生成图片只要足够真实,就可能已经完成任务;但一个医学世界模型必须证明,自己面对没见过的干预、不同剂量、不同细胞环境,甚至不同患者时,仍然能做出可靠预测。
一旦模型开始连续向未来推演,问题会更加明显。前一步只有一点点误差,经过多次模拟之后,也可能逐渐积累,最后让整个预测偏离现实。这是所有动态世界模型都会面对的问题,在复杂的生物系统里尤其如此。
因此,至少在现阶段,生物医学世界模型并不能替代真实实验的。它更现实的用途,是成为真实实验之前的一层 " 预演 "。它可以先在计算机里模拟不同干预,淘汰掉大量明显不值得验证的路径,再把最有希望、或者最有信息量的候选交给真实实验。
实验完成后,新结果又可以反馈给模型,帮助下一轮选择。在这样的闭环里,AI 并没有取代实验,只不过它被用得更有针对性了。
目前,AI 的使用更多出现在实验完成之后:读论文、分析数据、解释结果。但如果世界模型逐渐成熟,AI 可能会越来越多地出现在实验开始之前,参与决定 " 接下来究竟值得试什么 "。
在真实科学研究里,想法本身从来不是唯一稀缺资源。时间、实验设备、样本、经费和研究人员的注意力,都更加有限。因此,一个真正有用的生物医学世界模型,未必需要先成为一个完美的 " 数字人体 "。它只需要做到一件更现实的事:在上百种可能的实验路径里,比现在更准确地告诉研究者,下一步往哪里走更值得。
参考链接:
https://www.cell.com/cell/fulltext/S0092-8674 ( 26 ) 01005-6
免责声明:本文旨在传递生命科学和医疗健康产业最新讯息,不代表平台立场,不构成任何投资意见和建议,以官方 / 公司公告为准。本文也不是治疗方案推荐,如需获得治疗方案指导,请前往正规医院就诊。
运营 / 排版:何晨龙
注:封面 / 首图由 AI 辅助生成