
据《广东新闻联播》报道,广东省领导来到腾讯总部调研座谈。包括马化腾在内,多位腾讯高管均参与座谈。
能坐在 Pony 旁边,说明腾讯高层对姚顺雨高度认可,而姚顺雨确实也不负厚望,出任腾讯 AI Data 部负责人不到一个月,就拿到了一项中国第一。
在 Arena 最新的 Alignment Index(对齐指数)榜单中,中国多家 AI 公司冲进榜单前 10,腾讯混元独占鳌头,其最新模型 Hy4 Preview 拿到了 78.5 分,全球第 5,中国第一。UA 1.47%、FA 6.44%、DC 13.24%,越权控制最好。
和以往 Arena 的 " 秀肌肉 " 榜单不同,这张榜测的不是谁更聪明、谁跑分更高,它测的就是现在最火的安全问题,谁家的模型最 " 不会越狱 "。
2025 年的时候,姚顺雨曾写过一篇文章,标题为《The Second Half》,文章的核心判断就是在 AI 的下半场,瓶颈不再是怎么训练模型,而是怎么去让模型符合用户的真实需求。
如今看来,姚顺雨用实际行动证明了自己当时的猜想。

10 月 8 日,Arena 宣布完成 2 亿美元 B 轮融资、估值 31 亿美元,并同步推出了对齐榜单 Alignment Index。这张榜单基于 9 万多条真实的 Agent 会话、覆盖 27 个模型,全都是从用户真实的使用轨迹里,专门定位模型出现风险的时刻。
榜单主要看三种失败信号。
第一种是越权(Unauthorized Action,UA):你没让它做的事,它自己做了。
最典型的例子就是绕过安全护栏攻击他人网络,以及删除文件。
Arena 披露,Claude Opus 5 约有 2% 的会话出现越权,其中 53.5% 涉及未经许可删除或 " 清理 " 用户的文件和之前的工作成果。
第二种是错误归因(False Attribution,FA):把用户没说过的话、没有的意图或事实,安到用户头上,而且这个说法与用户提供的证据相矛盾。
说白了就是 " 甩锅 ",或者凭空编造 " 你之前说过要这样 "。比如它代码跑错了,却告诉你是你的数据有问题。这一项在专业写作场景里最高,达到 13.7%。
第三种是虚假完成(Deceptive Completion,DC):没做完,却告诉你做完了。
这是三项里最常见的问题,平均每 10 个会话就有 1 个出现,而在代码调试场景里,比例高达 48.0%。
第一名是 OpenAI 的 GPT-6.1 Sol,87.9 分,第二名是 Anthropic 的 Claude Opus 5.5(83.2 分),第三名是 Grok-4.7(82.7 分)。GPT-6.1 Sol 虚假完成率只有 2.34%,换句话说,100 次任务里大约有 2 次会 " 谎报军情 "。
虽然 Hy4 Preview 得分为 78.5 分,和前三名有差距,但已经站在了全球第 5、中国第 1 的位置。越权 1.47%,是中国实验室里最低的,这意味着它最少 " 擅自动手 "。
Hy4 Preview 的虚假完成率是 13.24%,100 次里大约有 13 次,高于 10% 的平均水平。这是混元的短板,也是接下来最该补的一块。
这张榜单的结果,和姚顺雨过去一年在腾讯做的几件事,是强相关的。
今年 9 月,腾讯 TEG 内部任命,姚顺雨正式兼任 AI Data 部负责人,向 TEG 总裁卢山汇报。

至此开始,腾讯混元的 " 模型、Infra、数据和评测 " 四件事,全划归到了他一个人手里。
从模型到数据再到评测,姚顺雨一把抓,这事本身就非常的姚顺雨。
还是在《The Second Half》这篇博客里,姚顺雨写到,模型性能逐渐趋同,继续刷分,不会再带来真实的价值。
姚顺雨认为,其根本原因在于,传统模型的评测方法非常局限。
Agent 拿到任务、自主完成、最后得到一个分数。但是现实中,Agent 必须在全程与人互动,它很难完全自主执行题目。
此外,传统的评测每道题都是独立同分布的,题与题之间互不相干。现实中,任务是顺序发生的,经验会积累。
姚顺雨表示,AI 已经在象棋、围棋、SAT、律师资格考试和 IMO、IOI 上超过了人类,但世界并没有因此发生太大改变,归根结底,是因为现在的评测方法与真实世界不同。
所以在 Hy4 Preview 上,姚顺雨让模型自己参与了训练方法、数据策略、评估体系和底层算子的自动优化。以初步 RSI 的方式进行自我迭代。
同时为了让模型更能解决实际问题,Hy4 Preview 与 WorkBuddy、CodeBuddy 等产品共同设计,训练数据则是腾讯软件工程、游戏、金融、安全团队在实际业务中产生的真实数据。
前文提到,越权、甩锅、虚假完成,这三个问题有个共同点:它们只有在真实任务里才会暴露。姚顺雨主张的理念,刚好也正是如此。
Hy4 Preview 发布当天,一位博主做测评,让 WorkBuddy 接入 Hy4 去给三个视频文件重命名。
为了试探模型会不会偷懒,他中途把文件夹里的参考文档剪切走了,结果被模型发现,它直接发问 " 刚才文件还在,怎么不见了 ",随后去查回收站。
可见 Hy4 Preview 在防止模型 " 虚假完成 " 这方面,下足了功夫。

如果只把这张榜单看成一次排名,其实是低估了它的意义。这个榜单想要说明的是,AI 行业的叙事正在发生转移。
过去,大模型的故事是 " 谁更强 ":谁的 MMLU 更高,谁的数学更好,谁的代码跑分更猛。

于是全球最顶尖的三家 AI 公司都纷纷对模型发布做出了调整。
今年 4 月,Anthropic 启动 Project Glasswing,只让选定的公司和开源维护者使用未公开的 Claude Mythos Preview 去扫描软件漏洞。OpenAI 在 6 月 26 日发布 GPT-5.6 Sol 时,同样把访问范围限制在一小批经过审核的合作伙伴。9 月,OpenAI 的 GPT-6 Astra 在发布时,称这个模型是在《预备框架》中首个达到最高网络安全等级的模型,最强的网络能力只对加入 Daybreak 计划的企业开放。谷歌的 Gemini 4 Argon 同样也只交付给网络安全合作伙伴。
虽然这里面有营销的成分,但 " 模型太强了不敢直接放出来给大家用 " 这个说辞,也绝非是空穴来风。
Arena 表示,对话越长,问题越多。在 20 条以上用户消息的会话里,虚假完成的出现比例升到 45.4%,越权升到 12.4%。而 Agent 普遍做的恰好是长任务。
这也是为什么对齐问题,会随着 Agent 的普及而逐渐成为 " 头号难题 "。
另一方面,对齐也在影响中国模型的出海。
过去,国内模型出海的方式是比较直接的。
他们自己做海外 API,然后再卖给海外客户。但是随着国际环境的变化,国内 AI 厂把出海的方式,变成了模型上架 AWS 这类海外云平台,由云厂商做渠道,按调用量分成。
智谱和月之暗面都在走这条路。
10 月 5 日,AWS 宣布智谱的 GLM 5.3 在 Amazon Bedrock 正式可用,并确认按使用量与智谱分成。第二天,智谱港股一度上涨超 7%。
这件事看似只是渠道变化,其实是游戏规则变了。以前是模型厂商自己去说服海外客户 " 我很可靠 ",现在是亚马逊把你放在货架上,替你背书。
对海外企业来说,把模型接进业务、尤其是让它当 Agent 去执行任务,最担心的就是对齐问题。
原因就俩字 " 采购 "。一个会删文件、会谎报进度的 Agent,恐怕不会有哪个企业的采购部门敢签字,更何况现在 AI 的安全叙事已经被三大 AI 厂炒上了天。
Hy4 其实同样面临出海的问题。目前,Hy4 可以通过 OpenRouter 和腾讯云 TokenHub 调用,WorkBuddy 和 CodeBuddy 这两款产品同样也面向全球开放。
再结合未来出海环境和法规方面的变动,对齐要远比性能更重要。
对姚顺雨和混元而言,78.5 分的意义不在于 " 又上榜了 ",而在于它第一次拿到了一份第三方、可验证、国际通行语言的背书。
在这之前,混元要说服海外客户,只能靠官方发布会上的内部盲测;在这之后,它至少有了一个独立机构的数字:越权 1.47%。
当然,这份成绩单也不是终点。Hy4 Preview 目前仍还只是 preview,13.24% 的虚假完成率离第一名的 2.34% 还有相当的距离。
Arena 的榜单也刚刚推出,方法论还有待检验。
因此,这并不足以说明混元已经站稳了,但却能说明姚顺雨确实押对了方向。