文 | 深流研究所,作者 | 吴绛枫
8 月 28 日,腾讯混元发布并开源 Hy4 preview。
从今年 2 月重建预训练与强化学习基建算起,混元把大版本的迭代周期,压缩到两个月左右。
这已经接近 Anthropic、OpenAI、智谱等头部模型厂商的更新频率。
差别在于,腾讯是在重建地基的同时跑出了这个速度。
版本间隔在缩短,混元能力跃升的幅度也在持续变大。
Hy4 preview 总参数达到 770B,是 Hy3 的 2.6 倍;激活参数从 21B 提升到 49B,上下文从 256K 扩展到 1M。

7 月初,Hy3 在软件工程实战基准 DeepSWE 上拿到 28.0 分,同期 Claude Opus 4.8 是 58.0。
不到两个月,Hy4 preview 在同一项测试上拿到 64.3,超过 DeepSeek V4 Pro 的 62.7。
同一天公布的 Terminal-Bench 2.1 上,Hy4 preview 拿到 85.4 分,与 Claude Opus 5 持平。
如果把 Hy3 preview 以来的三个版本放在一起看,混元在多项主流 benchmark 上都画出了一条显著上升的曲线。

那么,猛踩油门的腾讯混元,它的 " 加速度 " 究竟从何而来?
1、每一次发布,都是实战
Hy4 preview 发布当天,WorkBuddy 和 CodeBuddy 同步开启两周免费体验。
混元团队在说明中提到:" 如同 Hy3 preview,我们希望通过 Hy4 preview 的尽快发布获得广泛的真实反馈,从而显著提升 Hy4 正式版。"
同一套流程,混元已经走过一遍。
4 月 23 日,Hy3 preview 开源上线,同时接入元宝、WorkBuddy、CodeBuddy、ima 和 QQ 等多个业务产品。
三个月后,Hy3 正式版发布。团队表示,Hy3 preview 已在 50 多个业务中获得广泛反馈,修复了大量体验问题;正式版在此基础上,进一步提升后训练数据的质量与多样性,并扩大了强化学习的算力规模。
变化体现在核心指标上。
对比 preview 版,Hy3 正式版的幻觉率从 12.5% 降到 5.4%,常识错误率从 25.4% 降到 12.7%,多轮对话问题率从 17.4% 降到 7.9%。
这不是单靠增加参数就能解决的。
模型在真实任务里会犯一些非常具体的错误。比如忘记用户几轮前提出的限制,工具调用失败后盲目重试,任务已经完成却不知道什么时候该停等等。
只有把模型放进产品,让它持续面对真实用户,再把失败过程拆开,找到问题发生在哪一步,补充正确的任务轨迹和判断标准,错误才可能被一条条纠正。
Preview 不是一个版本标签,而是将真实使用纳入模型研发的行业机制。
早在 2022 年,OpenAI 就把 ChatGPT 作为 research preview 推向公众,希望借此收集用户反馈,了解模型在真实世界中的优势与局限。后来的 o1-preview、GPT-4.5,也延续了相似的发布方式。
OpenAI 将其称为 " 迭代式部署 ":不是等系统在实验室里变得完美再推出,而是让一个仍有不足的版本受控地进入真实世界,再根据实际使用不断修正。
如今,分阶段开放、早期测试和 preview-first,已经成为前沿模型常见的研发机制。
每一次 preview 都不只是一次产品公测,也是一次大规模实战。
正如混元团队所说,Hy3 preview 是混元从读万卷书到行万里路的开端。
2、实战反馈,如何变成模型能力
发布大模型只是第一步。
它能不能真的进步,取决于收回来的是什么,以及这些东西能不能变成有效的训练材料。
Hy4 preview 的官方说明里,有一句容易被略过的话:模型能力的提升,来自与腾讯内部软件工程、游戏、金融、安全等领域专家的高质量数据共建。
Hy3 时期,重点是与 CodeBuddy、WorkBuddy 等产品深度协同,把真实任务中的用户反馈和失败案例送回训练环节。
到了 Hy4 阶段,在产品反馈之外,来自各个专业领域的专家共建被放到了更靠前的位置。
这是两个不同层次的反馈。
用户告诉模型 " 哪里不好用 ",专家告诉模型 " 什么才算真正做好 "。
一个金融分析任务,普通用户可能只能判断最后的报告能不能用;专业人士则可以进一步判断统计口径是否一致、证据链是否完整、风险提示是否充分。
一个软件工程任务,测试通过不等于代码可以合入,工程师还会看架构、可维护性、性能和潜在回归。
让产品反馈和专家判断组织起来,参与模型训练的方法,腾讯内部叫 Co-Design。
什么信息该给模型,什么时候给,以什么结构给;模型可以调用哪些工具,怎样判断任务完成,失败后又该如何恢复——这些都不是模型团队关在实验室里能独立想明白的。
Co-Design 做的,是让多方一起定义问题,而不是等模型训练完成,再由产品接上一个 API。
混元内部还建立了 50 多套评测,用真实考题、人工评测和产品众测进行验收,不再把外部排名作为唯一标准。
姚顺雨的判断是,真正有价值的进步来自产品侧回流的真实 Prompt 分布:模糊提问、多轮追问、省略表达、隐含意图、前后矛盾,以及用户自己都没有完全说清楚的需求。
用户提供问题分布,专家提供质量标准,产品提供任务环境,模型团队再把三者变成后训练和评测体系。
这才是反馈真正转化成模型能力,实现 Co-Design loop 的全过程。
3、腾讯的 Agent 产品矩阵,混元的训练场
WorkBuddy 的界面上,摆着多个厂商的十余款模型。
混元、DeepSeek、GLM、Kimi、MiniMax,用户点一下就能切换,没有唯一选项。
这给混元设置了一个比内部评测更直接的考场。
每一次切换都是一次投票。每一次重复使用也是一次投票。
结果是 Hy3 留住了用户。
今年 7 月 8 日,Hy3 正式版在 WorkBuddy 上线后,调用量一度把算力打满。当天下午排队率超过 50%,团队紧急扩容。原定两周的免费体验,也因为需求过大延长到了 8 月底。
自上线 WorkBuddy 以来,主动选择 Hy3 preview 的用户数量增长了 6 倍。接入 Hy3 正式版后,WorkBuddy 内部测评的任务成功率从 72% 提升到 90%,平均耗时缩短 34%。
这些数字至少证明了一件事:
模型在内部评测中获得的提升,有一部分转化成了用户能够直接感知的体验。
用户选择只是结果。
对模型研发更重要的是,用户为什么选择它,又为什么放弃它。
在多模型共存的产品里,混元获得的不只是一句 " 好用 " 或者 " 不好用 ",而是一组带有对照关系的反馈:
同一个任务,不同模型用了多长时间,采取了什么路径,调用了哪些工具,在哪一步失败,用户最终接受了哪一个结果。
这让 WorkBuddy 不只是混元的考场,也成了它的训练场。
WorkBuddy 只是其中一个入口。
混元已经接入腾讯内部百余个业务场景。腾讯也在推动企业微信、腾讯文档、ima、腾讯会议和 iwiki 与 WorkBuddy 进一步打通。
入口越多,模型面对的任务类型越丰富;工具越多,模型能完成的任务链条越长;任务链条越长,暴露出来的问题也越接近真实生产。
对拥有产品矩阵的公司来说,优势不只是用户多,而是环境多。
元宝提供搜索和对话,CodeBuddy 提供代码库和开发工具,WorkBuddy 提供本地文件与办公流程,ima 提供知识库,腾讯会议和企业微信则提供协作上下文。
这些产品提供的环境不同,但模型在其中习得的能力可以迁移。
搜索中练出来的信源判断,可以用于研报分析;编程中练出来的规划、调试和验证,可以迁移到办公任务;长文理解中练出来的上下文管理,又可以帮助模型完成跨文件协作。
单个产品只能提供一种反馈。产品矩阵提供的是一整套能力进化的环境。
4、把实战闭环搬进模型内部
到这里,混元的加速逻辑已经形成了一条外部闭环:
模型进入产品,用户和专家提供反馈,反馈被加工成训练与评测材料,再进入下一个版本。
Hy4 preview 往前又走了一步。
它开始把同样的循环搬进模型研发内部。
产品侧的循环是 " 发布—使用—反馈—改进 ";模型内部的循环则是 " 提出方案—运行实验—读取结果—继续修改 "。
前者由模型、产品和专家共同完成,后者开始由模型参与执行。
用 AI 优化 AI,并不是 Hy4 独有的方向。
随着编程 Agent 的长程执行能力增强,越来越多模型开始参与训练框架、GPU 算子、编译器和芯片设计等研发任务。行业正在从 AI for Coding,走向 AI for AI。
Hy4 preview 的不同之处在于,它开始参与一条与自身研发直接相关的链条:训练方法、数据策略、评估体系和底层算子的自动优化。
这虽然远不是严格意义上的 " 自己训练自己 ",但模型与研发对象之间的距离,已经缩短了一步。
一个直接结果是,Hy4 preview 首次给自己的推理系统做了一次优化。
模型先分析系统瓶颈,再围绕算子融合、通信优化等方向提出方案,运行实验,根据日志继续调整。最终,端到端吞吐相对基线提升了 31.8%,而且在不同上下文长度和并发度下都获得了稳定收益。
简单说,同样一套算力,现在可以承接更多请求。
模型不只是被部署到基础设施上,也开始参与改造承载自己的基础设施。
在一个小模型后训练任务中,Hy4 preview 作为 researcher 协调多个 Codex Session,并行优化多个评测目标,8 项评测全部优于 Codex 独立探索。
过去,这些工作主要由研究员完成:提出假设、修改代码、启动实验、阅读日志、比较结果,再决定下一轮怎么做。
现在,模型自身也开始进入这个闭环。
5、实战驱动的加速度
回过头看,这也解释了混元这半年的加速度。
它不是只靠一次更大规模的预训练,把模型憋到足够强再发布。
它把发布变成获取反馈的入口,把产品变成任务环境,把用户和专家的判断变成训练弹药,又开始让模型参与下一轮研发。
这条链条可以概括成四步:发布,实战,反馈,再训练。
到了 Hy4 preview,这条链又向内延伸了一步:模型开始参与改进承载自己的系统。
对腾讯而言,这款模型的意义,不只是混元又追上了一段距离,而是腾讯开始把模型、Agent 产品、真实任务、数据反馈,以及推理基建组织成一个持续运转的系统。
过去,大模型竞争主要看算力、参数和文本数据。
现在,竞争正在转向另一组能力:
谁能找到真正有价值的问题,谁能构造足够真实的环境,谁能把用户、专家、产品和模型组织进同一条反馈链,以及谁能让这条链转得更快。
模型仍然重要。
决定下一次迭代速度的,还有围绕模型运转的整个系统。