去年底,一代豆包手机把不少人对 AI 手机的想象往前推了一步。用户说一句帮我订明天下午去上海最便宜的机票,手机就能自己打开 App、查航班、填信息,到了付款环节再交给用户确认。

这不是简单换一种技术,而是 AI 手机开始重新处理一个关键问题,AI 到底应该怎样进入 App?
一代豆包手机走的是 GUI 路线,说白了就是让 AI 像人一样看屏幕,找按钮,滑页面,再完成点击。它的好处很明显,只要用户能操作,理论上 AI 就能照着做,不需要每个 App 提前开放专门接口。
问题也在这里。AI 每走一步,都可能要截图,上传模型识别,再判断下一步动作,接着继续滑动和点击。现场演示寻找晚上 10 点航班时,就需要不断重复这套流程,手机和云端来回传递,速度自然快不起来。
更麻烦的是权限和生态。GUI 操作往往需要较高系统权限,还要读取屏幕内容,私人聊天、账户信息、财务数据都有暴露风险。AI 要是点错了,甚至误触支付,责任算用户的、手机厂商的、模型厂商的,还是 App 的?
App 平台也有自己的顾虑。

二代产品的变化,就是把手机助手从屏幕操作员,改成服务调度员。MCP 可以理解成统一插座,App 愿意开放哪些能力,就按标准接出来,AI 不必偷看屏幕,也能查询信息、调用服务。A2A 则更像智能体之间互相传话,手机里的 Agent 把任务交给 App 里的 Agent,再由对方返回结果。
这样做有什么好处?速度会更快,权限边界也更容易划清,平台还能决定哪些服务可以被调用。现场工作人员介绍,字节体系内已有数十款 App 支持新的协议方式,实测响应速度比 GUI 明显提升。至于其他超级 App 开放了哪些接口,目前还没有更多信息。
不过,平台愿意开放多少,才是这条路能不能跑通的关键。MCP 和 A2A 并不是把所有入口都交出去,而是平台自己定规则,自己划范围。AI 想调用我的服务,可以,但要按照我的方式来,这种安排对平台更安全,却也意味着手机厂商不能单方面包办一切。
这也是 AI 手机和普通语音助手的差别。过去大家比的是谁接入的大模型更强,谁能写文章、修图、做摘要。现在模型只是底座,真正影响体验的,是它能不能连接足够多的服务,把查票、订房、付款确认这些环节串起来。

豆包手机并不是唯一的尝试。大会现场,阶跃星辰的 STEPX Neo 同样吸引了不少关注,它搭载智能体原生操作系统 Step AOS,并开放 A2A、MCP、Skill、CLI、GUI 等多种合作方式。现场演示中,手机可以规划演唱会行程,调用携程安排机票和酒店,再调用支付宝卡片完成相关信息衔接。
荣耀则走了另一条路,发布了 Robot Phone,加入可收纳、弹出和转动的机械云台,结合多模态智能体操作系统,让手机不仅能听懂声音、识别手势,还能联动多个 App,感知周围空间。为什么要加机械结构?因为有些任务不是打开页面就能解决,拍摄、识别和现实环境互动,需要新的硬件帮忙。
路线不同,目标却差不多,都是想让手机从被动执行指令,变成主动完成任务。协议调用见效快,不必更换系统和硬件,头部 App 一旦接入,体验可能马上变化。多模态硬件能制造差异,但未必会成为日常使用的主入口。
真正具备长期想象力的,可能是从操作系统底层重做,让 Agent 成为系统里的核心角色,权限、硬件和服务都围绕它重新组织。可这条路成本更高,也更容易碰到生态阻力。
所以,二代豆包手机的调整,重点不只是速度提升,而是把主动权重新放回平台和协议之间。未来用户说一句话,能不能真的让努比亚都包了,既看 AI 聪不聪明,也看那些超级 App 愿不愿意把服务接出来。这场关于手机新入口的竞争,才刚刚开始。