


作者丨雪饼 编辑丨九黎
AI Agent 能够听懂指令并一键办妥一切时,一个技术上的完美工具,却成了互联网商业最危险的掘墓人。用户不再需要跳转、不再浏览页面、不再观看广告,意味着建立在日活与停留时长之上的万亿级流量生态即将分崩离析。AI 手机的底层突围,技术风控只是表层的生死线,更硬的骨头在于利益的重新分配。在行业标准确立的前夜,如何通过通用底层协议划清生态底线,决定了下一代操作系统话语权的最终归属。
01
越权:豆包 " 模拟点击 " 触碰风控与利益红线

但好景不长,上线次日,部分用户就发现微信账号因登录环境异常被封。紧接着,淘宝弹出人机验证;农行、建行等银行 App 以风险环境为由中止登录和支付。
短短几天内,微信、淘宝、支付宝、美团、拼多多等国民级 App 相继把豆包助手 " 拉黑 ",Agent 功能被一刀砍废。
努比亚 M153 的迅速失败,有一个值得深思的问题:它到底做错了什么?
从技术上讲,豆包走的是无障碍权限 + 屏幕语义理解 + 模拟点击的路径,无障碍服务原本是为视障人士设计的功能,开发者为每一个按钮添加标签,在视障人士使用时系统会读取并朗读,让视障用户知道当前按钮的作用。

但问题在于,这套机制在风控系统面前等同于一个巨大的后门。
在模拟操作的情景下,第三方应用无法判断这项权限究竟是用户亲手确认的,还是被不法分子诱导下授予的,安全起见,只能以风控为由先停止服务。
不过,初代 AI 手机的失败更根本的原因在于,豆包 GUI-Agent 方案打破了全球互联网生态长期建立的入口逻辑。用户进入一个 App 需要经过搜索、点击、跳转,每一步都关联着应用的分发、引流和商业化策略。
真人操作过程中看的每一个广告,都是 APP 能赚到手的真金白银,但如果 AI Agent 能模拟完成所有操作,原本属于应用的流量体系将分崩离析。
于是,在重重阻力下,AI cos 人类的模拟点击策略以彻底失败告终。不过这不是豆包一个产品的问题,所有在 Android 上做 AI 手机的公司,都撞上了同一面墙:在别人的地盘上做客,随时可能被扫地出门。
02
原生:阶跃 Step AOS 的 " 去寄生化 " 自救

所以阶跃没有走在 OS 上加 AI 的老路,转而从零开始重构底层框架,推出首个智能体操作原生系统 Step AOS。
Step AOS 在硬件和安卓底层之上增设专属运行层,打通全设备、全应用接口。传统操作系统的一切资源都围绕人操作应用来设计,Step AOS 则专门为智能体重新分配硬件资源、重新调度系统能力。
如果说传统手机是一栋办公楼,AI 助手就只是这座办公楼里的临时工,需要在别人下班后才能使用会议室,还随时面临被驱逐的风险;但智能体手机更像是一栋为 AI 量身定制的写字楼,AI 从一开始就拥有自己的办公室和钥匙。

记忆:让智能体真正懂用户,日常问答记忆召回最快仅需 15 毫秒;
决策与执行:端云多脑协同,设闹钟、找照片等即时任务由端侧模型在百毫秒内完成。
安全:提出 " 可信、可见、可控、可逆 " 四维安全框架。
把这三点放在一起看,阶跃真正想回答的是一个本质问题:AI 凭什么值得你托付? 记得住、办成事、安全感是一套完整的信任闭环,三者缺一不可。
这也是区分玩具和工具的分水岭:前者有趣,后者放心。
但需要注意的是,阶跃 AI 手机在烈火烹油之下,仍有隐忧。三大核心能力解决的主要是用户层面和风控层面的问题,让用户觉得好用敢用放心用,让风控分辨真人操作还是 AI 代劳。但别忘了上一任 AI 手机的失败经验,在风控之外,还有一块更硬的骨头要啃:流量利益分配。
豆包当年被围剿,技术路线踩了风控红线只是一个表层原因。更深层的原因是,它动了互联网 App 的蛋糕,用户不需要再打开 App、不需要再浏览页面、不需要再被推送广告,App 的日活、停留时长、广告收入全链条受损,这才是巨头们真正无法容忍的。
当用户通过 AI 完成了原本需要打开 App 才能完成的事,那 App 的流量和收入从哪来?谁为这个绕过前台的行为买单?
这是阶跃没有正面回答,也无法独自回答的问题。
03
纳贡:A2A 协议,互联网巨头对 AI 的一次 " 招安 "

对比过往三种交互逻辑的根本差异:传统手机是你找工具,豆包式是模拟点击,阶跃式是工具找你。Agent OS 让用户只需下达命令,系统自动拆解任务、调用工具、交付成品。

落到真实的生活场景中,传统手机,就算只是想订一张上海到北京的高铁票,都需要十余次手动操作;现在的 Agent OS,哪怕下达 " 帮我把上周的销售数据做成 PPT,周一开会用 " 这样的复杂指令,系统也可以把任务自动拆解为几个子任务,实现复杂任务一键完成。至此,AI 彻底从一个对话对象变成了执行主体。
阶跃目前已与携程、支付宝、滴滴、美团、WPS、剪映等达成 AI 深度合作,覆盖了出行、本地生活、办公等高频场景,对不少用户来说已经具有实用价值。
不过,这些合作本质上仍是一对一的接口打通,每一个 App 都需要单独谈判、单独适配、单独接入。
行业需要一个更通用的底层协议,让手机厂商和 App 之间建立一种标准化的对话机制,不需要每一次合作都从零谈判。
Agent to Agent 协议正是这个方向的产物。简单来说,A2A 的本质就是系统智能体解析用户意图后,通过加密且受控的协议把指令发给应用,由应用在后台自己执行并返回结果。整个过程 Agent OS 看不到应用界面内容,数据安全通过用户和应用的双重授权机制保障。
这事实上划清了 AI 手机和第三方应用之间的底线:互联网超级 App 不接受屏幕读取和模拟点击的 GUI 路径,但愿意接受安全合规的 A2A 协议合作。
腾讯总裁刘炽平对此有过清晰的表述:" 真正的操作系统必须保持中立,Agent 调用 App 能力需要获得许可,否则就是掠夺。"
翻译一下就是:AI 可以干活,但不能绕过门面,后台服务的钱可以分,但前台流量是必须死守的阵地。
或许这条底线才是 AI 手机与超级 App 共存的最终形态。
AI 手机的竞争正在从谁先接入大模型转向谁能定义智能体和下一代操作系统。各大手机厂商接连入局,但却走上了完全不同的路。
华为走生态规模路线,荣耀走系统重构路线,OPPO 走跨应用协同路线,vivo 走核心场景路线。
眼下,华为、荣耀、小米、OPPO、vivo 已悉数入局,或铺生态,或重构系统,或深耕场景,路线各异,指向却殊途同归:争夺 AI 时代的第一入口。各家都在疯狂试探,试图在 " 围墙 " 上凿出一个属于自己的门洞。然而,努比亚的夭折与阶跃的重构已经给出了血的教训:在旧地基上搞装修,迟早会被房东扫地出门;而即便盖好了新楼,若不懂向地主 " 纳贡 ",依然是无本之木。随着腾讯与主流厂商内测 A2A 智能体能力,微信打开一道门,让系统智能体直接对话内部智能体。这看似是握手言和,实则是巨头对 AI 流量的一次 " 招安 "。AI 可以干脏活累活,但 " 过路费 " 一分不能少。在这场关于 " 谁来收税 " 的战争中,谁能率先跑通 " 技术信任 " 与 " 利益妥协 " 的完整商业闭环,谁才算真正拿到了下一个时代的船票。