关于ZAKER Skills GEO服务 合作
钛媒体 23分钟前

AI 手机真正要消灭的,是“操作手机”这件事

文 | 防冷涂的蜡

现在的 AI 手机,正在变得越来越会 " 办事 "。

对着手机说一句 " 帮我点一杯热拿铁 ",然后看它自己打开外卖 App、找到常去的咖啡店、完成选购,最后等你确认付款。荣耀曾用这个场景展示 YOYO 智能体。到了 2026 年的 MagicOS 11,YOYO 已经可以连续处理超过 100 步的长程任务。过去需要人亲手完成的一串动作,正在被 AI 接走。

这当然很先进。但把画面换个角度看,又有点奇怪:我们已经造出了能够理解自然语言和复杂意图的大模型,然后又让它努力学习怎样寻找菜单、识别图标、按下按钮,在一套原本为人的眼睛和手指设计的界面里行动。

一个已经能听懂 " 我要什么 " 的机器,为什么还要学习 " 下一步点哪里 "?

麦克卢汉曾用 " 后视镜 " 形容人理解新媒介时的一种惯性:我们面对新事物,最容易借过去熟悉的形式来想象它。今天的 AI 手机也有这种味道。手机还在,App 还在,按钮还在,只是多了一个越来越聪明的 AI 替我们完成操作。

如果 AI 已经能理解 " 我想做什么 ",未来的人为什么还需要继续告诉机器 " 下一步点哪里 "?

未来最初,总是长得像过去

1993 年,苹果推出 Newton MessagePad。它可以记录联系人、笔记和日程,最受关注的功能之一,是通过手写笔输入文字。这个设计非常自然:人已经习惯在纸上写字,新设备只要把纸变成屏幕、把墨迹变成数据,就能迅速获得一套人人熟悉的使用方式。

Newton 把纸笔经验搬到了屏幕上。到了 2007 年的 iPhone,交互开始更多围绕屏幕自身的能力来组织。苹果在发布时强调大型 Multi-Touch 界面,用户可以直接用手指轻触、滑动、双指缩放,列表和照片都随着手势发生变化。移动设备逐渐从 " 怎样把过去的工具装进去 ",走到了 " 怎样形成自己的使用方式 "。

一种新技术真正成熟的标志,往往是它开始形成属于自己的交互语言。

今天 AI 已经进入手机,但桌面、App、菜单和按钮,仍然大体按照智能手机时代的方式组织。用旧界面承接新能力有现实上的便利:服务已经在那里,用户也已经在那里,AI 可以先接管一套现成的流程。于是,大量 AI 手机首先解决的是怎样让 AI 更好地使用智能手机。

真正的范式变化,会从另一个问题开始:为什么 AI 还需要像人一样使用手机?要回答它,得先看清这些越来越自然的操作,究竟让人承担了什么。

计算机越来越好用,人却一直负责学习机器

早期命令行计算机很难用,用户必须学习机器的语言。想移动一个文件,需要知道命令怎样写、路径怎样表达。图形界面把这种关系往人的方向拉近了一步:文件变成图标,位置变成文件夹,原本需要记住的语法,被改造成屏幕上看得见的对象和动作。

1980 年代,人机交互学者 Ben Shneiderman 提出 "Direct Manipulation",也就是直接操纵。他强调让对象持续可见,用直接动作替代复杂语法,并让操作结果迅速呈现、可以撤回。鼠标之后是手指,触摸屏又把指针拿掉,点击、拖拽、缩放几乎不需要额外解释。机器越来越顺手,但用户仍然要知道,为了办成一件事,应该先做什么、再做什么。

假设你下周三去上海出差,需求其实很简单:酒店离公司近、安静,一晚 800 元以内。打开订房 App 后,你需要输入城市和日期,查找公司地址,设定价格区间,再看地图、评分、评论和房型,最后核对取消条件并完成支付。

其中一些要求甚至无法直接对应筛选项。" 离公司近 " 究竟是直线距离近,还是早高峰通勤方便?" 安静 " 要从临街位置、房型和住客评价中判断。你得把一句完整需求,翻译成不同页面能接受的条件,再把分散的信息拼回一个决定。

从用户这一侧看,App 本质上是一套把人的目的拆解成机器动作的交互语法。每个输入框规定你能说什么,每个按钮规定接下来能做什么。熟练使用手机,就是学会在这些预设步骤之间找到通往结果的路线。

过去几十年的人机交互革命,一直在降低这套语法的学习成本。机器越来越容易操作,人却始终负责把目的拆成动作。即便订一家酒店只花几分钟,这几分钟里,用户仍然是整个任务的组织者。

Agent 把交互单位从动作提升到意图

同样的酒店需求,交给能够规划任务、调用工具并执行的 Agent,分工会发生变化。用户提供日期、位置、预算和偏好,AI 负责把 " 离公司近 " 转成位置与通勤条件,把 " 安静 " 转成需要查找的信息,再寻找能够满足要求的服务。

传统流程是:人产生目的,自己拆解任务,寻找软件,逐步操作,机器执行每一步。Agent 想做的,是把中间那段工作接过去:人给出目的,AI 理解并拆解任务,再寻找和调用能力,最后交付结果。

人与计算机交流的基本单位,正在从 " 动作 " 提升到 " 意图 "。

对着手机说 " 打开订房软件,再点价格筛选 ",仍然是人在安排步骤。只有当你可以交代 " 下周三去上海,住公司附近,安静一点,800 元以内 ",让系统自己决定完成路径时,任务的组织工作才真正转移出去。输入方式可以是语音,也可以是文字,关键在于人交代的是结果还是步骤。

这种分工并非今天才有人设想。1960 年,J.C.R. Licklider 在《Man-Computer Symbiosis》中提出,人负责设定目标、提出假设、确定标准和评价结果,计算机承担其中可以常规化的工作。他还注意到一个很细的区别:给计算机的指令通常要规定具体路线,给人的指令则更倾向于说明目标。

设想你对个人 Agent 说:" 明早 7 点 50 送我去机场。" 如果这是出发时间,它需要找到行程里的机场和航站楼,结合路况核对时间,预约车辆,再把安排写进日历。如果时间不够,它应该问你能否提前出发;如果价格明显超出平时范围,它应该把取舍交回来。

理解意图最终要落到一个很具体的能力上:哪些细节可以自行处理,哪些变化必须重新交给用户判断。地图、航班、打车和日历之间的衔接,则不再需要用户亲自复制地址、切换页面。

今天的一条技术路径,是让 AI 先学会操作已有界面。它看屏幕、认按钮、输入内容,再观察操作后的变化。这类 GUI Agent 能快速进入大量尚未为 AI 开放的服务,因为所有入口已经存在于页面里。

问题是,它仍然要经过为人安排的步骤。按钮换了位置,页面多出弹窗,流程增加一个分支,都可能要求它重新判断。如果服务本身已经知道怎样查询库存、创建订单、返回结果,机器之间完全可以直接交换这些信息,无须每次都把它们画成页面,再交给另一台机器识别。

苹果的 App Intents 和 App Schemas 提供了另一种方向:开发者把应用里的内容、可以执行的动作和所需条件,按系统能理解的方式描述出来,Siri 再据此查找内容、调用动作。界面上的 " 发送 " 按钮可以继续留给人,AI 却不必为了发送一条信息,先在屏幕上找到这个按钮。

依靠识屏点击完成的跨 App 操作,是 AI 兼容旧互联网的桥梁,不是 Agent 时代的终局。服务开放得越充分,AI 越没有必要重新走一遍人的点击流程。

未来最好的 AI 手机,很可能恰恰是最少让用户看到 "AI 正在操作手机 " 的手机。它应该让人看见结果,以及真正需要自己判断的取舍。衡量它的标准,也会从 " 能连续操作多少步 ",转向 " 完成一件事还需要占用用户多少注意力 "。

App 不会消失,但会从前台退到后台

一旦用户不必亲自经过那些页面,移动互联网过去十几年形成的商业价值也会重新分配。今天一个人要订酒店,通常先想到 " 打开哪个 App"。平台一边组织酒店库存、支付、评价和售后,一边拥有用户必须经过的搜索框、推荐位、商品货架和排序。

这些前台位置之所以值钱,是因为订单和用户注意力长期被打包在一起。一个人为了订酒店进入 App,平台拿到的不只是一笔交易,还得到一段浏览时间,可以卖广告、推会员、做交叉销售,把原本只想解决住宿需求的人继续引向其他商品和服务。

如果路径逐渐变成 " 人— Agent —服务 ",酒店、司机、商品、支付和售后仍然需要有人提供,变化发生在交易之前:用户先把需求交给自己的 Agent,未必需要进入某个 App,再沿着平台安排的路线浏览。

大量任务型 App 不会消失,但会从用户的前台入口,逐渐退成 AI 调用的服务基础设施。同样一笔酒店订单依然能产生交易佣金,却未必再附带首页广告曝光、关联商品推荐和几分钟的用户停留。

过去,App 把订单和注意力打包在一起;Agent 可能第一次把两者拆开。

这会把 " 提供服务 " 和 " 掌握入口 " 变成两种更独立的能力。拥有独家供给、合理价格和可靠履约的平台,依然有被调用的价值;依赖页面位置和用户停留获得的优势,则要接受另一套筛选。对平台来说,开放能力可以带来新订单,也意味着让出一部分 " 用户先看什么、再买什么 " 的安排权。

个人 Agent 承担的角色因此超出了一个新 App。传统操作系统管理设备资源,保证程序正常运行;个人 Agent 围绕用户的任务,判断此刻应该组织哪些能力、按什么顺序参与。从用户的感知看,它越来越像一层新的操作系统:人不必先判断这件事归哪个软件管,可以先说自己想完成什么。

传统 OS 管理 " 设备能做什么 ",个人 Agent 开始管理 " 这个人想做什么 "。

沿着这条路径走下去,下一代互联网最重要的入口,很可能不再是用户主动打开的 App,而是最先接收到用户意图、再替他组织服务的个人 Agent。但这个推演有一个前提:用户已经知道自己想要什么。

有些选择只是成本,有些选择创造目的

交电费、翻译一句话,或者补买已经确定型号的耗材,目的通常在打开手机之前就已经形成。用户需要的是正确完成任务,反复浏览页面、确认相同信息,并不会让结果更有价值。这样的过程越短越好。

即使购买一件已经确定的商品,人也不会无限搜索。多看一家店也许还能便宜一点,但还要花时间比较价格、配送和售后。赫伯特 · 西蒙的有限理性研究指出,人很少穷尽所有方案,而是在有限时间和认知能力下寻找一个足够满意的选择;George Stigler 则把寻找信息本身也视为一种成本。

Agent 适合接走的,正是这一部分工作。目标已经确定以后,搜索、比较和操作越多,越接近为了到达结果不得不付出的成本。用户只想把电费交上,并不需要认真体验一次缴费流程。

但一个人走进书店,未必已经知道自己要买哪本书。他原本想找一本经济学读物,却在旁边翻到一本讨论城市生活的社会学著作,读了几页,突然对一个从未想过的问题产生兴趣。最后带走的书,甚至不属于原来的计划。

这里发生的事情和缴费完全不同。选择没有在执行一个已经形成的目标,选择本身正在改变目标。John Dewey 在《Human Nature and Conduct》中讨论过类似过程:人的目的并不总是在行动之前完整存在,很多目标会在行动、经验和想象中形成,再反过来改变接下来的行动。

" 下一本读什么书 "" 周末去哪 "" 想要怎样的旅行 ",都包含这种尚未完成的形成过程。提前给出一个最匹配过去偏好的答案,可以减少比较,却也可能减少接触陌生事物、发现新兴趣的机会。更麻烦的是,连 " 什么才算合适 " 这套评价标准,都可能在过程中发生变化。

AI 最容易消灭的是达成既定目的所需要的选择;它最难替代的,是帮助人形成目的的选择。同一个订房服务,既可以完成一场安排明确的出差,也可以参与一次尚未成形的旅行。前者希望尽快结束搜索,后者有时正是从搜索里开始。

办事会越来越没有界面,生活仍然需要界面。这里的界面可以是一张允许随意探索的地图,也可以是一份夹杂陌生曲目的歌单。它的价值不是让人更快离开,而是让人接触自己尚未想到的东西,让新的目的有机会出现。

AI 越了解过去的你,筛掉陌生选项的能力也越强。它知道你喜欢哪种餐厅、哪一类文章、哪个品牌、怎样安排旅行,于是每一次推荐都会越来越像 " 你 "。短期看,这当然提高了命中率;长期看,一个永远追求 " 越来越懂你 " 的 AI,也可能越来越擅长把你困在过去的自己里。

人的偏好会变化,而很多变化恰恰来自那些事先没有表现出偏好的东西。机器如果只把过去的你预测得越来越准确,也可能同时减少你遇见另一个自己的机会。

真正成熟的 AI,要知道什么时候停手

计算器接到算式,地图接到终点,传统工具通常在任务已经确定之后才开始工作。个人 Agent 会更早地进入需求形成过程,它不得不面对一个过去的软件很少需要判断的问题:眼前这段选择,是用户希望摆脱的麻烦,还是值得亲自经历的事情?

面对明确任务,它应该尽量把过程拿掉;面对尚未形成的目的,它应该先让不同的可能性被看见,而不是急着把世界压缩成一个所谓最优答案。未来真正高级的个人 AI,稀缺的能力未必是替人做最多决定,而是知道哪些选择只是在浪费人的时间,哪些选择本身就是人的生活。

今天 AI 还在努力学习怎样点我们的按钮。几年以后回头看,这或许只是新交互出现前必须经过的一段兼容期。过去几十年,人一直在学习怎样更轻松地使用机器;接下来,轮到机器学习怎样理解人的目的。

更难的一课,是它还要知道什么时候继续替人行动,什么时候把选择重新交还给人。

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容