文 | 字母 AI
小扎拿出 Muse Charm 之后,Rabbit r1 又被翻了出来。
不少人看到这款新设备时,都会幻视两年多前的橙色小方盒。在 X 上,有人将小扎拿着 Charm、吕骋拿着 r1 的照片放在一起玩梗,不少外媒在报道 Charm 时,也都提到了这款初代 AI 硬件。

让人感到熟悉的不只是硬件。
2024 年,Rabbit 在 r1 发布会上,用打车、订票、点外卖等场景,向大众解释 Personal Agent(个人智能体)到底能办什么事。此后,这几样任务反复出现在一代代 Agent 产品的演示里,逐渐凑成了一套观众熟悉的 " 标准套餐 "。评测网站 Assistant Benchmark 也把订机票、订餐厅、购物等列进了 Personal Agent 的测试维度。
这套题目受欢迎的原因不难理解:外卖有没有送达,票有没有订上,买东西有没有省钱,交付结果明确。比起解释模型又提升了多少分,这些场景更容易让人看懂,AI 究竟能替自己做什么。
但最容易演示、传播的任务,难道就是 Personal Agent 最有价值的用武之地吗?
大公司想让 AI 下单,也难
Muse 爆火以后,很快遇到了平台的阻力。
当地时间 9 月 20 日,亚马逊表示已阻止 Muse 代表用户在其网站购物。亚马逊称,Meta 未事先告知 Muse 会访问其网站,Muse 浏览时也未标明代理身份,并对其处理用户凭据的方式提出隐私和安全担忧。

AI 能否稳定完成操作、替人下单,和是否获准操作,是两个问题。有时即使 Agent 知道该怎么操作,平台也未必放行,商业准入及背后的利益分配同样可能卡住订单。
平台担心的,除了账户安全和交易责任,还有自己的生意。
过去,用户在平台上搜索、比较、看推荐,平台从中赚取广告费和交易佣金。如果这些过程都交给 AI,用户可能只记得自己的 Personal Agent,不再关心订单来自哪家平台。平台可能失去影响用户选择的机会,广告和佣金的议价能力也会受到挑战。
Muse 受到关注后,Airbnb、Booking、Expedia 等旅游公司股价承压,就反映了市场对这种变化的担忧:未来的交易入口,究竟掌握在平台手里,还是 Personal Agent 手里?
Muse 的解决方式,是借助大公司的资源和影响力,构建起一套 Agent 友好的商业生态。
在被亚马逊拒绝后,Muse 与美国买菜平台 Instacart 宣布合作。旅行技术公司 Duffel 也宣布,美国 Muse 用户已可查询实时机票库存和价格,处理预订、取消及后续行程。
在用户端,Muse 提供免费使用额度,吸引更多用户使用,先让用户体验 Personal Agent 的成果,再逐渐培养习惯。
让更多平台接受 Agent,需要处理商业准入、利益分配和交易责任,也需要持续投入。Meta 这样的大公司,有资源吸引用户,也有能力影响生态。Muse 火起来的意义也在这里:推动更多服务接入,让 Personal Agent 有更多可用的场景。如果这些合作能带来更广泛的开放,也会为其他团队创造机会。
但资源有限的创业团队,很难照搬大公司的投入方式。它们更需要靠技术和产品创新,争取生存和发展的空间。
创业公司的方案
吕骋曾在采访中提到,只有 15 人团队的 Rabbit,会通过 Action Model 的多次迭代来完善 Personal Agent 的能力。
2024 年 1 月,随着 r1 的发布,Rabbit 的第一代 LAM 上线,当时只能通过 r1 使用;10 月,Rabbit 单独推出了 LAM playground,可以在网页端使用,Agent 能根据用户要求浏览网页、查找信息和执行操作。
按照当时的技术说明,它会结合页面截图和网页结构,判断可以点击的位置,并随着页面变化调整下一步行动。遇到陌生网站,Agent 会自己找到入口,把目标拆成操作步骤实现——这也是目前大部分 Personal Agent 仍采用的技术路线。
2025 年 2 月,Rabbit 发布了 Android Agent 研究预览,将 AI 的操作范围扩展到安卓应用和设备的系统功能。几个月后,有 AI 手机沿用了这套技术路线,结果被各大 App 禁止访问了。
直到今年初,Rabbit 把 LAM 升级为 DLAM,让 Agent 接入用户自己的 Windows 和 Mac 电脑,在获得授权后操作浏览器和桌面软件。
这套方案的效果是,通过真实设备执行任务,能够有效减少云端代理访问时遇到的限制。执行环境也由云端虚拟机延伸到用户自己的电脑,原来安装的软件、保存的文件和进行中的项目,都可以由 Agent 直接使用和处理。
从这些发布时间看,Rabbit 在 Personal Agent 的探索一直在行业领先。到了 OS3,Rabbit 又开始整合这些能力,探索下一代 Personal Agent 还需要解决什么问题。
OS3 的新探索
就在 Muse Charm 亮相的前一天,Rabbit 发布了 OS3。
用户不必先买一台 r1。打开网页,连接自己选择的模型和电脑,就可以让 OS3 使用现有的文件、软件和工具处理任务。一个账户最多连接五台设备,用户也可以通过 iMessage、Telegram 或 r1 进行交互。
这次发布演示的一项重点,是让用户一次交代多项任务,看 Agent 能否接得住。

说完,他让 OS3 拆分任务、开始执行,自己在同一个对话里接着提问。
一个直观的交互变化,是 OS3 的网页主界面采用持续对话。用户可以在同一个对话里交代多件事,多个任务能在同时后台执行,互不干扰,用户自己还能继续提问,或者补充、修改前面的要求。
用户少做的安排,成了系统需要解决的问题:哪句话是新任务,哪句话在修改旧要求," 刚才那份文件 " 指的是哪一个,需要调取哪些已有信息。持续对话的意义,在于把一部分任务组织和上下文管理交给系统。
Rabbit 押注的是:个人助理应该能接住随时出现、不断变化的交代,让用户少花时间整理提示词和管理会话。
这个方向也有其它产品正在探索。Claude Code 近期开始测试的新版 Projects,同样让用户在一个主对话中提出需求,由 AI 拆分并协调后台任务。
OS3 还把这种安排延伸到了用户连接的设备上。听懂要求、拆好任务之后,它还得判断:需要哪些文件和工具,应该去哪台设备干活。
这涉及到 Rabbit 的第二个技术下注:接入用户已有的工作环境,并智能协调多台设备。
云端虚拟机有一个很直接的好处,那就是让用户可以关上电脑,任务留在云端继续执行。但除了平台访问的限制,还有另一项体验成本:用户需要把自己的工作搬进这个新环境。为了让 Agent 开始干活,用户需要在虚拟机重新登录账户、上传材料、配置工具。
但在用户自己的电脑里,这些东西早已存在:做到一半的项目、安装好的软件、几轮修改过的文件,以及长期积累的资料。

不过,接入用户的电脑,也意味着任务会受到设备状态的限制:电脑休眠或断网,在这台电脑上执行的任务就会停止。
OS3 采取的解决方案是,它支持连接最多五台设备,包括本地电脑、办公室机器,以及用户自己的云虚拟机。
如果任务需要某台电脑上的软件,就在那里操作;需要长时间运行的任务,则可以安排在持续在线的设备上。用户可以指定执行位置,也可以由系统根据任务智能选择某台设备,或在多台开机的设备间接力完成任务。
例如,OS3 可以自动找到在 A 电脑上的视频,然后使用有专业编辑软件的 B 电脑完成剪辑,再到登录账号的 C 电脑完成上传。能在多台设备间分配任务、接力执行的能力,目前似乎还没有其他 Agent 实现。
在实际使用时,我们尝试让 OS3 完成一项资料收集任务:调研 Muse Charm 并整理成报告,完成后发消息到手机。约 15 分钟后,手机就收到了 OS3 通过 iMessage 发来的完成通知,消息中列出了调研内容和报告在 iCloud 中的保存位置。

国内的几家模型也都支持接入,我们在测试时使用了阿里的 Qwen,表现非常好。
按照 Rabbit 的设计,更换模型后,此前积累的记忆、配置的技能和连接的设备可以保留。OS3 本身免费,使用云端模型需自备受支持服务的 API 密钥,并按用量付费。
Rabbit 希望 OS3 能承接这部分积累,底层模型可以更新,用户与 Personal Agent 之间已经建立的工作关系继续保留。一个 Personal Agent 逐渐知道你在做什么项目、习惯怎样处理文件、哪些事情此前已经讨论过,这些积累不应该随着模型更换而作废。
我们在 Rabbit 的 Community 里了解到,Rabbit OS3 上线三天内,新用户累计已成功完成超过 1 万个任务,用户使用自己的 API key 每天消耗总量近 10 亿 token,人均水平远高于大部分 Agent 类产品。
一个长期使用的 Personal Agent,还需要能核实任务结果,并把用户的反馈用到下一次工作中,让上次被纠正过的错误,下次能够避免。只有当用户越来越少地重复交代、检查和返工,Agent 才真正替人省下了时间。
模型进步能提升理解和执行能力,平台合作能带来更多可用的服务,而如何用好这些能力,仍需要产品不断探索。
下一代 Personal Agent,既需要生态为它打开更多可能,也需要一个个具体的创新,让它真正好用。