斯坦福大学生给 GPT-6 准备了一只机械臂、一支画笔和一台相机,然后让它画金门大桥。
这次,画笔真的落在了纸上。在他发布的演示里,机械臂带着画笔移动,逐渐留下桥的轮廓。负责安排动作的,是 OpenAI 前段时间新发布的 GPT-6 Astra。
GPT-6 Astra 看着摄像头传回的画面,自己琢磨出怎么驱动机械臂,握住笔,蘸颜料,落笔,每一遍画的都比上一遍要好。
这段一分钟的视频在 X 上很快获得了 200 多万次播放,连奥特曼也转发并回复说「我也想要一个。」
过去几天,围绕 GPT-6 出现了不少这样的演示。有人让它在 Blender 里建模,有人让它去 Minecraft 找钻石,还有人把画肖像的任务交给它,自己看着软件里的画面慢慢成形。

尽管一项任务可能需要持续执行许多轮,途中还要处理报错、改计划、换工具;GPT-6 大多数时候都能凭借 Computer Use 的能力准确无误地操作,配合工具读取界面、操作软件,并检查操作之后发生了什么。
Blender,这个在 GPT-6 之前用于 3D 建模的专业软件,一时间变得像是办公软件一样;只要你会用 ChatGPT,就可以用 Blender 来做 3D 建模。
一个从没用过 Blender 的博主,在自己的备用 Mac 上装好软件,发提示词让 Astra 制作一架航天飞机。模型查找资料,编写脚本,开始操作 Blender。

有人让它在 Blender 里做一只照片级写实的蝙蝠。GPT-6 就一直做,一直改,直到用户的 token 耗尽才停手。

他说「虽然完成度确实还不到位,但我第一次真切感到,不再由人手工制作 3DCG 的时代开始了。」


更有意思的 Computer Use 玩法,还有用来操作游戏。
有人睡前给 GPT-6 留了个作业:在《我的世界》里用 Computer Use 挖一颗钻石。挖钻石本来在 Minecraft 里是件麻烦事,要下矿、要躲怪、要先造出整条工具链。

还有人让 GPT-6 打开浏览器里的画图工具给自己画肖像,甚至是让它把 Google 日历的日程格当成像素画布,用一个个日程事件「画」出了一幅迈克尔 · 杰克逊的肖像。

知名的「威尔 · 史密斯吃面」作为 AI 能力进步的民间计量单位,又往前翻了一页。

图|左边是 2023 年那个诡异的「威尔 · 史密斯吃意面」AI 视频,右边是 GPT-6 Astra 在 Mac 上用 Blender 5.1 重建的威尔 · 史密斯头像。
早在 OpenAI 发布 GPT-6 Astra 时,官方演示视频的口号就有一句:「你在电脑上能做的任何事,Astra 都能替你做。而且快。」

Computer Use 是这项新技术中一个尤为重要的组成部分。我认为它已经跨越了质的门槛。
事实上,它已经从过去那种缓慢、令人痛苦的运行方式,发展成为如今这种非常精准、高效且可靠的技术。因此,Astra 无需 API 就能用计算机完成人类能做的一切。
这一次,GPT-6 是怎么做到的
所以,为什么 GPT-6 在 Computer Use 的进步如此之大,就连那些复杂的专业软件,现在它都能操作了。
Browserbase 的增长工程师 Kyle Jeong 扒完了 OpenAI 官方开源的 Codex 仓库代码后,写了一篇技术拆解,他提到要理解 Astra 为什么强,得先回看 GPT-5.6 时代的 Codex / ChatGPT harness。
Computer use 是一个 harness(工程)+ model(研究)的双重问题 —— 模型决定做什么,harness 负责做。

这条路线的脆弱之处在于,显示器换个分辨率,模型可能就认不出按钮了。
Astra 换了一种方法,在针对浏览器的电脑使用里,它放弃了像素读取,直接使用「无障碍树」(Accessibility Tree)进行识别。

同时,截图仍会提供实际画面,一个输入框的名称可以写进可访问性树的清单,但画布上的笔迹、三维模型的形状却需要从图像中观察。GPT-6 Astra 可以结合两种信息决定如何操作,不必只凭屏幕上的坐标寻找每一个按钮。
另一方面,更关键的是所谓「代码模式」:与其说 Astra 学会了「用电脑」,不如说它学会了写脚本替自己用电脑。
任务开始后,它会拿到一个持续在线的编程环境(Node REPL,一个「写一句、跑一句、马上看结果」的交互式窗口,整个任务期间状态一直保留),然后在里面写代码,用 Playwright 控制浏览器,用 PyAutoGUI 控制桌面。

操作电脑这个动作,就这样被它内化成了一次又一次的小规模编程。另外,在安全层面还有一道叫 Guardian Policy 的闸门,即后台有一个专门模型对每一步动作做风险分类,高风险操作会停下来等人类批准。
这套工作流程也能很好地解释了官方基准里的数字,在 OSWorld 2.0 上 Astra 得分 72.6%,比前代的 65.7% 高出一截,而单任务平均耗时从 75 分钟降到了 40 分钟。

专栏作者 Tae Kim 在 Substack 上认为 GPT-6 这次的发布是一个新的热潮。
Computer Use 是四年里的第四波指数级需求浪潮 —— 第一波是聊天机器人,第二波是推理模型,第三波是智能体编程,第四波,是智能体操作电脑。
也有网友说,除了去年十月到今年二月,OpenAI 没能赶上 Claude Code 的低谷期,它几乎是发现「下一个热门技术」的王者。

图|引用来源:https://benhylak.substack.com/p/openai-did-it-again-but-what-did
1.只需增加更多计算即可(transformer)
2.再把它做成聊天机器人(ChatGPT)
3.让它执行操作(工具调用)
4.教它如何思考(推理模型)
而随着 GPT-6 的推出,他们揭示了第五点:
5.Computer Use 计算机使用
从操作电脑上的软件,到操作设备
的确如此,回看过去四年的 AI 发展,聊天机器人教会了模型听和说,推理模型教会了它想,编程 agent 在文本的环境里教会了它做,而 Computer Use 把「做」这件事又推广到了整个数字世界。
前几天,Greg Brokman 在接受 Stratechery 的专访里,回忆了一段往事:2015 年 11 月 OpenAI 创立之前,他们想做的第一件事,就是让模型看着屏幕像素、操作键盘鼠标,端到端地学会用电脑。

图|https://stratechery.com/2026/an-interview-with-openai-president-greg-brockman-about-astra-and-alignment/
这个初心当时没做成,于是过去两年成了他口中的「连接器时代」,即想让 AI 用什么软件,就给它写什么 API 连接器,一个软件一个接口,一家厂商一份定制。
直到 GPT-6 发布,他说,「现在,我们终于有了一种几乎是万能连接器(almost this universal connector)的技术。」
如果模型看屏幕、动键鼠就能操作任何软件,那么「屏幕 + 输入设备」这个组合就不再只是个人电脑的形态,而是几乎所有可以通过视觉完成的任务。
今天是操作一台电脑,下一步顺理成章的就是模型成为架在所有设备之上的统一抽象层。所谓的接口变成了「看和点」这种人类级别的通用协议,让设备之间第一次有了一种共同语言。

图|GPT-6 与 ENPIRE 英伟达机器人技术平台,GPT-6 Astra 能够以零样本的方式进行机器人上下文学习。
不同设备上的接入条件并不相同。Google Play 明确限制应用借助 Accessibility API 自主规划和执行动作,对符合条件的残障辅助工具设有例外;iOS 则通过应用沙箱限制跨应用的数据和资源访问。手机上的系统权限和分发规则,会直接影响第三方 Agent 能采用哪些操作方式。
但机器人领域的测试者已经拿到了第一批量化证据,RoboCurve 基准里,GPT-6 Astra 直接输出机械臂末端的位姿指令,在「把积木放进碗里」的任务上 20 次成功 19 次。对照之下,Claude 最新的 Fable 5.1 只有 40%。

当模型学会通过「看和点」操作软件、通过位姿指令操作机械臂,数字世界和物理世界之间差的似乎从来不是智能,只是需要一个驱动层。

GPT-6 Astra 用机械手解开了魔方
在电脑上,它是屏幕和鼠标键盘;在机器人身上,它是电机的位姿指令。驱动层两边,跑的是同一套智能回路 —— 感知,决策,行动,观察反馈,再来一次。

OpenAI 在 GPT-6 Astra 的发布视频里特意致敬了它。四十七年后,机器不但能把屏幕上的东西放到那里,还拿起了画笔,开始学着把颜料放到画布上该在的位置。
