不 ber?写代码的大模型,还能帮忙满屋找鸭子?
Meta 最新释出的这段 demo,还真有点意思。
以 Coding 能力见长的Muse Spark 1.2,突然长出了具身手脚:
读画面、拆任务、定路线、调工具,再根据每一步的新观察修正行动,直到完成任务。
在另一段演示中,Muse Spark 1.2 还能指挥双臂机器人整理桌面,各种长链任务均不在话下。
发布半个月后,Meta 终于摊牌了……
Muse Spark 1.2 更强的二段技原来在多模态。
它可以同时完成视觉编码、机器人规划以及视听理解,并通过 Agent 工具将全部能力串在一起。
从 Meta 公开成绩来看,这颗「大脑」委实很顶:
高难视觉推理测试 ZeroBench 中,Muse Spark 1.2 狂揽 54.0%,与旗舰模型GPT-5.6 Sol也只差 0.6 个百分点。

继续押注多模态智能体,让它从感知走向行动,从数字世界走进物理世界。
以及……模型即将开源。

先划重点,演示中的 Muse Spark 1.2,并不是看一眼画面就直接输出机械臂的电机指令。
按照官方 blog 披露的架构,整套机器人系统分为上下两层。
上层是一款 Muse Spark 专用变体,负责充当具身总指挥。
用户给出一个抽象目标后,它先理解当前场景,识别周围物体和分清容易混淆的目标,再将整件事拆成一连串可以执行的子任务。
每个子任务则交由下层的同系列 VLA 模型执行。

都是接收目标后,拆分任务再逐步执行,只不过运行操作从写程序变成了移动和抓取,反馈内容也换成了摄像头画面。
具体来说,Muse Spark 1.2 会对视频进行深度理解和密集描述,持续提取其中的场景变化,并调用网页开发、实时搜索和空间定位等 Agent 工具,把音视频里看见的信息转成下一步可执行的任务。
而这也是 Meta 首次如此集中地展示 Muse Spark 的具身能力,足以说明模型的视觉感知、任务推理和高层规划已然成熟,可以将模型决策推入物理世界中。
除了指挥机器人,视觉编码也是 Meta 此次强调的重中之重。
它能够根据一张图片或者一段视频直接生成网页和游戏,效果 be like:
模型会先识别参考素材里的布局、层级、字体和视觉风格,再将这些信息翻译成能够运行的代码。
期间也会实时查看页面的渲染结果和交互行为,对照原始素材的偏差,再继续修改,这里依然是同一套自我迭代 SOP。
另外,模型在 Design Arena 的多项榜单上均排名靠前,尤其是 " 视频生成网站 " 上位列第一。

为了更好地判断多模态 Agent 在真实任务中的交付能力,Meta 还同步预览了一套内部评测工具——WildArtifactBench。
首批公开的 10 项任务覆盖得相当杂:
识别鸟鸣、分析心脏超声、判断冠状动脉狭窄、生成猫的 3D 网格、设计厨房布局、创建强化学习驾驶训练器、编辑视频……

其中要求模型不仅能听懂,还要管理文件、记录判断、按照指定格式输出,并接受程序逐项验证。
难度相当之高,市面现有模型的表现均距离满分相差甚远。

比如和 Muse Image 混合食用,协同完成智能媒介生成,同时输出精细的图像描述,作为 Muse Image 和 Muse Video 的训练数据。
Muse Spark 还可以把原始文本和图视频内容打包整理成特征信号,供后续业务继续调用。
外部开发者也可以通过Meta Model API和Muse Code使用到 Muse Spark 1.2,后续还将正式开源。
参考链接:
[ 1 ] https://x.com/AIatMeta/status/2090485743034716420
[ 2 ] https://x.com/alexandr_wang/status/2090485261629354352
[ 3 ] https://research.meta.ai/blog/multimodal-intelligence-of-muse-spark-1-2
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见