关于ZAKER Skills GEO服务 合作
量子位 13小时前

视觉 AI 上线经验积累新范式,图像策略也能直接迁移到视频生成

重绘一张涂鸦后,AI 都学会了什么?

涂鸦变成鲜花,鲜花再长成一片花田——每一步的输出都是下一步的输入,中间任何一环偏了,误差就会沿着流程一路传下去。而当视觉 AI 完成了全部规划和试错,正确的经验能留下来吗?

由北航、港中文与新国大团队共同完成的OmniHarness给出了一种办法:参数不变,把做对的流程收进方法库,让下一次创作有经验可用。

画得出脑洞,改得准细节

从一张花朵涂鸦开始。

先重绘成写实红花,再沿用其风格生成花田。

前一步的结果,成为下一步的参考。

四格漫画要串起 " 醒来—看手机—发现周日—继续躺平 " 的剧情,兼顾动作、文字和画面衔接。

海报与书封,还要满足指定内容、标题和布局要求。

局部编辑更考验分寸:移除叉子或换成勺子,还要保留食物、杯子和桌面布局。

" 其他地方,尽量别动。"

一次成功,怎样变成一类任务的方法?

画对一次之后,换张图片、换个主题,经验还能派上用场吗?视觉智能体要走向实际创作,就绕不开这个问题。

OmniHarness 通过符号策略学习,把验证有效的做法提炼成一类任务可复用的方法。

红花和输入草图,是这道题的细节;" 先重绘、再用结果引导生成 ",则是一种可迁移的做法。换个主题,这条流程仍可作为适配新需求的起点。

策略是一套带使用说明的工作流:保留共享步骤、适用条件和依赖资源,去掉当前任务的具体输入。

新任务到来后,系统检查条件、填入新输入,再调整或组合已有策略。

自己出题、边做边检查、把经验留下来

第一步:挑选 " 踮踮脚够得着 " 的挑战

任务未到,先练起来。

反复练熟悉的题,收获可能有限;题目远超当前能力,也容易陷入低效尝试。选题要兼顾探索价值与现有方法的支撑。

默认每轮提出 10 个候选任务,按新颖性与能力边界评分的乘积选题:

其中,为候选任务集合。

新颖性看哪里练得少;能力边界评分看难度是否适合当前能力。

新颖性随尝试次数递减:

其中,为所需能力集合,
统计对应 " 情境—能力 " 的练习次数。图生图按源图区分情境,文生图使用统一标记。

对所需能力取平均,还能避免任务仅因包含更多能力,就获得更高的新颖性评分。

系统按调用与验证成功次数估计可靠性,取95%Wilson 置信区间下界;每项能力选最可靠的适用且未停用工作流。

任务能力估计由最薄弱的一项决定:

多步任务的短板,可能决定全局:某个关键环节缺少可靠方法,就会拖累最终结果。

再计算能力边界评分:

当 =0.5 时评分最高,能力估计接近 0 或 1 时评分降低,鼓励探索有基础、仍有提升空间的任务。

这里的是基于策略可靠性的能力估计,并非任务真实成功率。

第二步:边做边检查

系统先规划步骤与依赖,再将代码转换为 ComfyUI 工作流,验证流程可执行性、中间结果与最终输出。

中间验证尤其关键。如果红花已经偏离要求,继续用它生成花田,偏差可能沿流程传递。及时检查,才能尽早调整。

发现问题后,定位并修复失败环节,保留已验证部分;必要时调用子智能体,在有限重试内重新验证。

第三步:把经验留下来

成功流程抽象为策略;失败留下证据、原因和修正办法。系统持续更新可靠性、合并等价流程,让新经验参与下次选题与执行。

成功一次,也不意味着从此可靠。后续调用的成功与失败,会继续影响策略的可信度和复用优先级。

创意任务解决率 95%,提升在哪里?

在 ComfyBench 创意任务上,OmniHarness 解决率达 95%,比最强对照 SymbOmni 高27.5 个百分点;Codex GPT-4o 配置总体达 92.5%。

Pass 衡量工作流能否运行,Resolve 衡量结果是否满足要求。

两种配置的工作流运行通过率均为 100%;ComfyMind 和 SymbOmni 也已达到这一水平。因此,更值得看的是流程跑通后,究竟完成了多少任务。

同用 GPT-4o,OmniHarness 总体解决率为 89.5%,高于 ComfyMind 的 83%;创意任务为 95%,对照为 57.5%。

同用 GPT-4o 仍有提升,支持了整体框架的有效性,也让工具组织与经验复用成为值得进一步观察的因素。

换成 Codex 规划配置,总体解决率从89.5%升至92.5%,复杂任务从 76.7% 升至 83.3%,体现了规划配置对多步流程表现的影响。

复杂任务仍有进步空间:Codex 配置为 83.3%,略低于 ComfyMind 的 85%。

换个智能体、换成视频,经验还能用吗?

自主练习得到的策略库保持冻结,经知识接口适配交给其他智能体使用,保留宿主控制流程,不微调模型。

这份策略库既包含可复用的工作流模板,也包含失败证据与修正方法,供其他智能体通过自身的检索、规划和执行流程调用。

接入后,总体解决率变化如下:

ComfyAgent:32.5% → 57.0%。

ComfyMind:83.0% → 88.0%。

SymbOmni:86.0% → 89.0%。

创意任务解决率分别提升 27.5、17.5 和 10 个百分点。

三个系统在创意任务上的增幅,都高于各自的总体增幅。这提示,面对新的创作要求,可调用的方法和修正经验尤其值得重视。

只用图像任务练习得到的冻结策略库,还能参与视频生成。

视频总体解决率达85.9%,比表中最佳对照高5.1 个百分点;视频到视频任务达 80.0%,比该对照高 13.3 个百分点。

图像策略支持内容构建、参考保持等操作,视频专用组件处理时序,二者经适配和组合完成任务。

让每次实践,都留下方法

OmniHarness 让经验成为可积累、可复用的能力资源。自主练习与多轮检查仍有计算开销,后续需优化检索、验证与推理预算。

完成任务之后,还能留下些什么?OmniHarness 的回答是可验证、可调用、可继续修正的方法。让下一次行动接住上一次的经验,是这条研究路线的价值。

论文全文:https://arxiv.org/abs/2609.16057

项目主页:https://omniharness.github.io/

代码与运行说明:https://github.com/OmniHarness/OmniHarness

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

— 完 —

【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目 / 主页链接,以及联系方式。

我们 ( 尽量 ) 及时回复你 : )

点亮星标

科技前沿进展每日见

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容