超 20 家机构抢着 " 上车 "?
作者 : 壹小姐
编辑 : Koji
排版 : NCon
7 月 20 日,在世界人工智能大会上,智象未来发布一款不限时长的内容创作多模态智能体 vivago R1。用户只要上传几张照片,配合简短的文字描述,就能生成分钟级长视频。
随后不到三天,这家公司接连宣布完成 15 亿元人民币的 C 轮融资。最近三个月,它已经陆续完成三轮融资,累计金额超 21 亿元,跻身独角兽行列。
一家成立仅三年的 AI 公司,凭什么在这个时点,获得超 20 家顶级机构的密集押注?3 个月密集完成 21 亿融资的背后,这家公司的最新产品 vivago R1 具体表现如何?
当 AI 学会 " 像导演一样思考 "
AI 视频生成领域,存在一个典型痛点:大多数工具只能产出 15 到 30 秒的短镜头,内容一旦变长,人物容易变形,而用户如果想调整一个角色或一段情节,通常要从头生成。
vivago R1 的第一印象,是它试图用 " 长程推理(Reasoning)" 来解决这些问题。
它更像是一个能够自主规划任务、调度资源、持续推进创作的多模态智能体,而不是一个 " 提示词进、视频出 " 的黑盒工具。
上手之后,你会有一个直观的感受是:它把创作方法变成了产品。海外很多内容创作者也给到 vivago 很积极的反馈。
在 vivago R1 的设计中,Skill 不再是单纯的功能按钮,而是创作方法的产品化封装。
它把原本属于专业创作者的脚本拆解、镜头组织、素材继承、风格控制和生成顺序,压缩成了一套用户可以直接调用的方法。
用户不需要理解模型参数和工作流,只需要知道自己要做产品广告、故事短片还是品牌内容,Skill 负责把目标翻译成 Agent 可以执行的 " 工作协议 "。
SkillHub 是这些方法的组织系统。
它把抽象的 AI 能力翻译为用户可感知的创作场景,让用户从 " 我想做什么 ",快速进入 " 我现在可以开始做 "。
截至目前,SkillHub 已经沉淀了数百个经过真实项目验证的创作 Skill,从跨境电商的爆款素材生成,到影视团队的分镜制作,到个人创作者的剧情号运营场景。
支撑这套 Skill 体系的是 vivago R1 的分层记忆与多 Agent 协作架构。
这里我们用最直观的方式讲讲它是怎么 " 像人一样工作 " 的:
最上层是调度层(Orchestrator)。
它像一个总导演,只沉淀最终定稿——角色设定是什么、叙事主线是什么、哪些决策已被确认。过程噪声在这里被过滤掉,系统不会因为一次失败的生成而 " 记仇 "。
中间是专家层(Specialist Agents)。
这里驻守着编剧 Agent、导演 Agent、设计师 Agent、剪辑师 Agent ——每个专家都有自己的独立记忆,负责各自专业环节。编剧 Agent 记得故事线的推进,导演 Agent 把控镜头语言的一致性,设计师 Agent 守护视觉风格的统一。
最下面是执行层(Execution Agents)。
负责分段并发生成。每个执行子 Agent 只处理一段任务,用完即走;如果某一段失败,只重试这一段,不影响整体进度。
在 WAIC 上,智象未来创始人兼 CEO 梅涛把这套机制的运行逻辑概括为:记忆逐层变轻,定稿逐层上浮。
这非常贴合真实创作者的直觉——一个导演不会在拍第二场戏时还纠结第一场戏的每一个细节,被确认的东西上浮为定稿,被舍弃的细节沉入记忆底层。
除了架构,vivago R1 的交互方式也让创作者觉得 " 顺手 "。它同时给了两个视图:Chat 和画布形式。
Chat 是任务推进视图,负责承接用户意图输入、素材装配,以及用户与 Agent 持续协作的 " 时间轴 ";画布是项目上下文视图,负责将创作过程中形成的关键内容重新组织成可浏览、可判断、可复用的结果空间。
这种设计,让用户既能在 Chat 中 " 边聊边创作 ",也能在画布中整体把握项目进展。
视频做完之后,还有一个对用户非常友好的细节:它可以直接绑定 TikTok、YouTube 等海外账号,一键分发。不用再走 " 导出文件—打开平台—重新上传—填写信息—再次调整 " 那一套繁琐流程。对创作者来说,这一步的 " 顺滑 ",往往是决定日更还是弃更的关键。
从 SkillHub 的方法引导,到分层记忆的多 Agent 协同,再到 Chat+ 画布的双视图协作,最后到一键分发的链路闭环,vivago R1 试图构建一个能够在用户意图引导下,完成从创意到发布全流程的 " 创作 Agent"。
这背后的一个核心趋势是:视频生成的下半场,不仅需要更好的模型,更需要能思考的 Agent。
超 20 家机构抢着 " 上车 ",合肥又押中一个独角兽
7 月 23 日,智象未来宣布完成 15 亿元人民币 C 轮融资,相比资金数额,更值得关注的是这笔融资的 " 速度 " 和 " 资方阵容 "。
三个月三轮,累计超 21 亿元。
今年 4 月,智象未来刚刚宣布完成超 5 亿元融资,引入东方富海、安徽省投资集团旗下省产业投资公司、峰华资本等机构;随后 5 月,又获得深创投、金浦投资、财鑫资本、复聚资本等新一轮注资;7 月,C 轮 15 亿元火速敲定。
在资方阵容方面,智象未来已经形成了 " 国家队 + 地方国资 + 产业资本 + 顶级财务机构 " 的多元强股东结构。
领投方包括社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本;跟投方包括厦门国贸资本、上影新视野基金、湖北长江产业投资集团、华策影视、航源资本、创云海资本、华福投资、余杭金控股份、交银资本、若松基金等;老股东合肥产投、东方富海、金浦投资、金华金投、中哲创、财鑫资本持续加注。
这笔融资背后,作为耐心资本的社保基金已经入局。这是社保基金在原生全模态世界模型方向的重要布局信号。
在产业资本方面,除 C 轮进入的华策影视、上影新视野基金之外,湖北长江电影集团已在 A 轮入股。三家影视产业资本同时出现,这在 AI 大模型公司的融资中并不多见。目前,华策影视已设立 AIGC 专项基金和 AI 视频投资基金。
而在所有资方中,合肥产投尤其值得关注。
作为一家总部落地合肥的公司,智象未来的融资历程与合肥国资深度绑定。早在 2024 年,公司便获得合肥产投、安徽省人工智能母基金领投的 A 轮融资;今年以来,两家机构继续跟投,安徽省产业投资集团、合肥高投、兴泰集团等也陆续进入股东名单。加上本轮创云海资本、航源资本等合肥力量入场,合肥背景机构已基本覆盖智象未来 A、B、C 多轮融资。
这背后,是 " 合肥模式 " 在人工智能领域的一次延伸。
过去十年,从京东方、长鑫存储到蔚来,合肥国资的打法并不是追逐短期风口,而是围绕关键产业链提前卡位,借由龙头项目带动产业集聚。
今天押注智象未来,逻辑同样如此:AI 正在成为新一轮产业基础设施,而视觉生成,以及原生全模态大模型则是其中最具应用外溢性的方向之一。
今年以来,智象未来已多次作为合肥在人工智能、尤其是世界模型领域的标杆企业,亮相中国科交会、链博会等国家级展会。从算力基础设施到 AI 应用生态,智象未来正在成为合肥 AI 版图中的一块关键拼图。
如果说长鑫存储对应的是存储芯片,蔚来对应的是新能源汽车,那么智象未来所处的原生全模态大模型赛道,对应的可能正是合肥下一张 " 产业名片 " ——生成式人工智能的基础设施。
从 " 生成内容 " 到 " 生成世界 "
这批密集融资背后,智象未来想要重新诠释 "AI 与现实世界 " 的关系。
在 WAIC 2026 的主题演讲《迈向世界模型:原生全模态推动智能体能力跃迁》中,梅涛系统阐述了智象对下一阶段 AI 演进方向的判断。他抛出了一个核心命题:
AI 大模型正在从 " 理解世界 " 走向 " 改变世界 "。而通向这一目标的关键,是原生全模态世界模型与智能体的双线并进。
在他看来," 世界模型 " 虽然被频繁提及,但行业路线并不统一:有人从 3D 空间建模切入,有人从长视频生成逼近世界模拟,也有人沿着具身智能路线解决动作规划和物理交互。
智象选择的,选择原生全模态(UiT)路线,它在最底层把 " 世界的运行规律 " 刻进模型 DNA 里,让模型以统一的方式理解视觉、语言、动作和空间关系。正是这一架构,让智象具备了 "Any to Any" 的能力:任意模态输入,都可以支持任意模态输出。
梅涛用一句话概括了智象的技术信念:
图像是通往世界的起点,也是重塑世界的入口。
在他看来,图像不只是图像,还承载着时间和空间:在图像序列中加入时间维度,就变成了视频;加入立体几何,就构建了 3D 世界;与真实世界完成交互和操作,就是具身智能。这条路径背后,是智象对 " 从多模态走向原生全模态、再走向世界模型 " 的完整判断。
在 WAIC 演讲的最后,他用一句话总结了这条路线对 AI 未来的意义:
大模型负责让 AI 理解、感知世界,智能体赋予 AI 执行、行动的能力,原生全模态世界模型则打通认知、行动与反馈闭环,推动 AI 从内容生成走向改变现实世界。
据智象未来官方披露,其自研的 UiT(Unified Transformer)原生全模态架构,闭源 Pro 版本参数量已突破 2000 亿;vivago R1 依托 HD-AgentOS 全流程调度与治理能力,内容有效可用成功率达到 85%。
今年 6 月,智象未来商用图像模型 HiDream-O1-Image-1.5,在独立 AI 模型评测平台 Artificial Analysis 上以 1265 ELO 的评分位列全球第二,仅次于 OpenAI,超过 Google、NVIDIA 和字节跳动等巨头的同类产品。
从 2017 年,梅涛带领团队在微软亚洲研究院发表了全球第一篇文生视频论文,到 2026 年 vivago R1 实现让普通用户一键生成连贯的长视频。AI 视频的进化速度,比所有人预想的都要快。
当几十秒的短片不再需要几十人的团队,当 120 分钟的剧集可以被压缩到 1 个月甚至更快完成,那些原本被成本和技术门槛挡在门外的创作者,会创造出怎样的新叙事?
答案,可能才刚刚开始被写下。
十字路口正在寻找独立撰稿人,撰写 AI 产品和模型评测。
如果你写过类似文章:《实测 PixVerse C1 [ 1 ] 》、《实测 LibTV [ 2 ] 》,请联系 zeo0811@gmail.com ,邮件内容请包括:① 个人介绍、② 你写过的 AI 评测文章。
我们会提供有竞争力的稿酬。期待与你一起观察与记录 AI 时代