" 大厂是一挺机枪,子弹打不完;创业公司只有一个弹夹,每一发都要打向未来。" 说这话的人叫梅涛,京东集团前副总裁,加拿大工程院外籍院士。
2023 年,他离开京东,在合肥创立了智象未来。彼时 ChatGPT 刚刚引爆全球 AI 热潮,大多数创业团队一头扎进大语言模型,梅涛却选了另一条路——多模态生成。

这家总部位于合肥的多模态人工智能公司宣布完成 15 亿元 C 轮融资。加上 4 月的超 5 亿元和 5 月的亿级融资,短短三个月内,这家成立仅三年的公司累计融资额已突破 21 亿元,投后估值超过 10 亿美元,正式跻身独角兽行列。
从社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,到上影新视野基金、华策影视,投资方阵容横跨国家队与影视产业资本,智象未来背后是对一条特定技术路线的集体押注。
智象未来从一开始就选了条不一样的路。
创始人梅涛在计算机视觉与多模态领域深耕超过二十年,2017 年带领团队在微软亚洲研究院发布了全球首篇文生视频论文。联合创始人兼 CTO 姚霆同样出身微软亚研,曾参与 Bing 视频搜索和小冰视觉对话系统的研发。这样一个学术与产业双重背景深厚的创始团队,在 2023 年创业时做了一个反直觉的判断:不扎堆大语言模型,押注多模态生成。
他们的判断依据是:纯文本只是信息的一种载体,而多模态天然包含图像、视频、音频和物理世界信号,更接近 AGI 的入口。基于这一判断,智象未来自研了 UiT 原生全模态架构——不搞图像和文本分别编码再对齐那一套,而是把所有模态映射到同一个 Token 空间,在统一系统中完成理解、生成和推理。
梅涛将其概括为 " 对人类社会感知方式的还原 ":人看到台风新闻会联想到狂风和雷声,多种感知协同工作,而非单一模态独立处理。
在 Artificial Analysis 榜单中,智象未来的智象未来 HiDream-O1-Image-Dev-2604(8B 开源版本)位列文生图开源榜单全球第一;闭源商用版 HiDream-O1-Image-1.5 位列 Artificial Analysis 文生图总榜全球第三、中国厂商第一,ELO 评分为 1265 分,超越字节跳动 Seedream 4.0、谷歌 Nano Banana 2、英伟达 Cosmos3 等主流模型,仅次于 OpenAI 的两款闭源模型。

技术壁垒之外,商业化落地也在同步推进。
智象未来构建了 "1+1+3" 战略体系:一个模型底座、一个 Token Hub 标准化输出平台,以及商业营销、影视创作、内容创作三大垂直场景。截至 2026 年第一季度,产品已覆盖全球超 100 个国家和地区,服务超 5000 万专业用户和 4 万余家企业客户。
正是这套组合拳,吸引了从国家队到产业资本的多方下注。
今年 4 月,完成超 5 亿元融资;5 月再获亿级融资;7 月的 15 亿元 C 轮则集结了近 20 家机构。合肥产投更是从 A 轮跟到 C 轮,累计投资 1.15 亿元,与公司深度绑定。
不过,市场对 " 世界模型 " ——表达世界、推演世界、构造世界的定义远未达成共识。
梅涛在世界人工智能大会上提到,行业通常将世界模型概括为 "model the world",他更倾向 "mold the world" ——塑造世界。在他看来,真正意义上的世界模型需要同时具备对物理规律的理解与建模、对长上下文因果关系的处理、与物理世界的多模态感知交互三类核心能力,当前所有模型距离这一目标仍有距离。
从多模态生成出发,沿着 " 以图入视、以视入世 " 的路径探索世界模型能力,是智象未来的技术路线图。21 亿元融资为这条路注入了充足燃料,但将 vivago R1 从展会 demo 转化为规模化商业交付,才是这家新晋独角兽面临的真正考验。
当前多模态生成赛道仍处于快速迭代期,技术落地与商业化交付能力,将是决定公司长期价值的核心变量。正如梅涛所说,创业公司只有一个弹夹,每一发都必须打向未来。现在,子弹已经上膛。
来源:星河商业观察