文|王欣逸
编辑|张雨忻
一句话介绍
国内唯一做多模态长记忆的公司——丘脑智能,推出原生多模态记忆基座,押注 AI 从通用走向个性化,最终走向主动智能。
主动智能,指的是 AI 能在足够了解用户的基础上,在合适的时间、以恰当的方式主动跟用户交互。要实现主动智能,Memory 是必须要跨过的门槛。
融资情况
近日,丘脑智能已完成数千万元种子轮融资,投资方包括深圳一线基金和产业资本,本轮融资主要用于技术研发以及人才队伍补充。
团队介绍
丘脑智能创立于 2025 年 11 月,创始人兼 CEO 张源毕业于北京大学,是电子与经济双学科背景,曾在一家自动驾驶公司担任 COO,也有过创投行业、具身智能的工作经历。
团队平均年龄约 26 岁,核心人员主要来自阿里达摩院、腾讯、商汤、港中文、港中深、北大、西交大、KIT、复旦等企业和高校。
产品及业务
Memory 领域的行业共识,最早于 2025 年底在学术界率先形成。这是一个非常新的领域,在面对投资人时,张源常常被问到一些问题,比如,基模会不会自己把记忆做了?Memory 这一层到底会不会独立存在?基模和记忆企业之间应该怎么分工?
这些问题,张源有一个坚定的回答:记忆层一定会作为独立的基础设施长期存在。
她对此解释,不同厂商的基模基因和训练语料各有差异,擅长的任务也各有侧重,用户不断在几家模型之间切换,这导致记忆孤岛的问题长期存在。AI 从通用走向个性化的过程中,缺少一个能持续学习记住用户的中间层。因此,以用户为中心的第三方记忆层必然会独立于基模之外而存在。这恰恰是张源看到的机会。
不过,对于她而言,首先要做的是直面行业尚未解决的问题。现阶段,Memory 领域存在着一定痛点:
一是成本问题,多数方案直接把海量上下文全量塞入窗口,导致推理成本非常高;二是上下文断裂问题,跨 session、跨任务的对话难以有效衔接;三是模态缺失问题,现有记忆方案大多局限于纯文本,无法处理视觉、音频等多模态信息。
不仅如此,由于 Transformer 架构导致了持续的时序错乱,目前大模型无法理解时间。在 Agent 的协作中,记忆孤岛往往也影响着任务执行效果,用户信息被封锁在各个 Agent 之中,难以实现互通。
张源认为,AI 要真正融入物理世界,就必须从设计之初就以人类的多模态感知为参照。记忆架构从一开始就应该是原生多模态的,而不是先把信息转成文本再存储。
因此,丘脑智能在 6 月上线了一个名为MemAura的记忆基座,向客户提供 ADK(智能体开发包)和 API(应用程序编程接口)的服务。
MemAura 能支持长记忆的积累和快速的记忆调用,采用高效的上下文机制,还能有效降低推理成本。从成绩上来看,MemAura 的性能表现亮眼:输入侧 Token 综合消耗降低 40%-49%,记忆检索延迟控制在 400 毫秒以内,端到端首次回答可做到 1 秒以内,综合准确率可以达到 80% 以上。
在记忆处理流程上,MemAura 的做法和传统记忆系统的处理有很大的不同。
传统记忆系统通常会对用户输入进行抽取、压缩与摘要,然后存入原始信息库,再通过特定架构或图谱进行存储,最终依赖 Agent 模式进行检索。
不过,MemAura 采取的策略是,他们做了一套仿生的记忆处理机制,具体流程分为三步:首先是对事件进行识别,模仿人类记忆机制,保留关键信息,并过滤掉冗余的噪声;随后,MemAura 会对过滤后的信息进行编码;第三步是,做好信息的分区,对隐私与非隐私记忆进行分区隔离。
此外,他们还采用了冷热存储的策略:对于高频访问的证据,采用热存储以实现快速检索;而对于低频数据,进行冷存储以节约资源。这样既能确保核心数据随时可访问,又能有效控制整体成本。
张源告诉我们,在多模态记忆领域这个万亿级的赛道上,丘脑智能目前还没有面临着直面竞争。尽管这个赛道可以容纳下很多选手,但现在只有几家创业公司在关注这一赛道,估值最高的公司仅不到 20 亿元,竞争谈不上激烈。
丘脑智能现阶段主要的客户包括一些出货量比较大的陪伴硬件,如陪伴机器人等,以及一些垂类 Agent 场景,如 AI 客服、数字员工等领域,客户通过记忆 API,帮助基模在回答与执行任务时调用原始信息,从而提升交互效果。
因为不同场景对于记忆能力的侧重点各有不同,比如 3-5 岁的儿童陪伴型产品与 18-25 岁的陪伴型产品,其中的要求差异相当大。张源告诉我们," 我们不想做更高的定制化,因此,我们把 Memory 能力按照场景地图的权重,封装成了不同的 ADK,客户可以选择 ADK 接入。"
在商业模式上,MemAura 以 API 调用量及场景授权组合的方式收费,客户可按需选择不同层级的记忆能力。
" 现在我们客户大部分还聚焦在纯文本或文本加语音。随着多模态相关技术的成熟,客户的模态会更丰富,也会有更多具身场景的客户前来验证。" 张源说。
核心壁垒
从公司成立至今,他们的技术路线已完成两次迭代,正逐步探索第三次迭代。
第一代是 STKG 时空知识图谱,具体做法是:他们将时间和空间放在物理层,把多模态感知信息放在感知层,并构建起一个认知层形成认知网络,进行前向推理。
其 Benchmark 表现非常不错,在 LoCoMo(推理与时序)与 LongMemEval(交互与偏好)两个测试中均拿到了 SOTA。
不过,对于客户而言,到达一定临界值后,Benchmark 提高分值的意义并没有那么大,客户更在意的是延迟和 Token 支出。因此,他们做了一些工程化上的权衡,进行了架构层的迭代,转向模仿人类海马体的编码与认知地图、皮质层整合的方式构建记忆体系,建立起仿生记忆架构 MemAura。
在数据上,MemAura 实现了一个量级的领先。现在传统的线上客服场景,其延迟可能会达到 10 秒左右,在陪伴场景的延迟会在 2 秒左右,而 MemAura 可以做到延迟控制在 400 毫秒以内。
目前,关于 Memory 的技术,丘脑智能仍在不断探索之中,他们正在通过E2P(Embedding-to-Prefix)的相关技术方式以及对 transformer 架构进行微调来实现下一步的迭代;目前在实验室环境下做到大幅度节省 Token 支出以及偏好抽取领域近似持续学习的效果。
2026 年 5 月,丘脑智能还联合英伟达、港科大、港中文发布了全球首个做多模态长记忆 Benchmark,名为 MEMLENS,目前已开源,并拿到了 Hugging Face AI 领域 Daily Paper 的前三。
他们把 27 个视觉语言大模型和 7 个 Memory Agent 第一次放在同一套多模态数据下,分成 4 档标准的上下文长度(32、100、128、256K),进行了一次完整的对照实验,并得出了以下发现:
第一,视觉语言大模型往往不做任何压缩,直接将内容全量塞入上下文窗口,但随着长度增加,模型表现急剧下降;Memory Agent 的表现虽相对稳定,但由于记忆架构设计缺陷,大量视觉与多模态数据在写入阶段就已损失。
第二,随着上下文长度的增长,无论是 Memory Agent 还是视觉大语言模型,都更倾向于产生幻觉,面对缺乏充分证据的问题时,更倾向于自信地胡说。
第三,许多针对 Memory 的后训练方法,在训练后削弱了模型拒绝回答的能力,这反而增加了幻觉风险。
值得关注的是,这一 Benchmark 证明了基模厂商和记忆公司应该各有分工,各自做好自身擅长的领域,在行业中也有着自身无法被替代的生态位:基模应该做好视觉感知、图文对齐和底层推理;记忆企业应该做好跨模态信息检索、证据组织和状态更新。
Founder 思考
个性化的终点是主动智能。
因此我们判断,Agent的终局不应该是任务驱动的,而是状态驱动的。未来的 Agent 能基于你的历史记忆帮用户做 Planning,自我驱动完成任务。
不久的将来我们可以看到一些主动智能的产品或者能力,主动智能如果出现,应该会出现在做 Memory 的公司里。
未来的 Memory 应该做的事是——沉淀用户和任务偏好、区分长期状态和短期波动,以更好地支撑主动智能。
目前大部分做 Memory 的企业都在聚焦上下文窗口和 RAG(检索增强生成)。然而,我并不认为上下文窗口等同于真正的记忆,它本质上依赖于前端交互和短期上下文来维持的一种临时性工作记忆。至于 RAG,目前主流的内存实现方案多采用 GraphRAG(基于知识图谱做 RAG)架构,但其本质不过是外挂的向量数据库,通过向量检索完成相似性召回。
当前许多企业,如硅谷的开源项目,如 Mem0、MemGPT,仍采用向量原生(Vector Native)或 GraphRAG 的方式来实现记忆功能。
这类方案存在明显局限。以纯向量检索为例,它缺乏对信息关联性的建模,本质上更像一个知识库,只能应对简单的一问一答场景。真正的记忆并非静态的问答,而是需要追踪动态变化的时间线与用户意图,不断更新调整。
Long Context(长上下文)和 Memory Agent(记忆)并非是二选一的取舍,而是可以做工程化的权衡。
DeepSeek V4 拥有 1M 的上下文窗口,这一模型推出后,不少人会很自然的想到一个问题,就是基模会不会做记忆,或者未来的基模中会不会存在单独的 Memory 层?
我们的 Benchmark 对此做出了解答:基模要做的是把上下文做的更长,做好 KV cache(一种数据缓存机制)相关的工作,更侧重于做好底层推理能力,如视觉感知和图文对齐。而记忆企业应该做的是找到跨模态信息,更好的为用户提供帮助。两者各有分工。
Memory 的核心,不是存储,而是决策。
如果只是简单的存储,传统数据库和存储系统早已能够实现,完全不需要 AI 记忆。但是真正让 Memory 发挥价值的点在于,它能做出一系列判断:是否写入记忆、哪部分写入记忆、召回什么样的记忆、在回答什么样的问题的时候应该主动发起召回等。基于此,Memory 承载着两大核心价值:
第一个价值是,释放 AI 潜力的上限。基模的上限到 AI 真正能够触达的上限之间,存在一个关键的中间层,这个中间层包括 AI 系统的复杂度,以及个性化的数据闭环(即 Memory)。个性化的数据闭环,是释放 AI 潜力上限的核心基础设施。
第二个价值是,支撑主动智能。AI 的落脚点始终在人身上,服务于人、取悦于人、加速于人,这是它不变的使命。Agent 也好,物理或者非物理 AI 也好,最终都需要主动智能来支撑。而主动智能的本质就是决策,即在充分理解用户个性化数据闭环的基础上,决策什么时候发起交互,如何发起,发起什么样的内容。
在家庭机器人落地的前期,具身的 Memory 需求会暴增。
在 AI 走向物理世界的过程中,其交互入口是多模态的,因此,多模态长记忆是一个必然趋势。任何与人进行的交互都不可能绕开记忆,尤其是交互时间越长、任务链条越长、涉及模态越丰富,记忆所扮演的角色就越发关键。
此外,在长程工作流中,无论是 Agent 的长周期任务,还是具身智能的长程任务,数据模态越丰富、记忆跨度越长,其数据价值就越高。换句话说,数据越贴近物理世界的真实状态,所构建的壁垒也就越高。
AI 需要和物理世界有一个映射的锚点,这个锚点必须是时间。
因为时间具有唯一性,Memory 没有办法脱离时间单独存在,不管我们范式如何改变,我们都把时间看的非常重。
图片来源|企业供图
欢迎关注~
欢迎交流~