关于ZAKER Skills 合作
36氪 5分钟前

让 Agent 在协作中自进化,清华 00 后博士获千万元融资

文 | 赵京娜

访谈 编辑 | 海若镜

36 氪获悉,近日奇点逃逸完成千万级种子轮融资,由星连资本与水木创投联合领投,奇绩创坛跟投。其正在研发 AI 原生团队协作操作系统 Nexus,让人、Agent、任务、知识和工具基于同一份组织状态持续协作,并让系统从每一次协作中有证据地变强。

奇点逃逸创始人兼 CEO 薛传奕,本科、博士阶段均在清华大学就读,研究方向覆盖强化学习与多智能体,曾以第一作者身份在 NeurIPS、CJA 等学术会议和期刊发表论文;在商汤、鉴智机器人实习期间,参与自动驾驶算法研发与实车部署。

"今天,Agent 已经像能力出众的个体,但它们还没有真正进入组织," 薛传奕介绍道。

一个越来越常见的工作日可能是这样开始的:产品经理把需求交给一个 Agent 梳理,研发同时让另一个 Agent 修改代码,运营则在第三个对话窗口里研究发布方案。几个小时后,每个 Agent 都完成了自己的部分,也各自拥有一段完整的上下文。但当三项工作需要合并时,团队才发现,没人清楚另一个 Agent 做过什么、为什么这样做,哪些结论已经被确认,哪些变化又会影响后续任务。

于是,人重新回到信息中转站的位置:复制对话、补充背景、核对版本、拼接结果,再把同一件事向不同 Agent 解释一遍。

这是 Agent 能力快速提升之后,一种颇具反差的场景。当 Agent 开始写代码、处理文档、调用工具,甚至连续执行长程任务,新的瓶颈也随之出现:一个能力很强的 Agent,仍然只是一个能力很强的单人助手。它掌握的上下文属于某个用户和某次会话,执行过程分散在不同工具里,任务结束后,经验也很难自然成为团队下一次工作的起点。

那么,当越来越多智能进入生产环境,它们如何理解彼此的角色和关系?组织怎样保留 Agent 的工作过程?一次任务中的反馈,又如何转化为下一次协作可以复用的能力?这些问题最终汇聚为奇点逃逸的两条主线:协作与自进化

若 Agent 成为组织成员

在传统团队里,一个新成员加入项目,需要理解目标、分工、历史决策和协作规则。Agent 同样如此。它不仅要知道做什么,还要知道任务从哪里来、与谁有关、依赖哪些信息、什么结果才算完成。

现有 AI 产品大多围绕会话组织信息,一段对话结束,Agent 对任务的理解、执行依据和失败经验往往也停留在那段会话中。当任务跨越不同模型、不同成员和不同时间周期,团队不得不反复重建上下文。

薛传奕将其称为 AI 的 " 协作断层 "。他认为,解决这个问题的关键不是让所有 Agent 同时开始工作,而是先让它们面对同一份事实。

协作首先是对事实的协作。如果每个 Agent 理解的目标、任务状态和验收标准都不一样,能力越强,可能只是更快地朝不同方向执行。

因此,Nexus 从组织状态而非单次对话出发。人、Agent、任务、知识和工具被表示为相互关联的对象;一项工作不再只是一段自然语言指令,还包含目标、负责人、依赖关系、权限、当前状态、执行证据和验收结果。

在这样的系统中,产品、研发和运营不是分别与三个互不相识的 Agent 对话,而是围绕同一项工作持续推进。新加入的 Agent 可以理解前序任务发生了什么,找到相关决策和上下游依赖;新的过程和结果,也会重新成为组织状态的一部分。

Agent 由此从个人拥有的工具,变成组织可以分工、授权、审阅和接续的协作对象

这也是薛传奕所理解的 "AI 进入组织 ":不是企业采购了多少 AI 账号,也不是员工调用了多少次模型,而是 AI 的工作能否进入组织的任务、知识和责任体系。

图:薛传奕

静态 Agent 遇上动态世界

协作与自进化其实是同一个问题的两面。多个主体要在组织中持续协作,Agent 就必须能够适应不断变化的目标、成员、工具和约束;Agent 要持续积累智能,又必须进入真实生产环境,在具体任务中获得反馈、接受检验。

今天的大模型,通常通过大规模预训练和后训练获得能力。部署之后,再通过提示词、工作流、工具和记忆系统进入具体应用。这个过程的核心逻辑仍然是:人预先设计系统,Agent 在给定边界内执行。

它在稳定任务中有效,却很难覆盖真实组织的全部变化。一个项目的目标可能被修改,工具会更新,成员会变化,新的约束随时出现。昨天有效的任务拆解方式,今天未必仍是最优选择;一个 Agent 在某次任务中犯过的错误,也可能在另一段会话里再次发生。

当系统无法消化这些反馈," 长期运行 " 就只是不断累积规则。Prompt 越来越长,Workflow 越来越复杂,人工维护成本随之上升。Agent 做了很多工作,却没有真正从工作中学会什么。

奇点逃逸认为,真实协作提供了自进化所需的高质量反馈,而自进化又让 Agent 能够适应组织持续变化的环境。

与静态数据不同,组织任务中天然存在目标、约束和结果。人的修正说明哪里出现了偏差,验收判断给出结果是否可用,失败记录揭示任务拆解、上下文或工具调用中存在的问题。这些信号不是抽象的偏好,而是与具体工作过程绑定的因果证据。

" 脱离真实任务,自进化缺少高质量反馈;没有持续改进,协作系统也只会变成静态流程工具," 薛传奕认为。

在 Nexus 的设计中,协作与自进化的循环可以拆解为:组织协作产生真实任务与反馈, 独立评测筛选有效改进 ,经过验证的能力进入下一轮协作, 更强的 Agent 扩大组织的协作边界。

系统可以根据反馈提出候选改进,例如调整上下文组织方式、模型路由、任务拆解或工作流配置。但这些变化不会直接进入真实生产环境,而要先通过独立评测,比较效果、稳定性、成本和风险,再由治理机制决定采用、限制、拒绝或回滚。

图源:奇点逃逸

这与系统自由改写自己有本质区别。在薛传奕看来,自进化的前提不是赋予 Agent 无限自主权,恰恰是建立更严格的证据和治理边界。系统必须能够回答:为什么要改、改了什么、是否真的更好、有没有损害原有能力,以及出现问题时能否撤回

因此,奇点逃逸所说的自进化,可以被概括为三个环节:真实反馈驱动、独立评测、治理采用。

协作,是自进化发生的环境

在 AI 行业,协作和学习长期属于两套不同的语言。

协作软件谈任务、权限、流程和知识管理;机器学习研究则谈数据、训练、评测和泛化。一边负责组织如何运转,另一边负责模型如何变强。两者很少在同一套产品架构里相遇。

Agent 改变了这条边界。当 AI 只能生成一段文字,它与组织的关系更接近工具;当它开始拆解目标、调用资源、执行任务并与其他主体接续时,它的每一次行动都会进入组织流程。执行结果不仅是业务产出,也成为判断 Agent 能力的反馈。

这意味着,未来的协作系统不只是承载工作,也可能成为智能持续学习的环境。

一个能够从反馈中改进的 Agent,也会改变组织可以承担的任务。它不再只是在固定流程中替代某个步骤,而是可以随着目标、成员和工具的变化调整协作方式。人的注意力则从重复执行转向判断、创造和协调。

" 我们关心的不只是 Agent 单方面变强,而是团队整体能不能处理过去难以承载的复杂目标。" 这也是Nexus 选择 " 图结构 " 作为底层组织方式的原因

在 Agent 系统内部,目标、规划、专业能力、执行、记忆、工具和验证可以成为不同节点。改进发生在哪里、影响哪些能力,能够被定位和追踪。新 Agent 和新工具也可以作为节点接入,而不必重写整个系统。

在组织层面,人员、Agent、任务和知识又形成另一张相互连接的工作图。Agent 的观察边界不再局限于一段对话,而是可以在授权范围内理解相关人员、历史决策、上下游任务和可调用资源。

两层图结构连接起来,协作反馈才可能指向具体的能力节点,经过验证的改进也才能重新进入具体工作。

单个 Agent 功能很容易随着模型升级被追平,更值得看重的是组织在持续使用中积累的状态、对象关系、评测基线和协作策略。它们来自真实任务中的判断和反馈,又不断被下一轮工作重新调用。

这是一种不同于模型参数的数据资产:它不只记录答案是什么,还记录一项工作为什么这样完成。

奇点逃逸团队的研究背景覆盖智能体、强化学习、LLM Post-training 和认知科学。看起来分散的方向,实际都在追问相似的问题:智能如何在环境中形成,多个智能主体如何彼此协作,以及一次经验如何改变之后的行为。

这种研究取向也让奇点逃逸没有从某一个垂直 Agent 切入,而是把目标放在更底层的组织方式上

薛传奕把 Nexus 的长期方向概括为 "AI 时代的组织基础设施 "。这并不是一个关于 AI 取代多少人的故事。它更接近另一种变化:当组织中出现越来越多非人类智能,原有的软件和协作方式需要被重新设计。

" 协作和自进化不是两条平行路线,也不是先后发生的两个阶段。" 薛传奕说,"Agent 只有具备自进化机制,才能适应组织的动态环境;只有进入真实生产环境,它的能力才能被释放,并在持续反馈中积累新的智能。两者相互依赖,也相互强化。"

36氪

36氪

让创业更简单

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容