GPT-5.5 能写专业论文,DeepSeek-V4-Pro 能生成复杂代码,具身机器人能完成基础物理操作,语言智能和工具智能都已经跑出了自己的赛道。
但把同样的 AI 放进一次家庭聚餐、一场团队会议、一次医患对话,它往往表现得生硬、不合时宜。
不是知识不够,是 " 读懂人心 " 的能力还没跟上。这正是社会心智长期缺失带来的真实困境,也是从 " 任务执行 " 走向 " 社会协作 " 时必须补上的一课。
7 月 24 日,中国科学院计算技术研究所智能算法安全全国重点实验室 " 知境 " 团队,正式发布知境社会心智大模型技术体系。
这不是又一个大模型刷榜的故事,而是一份关于社会心智如何成为独立工程能力的完整答卷。
知境要做的,正是为现有大模型补上这块短板——给模型增加 " 情商 " 与可信任感,让 AI 在关键场合靠得住、信得过。
先体检,再开方:SoMBench 给 AI 做 " 社会心智 CT"
治病之前先诊断。知境团队做的第一件事,是建立一份足够精细的 " 体检表 "SoMBench。
SoMBench 把笼统的 " 懂不懂人 " 拆解成3 大一级维度、17 个二级维度、71 项细粒度任务,覆盖从基础信念推断到高阶情绪理解、从社会规范到关系建模的完整光谱。

更重要的是,SoMBench 不仅会告诉你 " 考了多少分 ",还告诉你 "错在了哪"。
通过单选、多选、判断、开放题的多题型交叉验证,以及选项扰动、捷径检测、受控改写等手段,SoMBench 能精准定位模型的错误模式,例如:是推理链断了?还是靠表面模式蒙对了?这为后续的训练指明了靶子。
20 个顶级大模型在 SoMBench 上测试,最强模型正确率仅 72.08%,无一达到 90% 天花板,社会心智的 " 无人区 ",名副其实。
为什么社会心智这么难?
因为同一场景里,AI 要同时处理角色关系、隐含意图、情绪变化、社会规范、未说出口的话等多层推理——普通大模型根本理不清这些弯弯绕绕。

体检表有了,接下来怎么练?
知境团队没有走 " 堆数据、堆算力 " 的老路,而是设计了一套会 " 自我进化 " 的训练系统。
密码一:FLARE 数据飞轮——错题本比课本更重要
传统训练是 " 准备一批数据,训完拉倒 "。
Zing 的做法是让评测像导航仪一样指出方向,而不是直接 " 透题 "。
当模型在诊断集上暴露短板时,FLARE 会定位到具体认知维度,再针对性合成全新的训练样本——语义、场景、推理路径都与原题不同,但瞄准同一种能力缺陷。
这就好比发现学生几何薄弱,就出套新几何题,而不是反复做同一张卷子。
候选样本还须经过多轮过滤,只保留模型当前无法轻易答对、但经过推理能够学会的中高难度样本。
这就是 FLARE 的核心逻辑:哪里弱就练哪里,但每次练的都是新题。

第一阶段:通用社会心智打底。
模型首先利用多教师蒸馏构建高质量冷启动数据,通过答案门控、推理深度过滤保留有效推理轨迹;
随后采用 Mixed-Reward GRPO 强化学习框架,根据任务类型、训练阶段和推理质量,动态组合过程奖励、可验证奖励和拒绝采样——奖励目标随模型能力变化而调整,不是一成不变的 KPI。
第二阶段:专项能力强化。
针对情绪理解、意图推断、社会规范、视角采择等薄弱环节,先用两轮监督微调注入领域知识,再用困难样本持续校准。
目标是:增强专项能力的同时,不丢失已学会的通用推理。
密码三:OPD 在线蒸馏——边学新招,边不忘老本
强化学习最大的风险是 " 学新的,忘旧的 "。
Zing 的解决方案是OPD(On-Policy Distillation):在在线轨迹上引入教师模型的 token 级分布约束,让学生模型在探索更优路径的同时,不偏离已验证的有效推理模式。
GRPO 负责 " 往前冲 ",OPD 负责 " 别跑偏 "。
两者作用于同一批采样轨迹,既鼓励探索,也守住边界。
FLARE 决定 " 学什么 ",两阶段训练决定 " 什么时候学 ",OPD 决定 " 向谁学、不忘什么 "。
Zing 构建的不是一个静态训练流程,而是一套随模型能力状态持续自适应的进化系统。
数据说话:这套 " 密码 " 管用吗?
训练方法再漂亮,最终要拿成绩说话。在 5 项国际权威社会心智评测基准上,Zing 给出了硬核答案。
Zing-27B 五项综合均值79.80,超越 GPT-5.5 的78.44。
尤其在 HiToM(+4.08pp)和 EmoBench(+5.62pp)上优势明显。
HiToM 评测的是 " 我知道你知道我知道 " 的递归信念追踪,阶数越高难度指数级增长——Zing-27B 是首个在该基准上超越 GPT-5.5 的百亿参数级公开模型。
Zing-32B,文本模型比肩 DeepSeek-V4-Pro
Zing-32B 综合均值76.32,略超 DeepSeek-V4-Pro 的75.90。
EmoBench 上 78.13 对 71.88 的 6.25 个百分点领先尤为突出,证明了专项社会心智训练在情感理解维度上能够形成显著的结构化优势。
Zing-8B/14B,小模型大心智
8B 模型在 HiToM 上达到78.08,14B 模型达到80.00,分别超越同尺寸基座模型近 12 和 8 个百分点,甚至超过参数量为其数十倍的更大模型。
递归阶数越高,差距越明显—— Zing-8B 在三阶和四阶信念推理上分别提升 21.67 和 22.08 个百分点。
这些结果指向同一个结论:社会心智能力的提升,来自训练方法的结构化设计,而非参数的简单堆砌。
SoMBench 作为知境自研的最难社会心智基准,当前模型仍有较大提升空间——这也正是下一步训练迭代的重点方向。
Actio:把 " 懂人心 " 从参数里 " 捞 " 出来
模型学会了,部署时怎么不掉链子?
知境的答案是Actio——一个 " 按需调用、不乱塞 " 的显式心智状态部署架构。
真实交互场景中不缺信息,缺的是恰当的信息。
Actio 以 Harness 为统一编排核心,根据任务的心智变量和推理需求,选择性激活四类支撑:
PRISM:76 项分层心理与社交技能(20 宏观 +56 微观),按需路由
Starling Memory:显式记录 " 谁、何时、相信什么 ",版本化更新
SAGE:跨任务可复用的推理经验,三级回退激活
Gated RAG:社会文化知识按需检索,验证信用分配
一次典型推理经历四步:理解任务并识别心智需求 → 并行检索技能、知识与记忆 → 排序裁剪组合后引导推理 → 离线沉淀有效经验。
Actio 像经验丰富的社工,知道什么时候该调用哪块能力——而不是把所有信息塞进同一段上下文。
这套机制的核心目标只有一个:让 AI 在真实场景中不仅 " 会想 ",还能 " 做对 ",配得上用户的托付。
应用前景:从实验室走向真实场景具身智能——给机器人装 " 心眼 "
物理 AI 解决 " 身体 " 的问题,社会心智 AI 解决 " 心眼 " 的问题。
知境的小参数模型(8B/14B)为端侧部署提供了可能,未来可探索家庭看护、儿童陪伴、协作机器人等需要实时社会推理的场景——让机器不仅会动,还懂得谁需要帮助、什么时候该安静、怎样表达才恰当。
复杂决策推演——重大选择的 " 预演沙盘 "
在事关重大的决策场景中,理解 " 各方会怎么想、怎么做 " 往往比算清账目更重要。
知境的社会心智能力未来可应用于政策沟通、危机管理、组织变革等领域的推演,能够帮助决策者在行动前,提前看见不同选择可能引发的连锁反应。
人机共生——统一心智协议
当多个智能体(人类、机器人、AI Agent)需要长期协作时,最大的风险不是能力不足,而是 " 你以为我懂了,我以为你懂了 " 的认知错位。
知境的社会心智建模框架,未来可为多智能体系统提供统一的心智状态表达与共享协议,让不同的智能体在同一个社会认知坐标系下协作。
一条新赛道,已经铺好了
知境团队真正想回答的问题是:
社会心智能不能像语言理解、代码生成一样,被定义为一种可以持续测量、训练和改进的工程能力?
SoMBench 建立了能力坐标系,把 " 懂不懂人 " 分解为可定位的认知缺口;
Zing 依据诊断结果组织自适应训练,让社会推理从提示词诱导的临时行为,转化为模型参数中的稳定能力;
Actio 则通过技能、心智状态、经验和社会知识的动态组织,为部署提供可选择、可检查的支持。
三者共同指向一条技术路线:社会智能不再只是模型表现出来的一种模糊 " 情商 ",而开始成为具有评测工具、训练方法和运行时接口的工程对象。
当然,这条路才刚刚开始。
训练收益能否跨任务、跨文化迁移,Actio 能否在长期真实交互中保持稳定与合宜,仍需要更广泛的验证。
但至少," 懂人心 " 这件事,终于从玄学走向了系统工程。
符号空间拼智商,物理空间拼行动力,心智空间拼的是 " 读空气 " 的能力,这是 AI 赢得人类信任的关键一跃。
语言智能之后,社会智能正在成为通用人工智能的下一个核心赛道。
知境为这条赛道,提供了从评测到训练到部署的完整工程基础。
知境团队 中国科学院计算技术研究所智能算法安全全国重点实验室
GitHub:https://github.com/Zhijing-AI/Zing (评测基准、模型权重等后续将陆续开源)
项目技术报告:https://zhijing-ai.github.io/Zing/Zing_TechReport.pdf
* 本文系量子位获授权刊载,观点仅为原作者所有。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


