来源:新浪港股
云知声(09678)发布公告,本公司正式发布基于 U2 通用基座模型强化后训练的新一代高密度智能模型 U2 Flash。相较前代 U2 模型,U2-Flash 在任务完成质量和综合效能方面显著提升:在代表编程能力的 DeepSWE v1.1 榜单中,U2-Flash 得分较前代模型翻倍,以 64.6 分的成绩超过 GLM5.3-Flash 和 DeepSeek-V4-Pro-0813 等模型;TerminalBench3.0 评分大幅提升至 24.3 分,超过 K3 等万亿参数级别模型;SWE-Bench Pro 评分达 61.6 分,较前代提升 10.5 分。同时,该模型在端到端执行效率及推理使用成本方面实现全面优化,Agent 任务迭代步数减少 20% – 30%,任务执行周期缩短 35%,Token 消耗减少 20% – 30%。
U2-Flash 采用稀疏混合专家(MoE)架构,总参数约 266B,单次推理激活约 10B 参数,首字响应时间平均控制在 3 秒以内,峰值输出吞吐最高 300 Tokens/s。该模型将编程、智能体、数学推理、指令遵循等多领域能力统一于同一套权重,以远小于同类稠密模型的激活规模实现主力级任务完成质量。模型具备隐式思考与连续状态推理机制,并将推理强度封装为四档可控接口,在高强度档位输出完整可读的推理链条,确保推理过程可核查、可追溯。此外,U2-Flash 已完成对主流国产算力平台的系统性适配,为规模化部署提供更灵活的算力选择。
在训练方式上,U2-Flash 建立了模型深度参与自身训练的自主闭环机制,为本公司在递归自我改进(RSI)方向上的第一步实践:模型可参与任务生成、轨迹分析与纠错重采,自主构建规模近 10 万的高质量 SWE 任务集;通过异步 Agent RL、多自训练教师模型在线策略蒸馏与自适应动态任务生成等创新,有效训练轨迹数提升约 60%,训练步数减少约 55%,并可实现训练系统的自主巡检与修復。所有自主调整均在人工设定的沙盒环境与验证标准内进行,保留完整、可回滚的记录。
U2-Flash 的发布,标志着本公司大模型技术从 " 以人工为主导的模型训练 " 迈向 " 模型参与自身演进 " 的新阶段。通过递归自我改进机制,模型得以在真实任务中持续自我验证、自我纠错与自我增强,为模型能力的长期复利式提升奠定基础。未来,本公司将坚持验证优先、全程可追溯、边界清晰的技术路线,在确保安全可控的前提下稳步扩大模型参与自身能力成长的范围,推动高密度智能在更多真实生产场景中规模化落地,为股东创造长期价值。