关于ZAKER Skills 合作
智东西 刚刚

刚刚,蚂蚁站在 Kimi 肩膀上开源了一款新模型

智东西

作者 | 李水青

编辑 | 心缘

智东西 8 月 11 日报道,今日,蚂蚁百灵大模型开源了一款轻量级混合推理 MoE 模型—— Ling-3.0-tiny。

该模型总参数量为7.9B,推理时激活参数量为1.3B,主要面向高效本地部署而设计。其同步提供BF16、FP8 和 INT4三个版本,已在DGX Spark、MacBook、Mac mini等设备上完成验证,兼顾性能、效率与可部署性。

在 Artificial Analysis Intelligence Index 评价体系中,Ling-3.0-tiny 获得 25 分,仅比 Gemma-4-26B-A4B 低 1 分,同时高于gpt-oss-120B(high)、Qwen3.5-9B、Gemma-4-12B 和 Gemma-4-E4B。

该模型的关键要点总结如下:

1、高效的混合线性架构:Ling-3.0-tiny 采用月之暗面自研的 KDA(Kimi 增量注意力)与DeepSeek 自研的 MLA(多头潜在注意力)的 3:1 交替堆叠结构,并配备由 128 个路由专家组成的稀疏 MoE 前馈网络,构建起高效的混合线性架构。

每个 Token 仅激活 8 个路由专家和 1 个共享专家,使该模型能够在长上下文建模能力、参数效率与计算成本之间实现平衡。

2、原生混合推理与智能体能力:Ling-3.0-tiny 兼顾快速响应多步推理能力,可通过 enable_thinking 参数在单次请求中灵活开启或关闭思考模式。该模型在通用智能体任务、代码生成、数理科学推理以及指令遵循场景下均具备均衡表现。

3、本地与边缘部署:在 FP8 精度下,Ling-3.0-tiny 在 DGX Spark 上的推理吞吐量可达100 – 105tokens/s,而在 M4 Pro MacBook 上则为86 – 90tokens/s,且在 8K 上下文长度时,峰值内存占用仅为 8.34GiB。

如下面视频所示,百灵在 36GB 内存 MacBook Pro 复刻 Infinite Wiki(无限百科)核心体验。用户阅读时点击词语即可生成上下文解释卡片,支持多层知识下钻。

该 Demo 全程本地推理,无需云端调用,实测首 Token 响应低于100 毫秒;所有数据留存设备端,不会产生云端 API 计费,接近一个原生速度的本地知识引擎。

Hugging Face 地址:

https://huggingface.co/inclusionAI/Ling-3.0-tiny

https://huggingface.co/inclusionAI/Ling-3.0-tiny-fp8

https://huggingface.co/inclusionAI/Ling-3.0-tiny-int4

ModelScope 地址:

https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny

https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny-fp8

https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny-int4

一、1.3B 激活参数 " 以小博大 ",评分紧咬 26B 大模型

在 Artificial Analysis Intelligence Index 评价体系中,Ling-3.0-tiny 获得 25 分。该指数从真实任务、工具使用、代码、科学推理、知识可靠性和长上下文等九个方向,综合衡量模型的跨任务能力。

百灵公布的对比结果显示,Ling-3.0-tiny 的综合得分仅比 Gemma-4-26B-A4B 低 1 分,接近激活参数约 4B 的更大 MoE 模型,同时高于 gpt-oss-120B(high)、Qwen3.5-9B、Gemma-4-12B 和 Gemma-4-E4B。

Ling-3.0-tiny 拥有 7.9B 总参数,但每个 Token 仅激活 1.3B 参数。这意味着,它以较低的实际计算规模,进入了主流 4B 至 12B 级模型的综合能力区间。

单项分数无法覆盖模型的全部能力,Tiny 模型也无法取代所有大型模型。但从相关评测看,Ling-3.0-tiny 已经具备进入代码辅助、知识工作流、工具调用和本地 Agent 应用的能力基础,其定位也超出了单纯追求 " 设备装得下 " 的小尺寸模型。

二、Agent 评分超 31B 大模型,输出速度超 160 tokens/s

Ling-3.0-tiny 较突出的方向是真实任务与 Agent 执行。

其 Artificial Analysis Agentic Index 得分为 16,高于 Gemma-4-31B;其中,GDPval-AA v2 取得 772 Elo,τ³-Banking 得分为 20.80,体现了模型在任务理解、工具调用和流程推进方面的能力。

在百灵此次列出的对比模型中,Ling-3.0-tiny 在 IMO-AnswerBench 和非幻觉率指标上取得领先成绩,在数学、科学推理、代码 Agent、指令遵循和长上下文等任务上的表现也较为均衡。

在综合智能指数达到 25 分的同时,Ling-3.0-tiny 输出速度超过 160 tokens/s,输出 500 个 Token 的端到端用时约 18 秒,这一时间已经包含模型思考过程。

较小的激活规模由此转化为更短的任务等待时间,也有助于提升 Agent 连续执行任务时的响应效率。

三、站在 DeepSeek、Kimi 肩膀上创新架构,降低本地部署门槛

Ling-3.0-tiny 延续 Ling-3.0 系列的原生混合线性注意力技术路线,并针对轻量化和低门槛部署进一步优化。其总参数量被控制在 7.9B,每个 Token 的激活参数量为 1.3B。

模型采用 3:1 KDA-MLA 架构,即每 4 层包含 3 层 KDA 和 1 层 MLA,以提高长上下文处理效率。

在 MoE 部分,Ling-3.0-tiny 设置了 128 个稀疏专家。每个 Token 会激活 8 个路由专家和 1 个共享专家,以较小的激活参数量承载更完整的模型能力。

该模型还采用原生混合推理机制,让常规任务的快速响应和复杂任务的多步思考由同一模型完成。Multi-Token Prediction 训练目标则为更高效的 Token 预测及后续推理加速提供基础。

这些架构设计主要指向三项实际价值:减少推理所需的计算资源,降低本地部署和二次开发门槛,并让轻量模型具备接入真实 Agent 工作流的能力。

四、从 DGX Spark 到 MacBook,三个精度版本覆盖不同设备

Ling-3.0-tiny 此次同步开源 BF16、FP8 和 INT4 三个版本,开发者可以按照硬件条件、性能要求和成本选择部署方案。

其中,BF16 版本适用于重视完整精度的研究评测和生产应用;FP8 版本在模型效果、运行速度和资源占用之间寻求平衡;INT4 版本进一步压低资源需求,面向算力和内存相对有限的本地环境。

三个版本的推出,使模型能够覆盖从专业级本地 AI 工作站到个人电脑的不同设备。开发者可以将其接入本地知识库、代码助手、UI 自动化、企业任务智能体等工作流,并将模型和业务数据保留在本地环境中。

1、DGX Spark:单机可支撑小规模本地服务

Ling-3.0-tiny 可在单台 NVIDIA DGX Spark 上运行 FP8 推理,模型权重文件约为 7.85GB。

在 2K 输入测试中,单请求稳态解码速度约为 100 至 105 tokens/s;两路请求并发时,聚合解码吞吐约为 161 tokens/s。

按照上述测试结果,开发者和中小团队无需搭建大规模算力集群,仅使用一台 DGX Spark 便可搭建独立运行的本地模型服务,为小规模用户提供推理能力。潜在应用包括企业内部知识助手、研发团队代码助手和面向特定业务流程的任务智能体。

百灵还在 DGX Spark 上部署 Ling-3.0-tiny,并用其驱动移动设备,演示模型理解任务、调用工具、执行自动化操作并完成验证的过程。该 Demo 面向开发测试中的批量试跑和回归验证场景,验证了本地模型在运行成本、数据可控性和执行可靠性方面的应用潜力。

2、MacBook:首 Token 响应低于 100 毫秒

目前,Ling-3.0-tiny 已完成面向 MacBook(Apple Silicon)的本地运行适配,BF16 和 FP8 版本均可运行。

在 MacBook 上,该模型可以用于代码辅助、文档处理、本地知识问答和工作流自动化。由于模型与数据均留在本地,用户可以减少对云端模型服务的依赖,并在处理隐私敏感信息时拥有更可控的数据边界。

其中,FP8 版本进一步降低了本地运行所需资源,并将持续生成速度提高约 30%,以改善多轮交互和 Agent 运行体验。

正如前文提到,为验证本地高频交互能力,百灵在一台配备 36GB 内存的 MacBook Pro 上复刻了 Infinite Wiki(无限百科)的核心体验。测试表明,Ling-3.0-tiny 已经能够在 Mac 上承担高频本地交互任务,并以接近原生应用的响应速度充当本地知识引擎。

3、Mac mini:变身常驻式本地智能节点

Ling-3.0-tiny 面向 Apple Silicon 的部署方案也可以延伸至 Mac mini。

相比更侧重移动办公的 MacBook,Mac mini 更适合作为低功耗、常驻式的本地智能节点,为个人或小型团队持续提供知识库检索、文档分析、自动化任务和本地模型 API 服务。

在百灵展示的 Demo 中,Ling-3.0-tiny 被部署在 Mac mini 上,用于划词翻译、语法纠错和文本改写。相关任务无需将数据上传云端,可以离线运行并提供低延迟响应,适用于个人及企业的本地阅读与写作场景。

至此,Ling-3.0-tiny 已经完成从 DGX Spark、MacBook 到 Mac mini 的适配验证。不同精度版本与设备形态共同扩大了这款模型的部署范围,也让中小团队能够根据算力、数据边界和业务需求选择更合适的本地运行方式。

结语:下一步将补强事实准确性和长程 Agent 稳定性

百灵称,接下来其将继续增强 Ling-3.0-tiny 的长尾知识覆盖和事实准确性,提高复杂工具调用及长程 Agent 任务的稳定性,并优化代码、科学推理和长上下文能力。

团队还计划改善模型推理能力、响应时间和任务成本之间的平衡,完善 FP8 和 INT4 版本的硬件适配、推理框架支持与部署文档,并与硬件厂商、高校及开发者社区共同建设轻量模型生态。

相关标签

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容