凤凰网科技讯 7 月 21 日,小鹏集团正式发布 TuringViT 高效视觉编码器,面向 VLM/VLA 时代系统性重构了视觉编码器的架构设计、数据范式与训练流程。该编码器将全面支撑小鹏智能驾驶、智能座舱及 IRON 人形机器人三大业务场景。
TuringViT 的核心技术创新包括三个方面:
Turing 线性注意力架构:采用 "5 层线性注意力 +1 层标准多头注意力 " 的混合 Turing Block 架构,将计算复杂度从二次方降至近线性。实测显示,在 1536 × 1536 分辨率下,TuringViT-18L 推理吞吐量达到 Seed1.5-ViT 的 3.04 倍,为高分辨率感知、多摄像头输入的端侧部署扫清了算力障碍。
VISTA-Curation 数据治理:通过三步精细化筛选(质量过滤、多样化字幕生成与交叉验证、综合评分排序),仅用 0.85B 图文对(约 SigLIP2-L 训练数据的 10%),便在 ImageNet-1K 等零样本分类基准上取得 83.6% 平均准确率,超越使用 10B 数据训练的主流开源基线。
原生动态分辨率训练:采用四阶段渐进式训练范式(视觉初始化→范围受限动态分辨率→原生分辨率精调→图文视频混合训练),从预训练阶段就适配下游 VLM/VLA 的输入特性,无需事后适配。
小鹏表示,TuringViT 的价值在于为行业提供了一条可复现、低成本训练 SOTA 级视觉 Transformer 的技术路径,推动先进视觉大模型从 " 头部团队专属 " 走向 " 行业普惠 "。相关论文及代码已同步公开。