关于ZAKER Skills 合作
钛媒体 31分钟前

测绘科学,或许是具身智能数据问题的终极解法

过去一年,从遥操作数据采集到仿真数据生成,从本体厂商自建数据闭环到第三方数据服务商涌现,具身行业在数据生产端的投入急剧膨胀。IT 桔子数据显示,2026 年上半年数据服务与数据集企业共发生了 19 起融资,融资总金额近 50 亿元。

放到更大的坐标系里看,这个赛道的体量还在快速膨胀。全球自动驾驶数据标注市场在 2025 年已达到约 50 亿美元,年复合增长率超过 25%;而具身智能数据市场虽然起步更晚—— 2026 年预计约 10 亿美元——但增速更猛,2030 年有望突破 100 亿美元。数据服务的盘子在变大,但问题也在变复杂。

一个越来越明显的矛盾是:数据数量在增长,真正能提升机器人能力的有效数据仍然稀缺。采集一小时视频很容易,但得到一小时可直接用于训练的洁净数据却很难。多家具身本体公司对我们表示,清洗数据的成本已经远远高于采集数据的成本。

也因此,几乎所有的具身本体厂商才都开启了自建数据采集管线之路。更大的问题在于进入真实场景之后。很多团队在堆了大量数据之后发现,模型在评测集上表现不错,一到真实场景就暴露问题。接触、滑移、遮挡、过力、异常恢复,这些只在真实闭环中才浮现的变量,很难被仿真引擎捕捉,在预训练的数据集中也很难覆盖。

这不是数采某个单一环节的问题,而是从场景选择、采集设计、过程控制、数据验收到质量修复、任务适配、资产复用,全链路都需要提升的质量能力。

" 这个行业需要一个独立三方的中立质量层 ",际数科技的创始人周源对创投家表示。

成立于 2023 年 5 月的际数科技,是一家专注做数据质量服务的创业公司。公司的两位联合创始人都有着深厚的测绘工作经历,也都曾在各自负责的知名测绘项目中吃尽了数据质量的苦头,而拥有相似背景的两位创始人加上商业化合伙人,也很早就达成了一个共识:要用测绘学的方法做空间智能的数据 " 精炼厂 "。

从左至右:邹小弟 首席运营官、周源 首席执行官、叶文凯 首席技术官。

际数科技在 2024 年完成天使轮融资,2025 年获长江产投产业融资,成立 2 年间,在智驾领域已服务了超 20 余家头部客户。2026 年开始,际数也正式切入了具身智能的领域,也即将在近期完成新一轮的融资。

中立质量层

周源认为,目前具身数据行业面临六个核心卡点:有效数据成本高;数据质量难提前判断;跨本体复用困难,数据不能天然迁移;离线评测与真实部署脱节;数据资产化困难;本体厂与大脑厂各自做数据闭环,难以沉淀跨本体、跨场景、跨客户的中立质量基础设施。而这些问题天然需要一个中立质量层来解决。

为什么在众多模型厂商都在自建数采管线的同时,仍需要一个外部独立的质量层?针对这一质疑,周源表示:目前行业惯例是用模型端到端效果来验证数据质量。数据好不好,全看训练出来的模型表现。这套机制在大语言模型阶段尚可,但空间智能的模型训练管线极长,等到真出了问题,其实很难归因:是模型问题、训练问题、调参问题还是数据本身的问题。

而际数的解法是:在数据进入模型之前就构建一套数据质量标准和评估方法、治理方案,不让质量问题伴随数据传到模型里。

这背后还有一个被忽视的行业认知错位:客户买的从来不是标注服务本身,而是 " 能训练出好模型的数据 "。但在传统模式下,数据用完即弃,大家永远在重新花钱。中立质量层要做的,是把数据从成本项变成可沉淀、可复用、可增值的生产要素——同时,也是在为行业争夺空间智能数据标准的定义权。

同样的问题在智驾行业其实早有体感:端到端大模型普及后,智驾体验没什么明显提升,甚至有些企业在把模型升级版本后,车辆反而变笨了。行业共识是应该重新构建基础数据质量框架。但当数据飞轮转起来以后—— 50 万 + 辆车在回传数据——数据的质量控制就变成了一件成本极高的事情。

在周源看来,这件事并不适合本体厂商或模型厂商自己做。因为建立质量模型评估数据本身需要更为开放的数据飞轮体系,单一厂商的管线不足以观测质量问题对整个数据域的影响。行业一定需要一个跨多方的组织来研究泛质量问题——研究不同场景对不同模态传感器、不同观测方案产生的影响,找到共性影响。而这正是中立质量层存在的价值,也是际数科技的终极愿景。

" 一张图、一把尺、一个飞轮 "

际数做的不是简单的数据标注,而是整个空间数据处理管线——从采集、清洗、标注、对齐到质检。周源将这套核心方法论称作 " 一张图、一把尺、一个飞轮 "。而这套方法论的本质,正是用测绘百年积累的误差分析和不确定性分析方法论解决空间数据质量问题。

" 一张图 " 指的是际数自建的质量因子库,用来描述真实场景中物体、材质、动作、接触等因素与数据质量之间的关系,用来判断哪些因素的变化会对最终数据质量产生怎样的影响。

" 当我们进入一个环境观测物理世界时,有些因子非常稳健,有些就没那么稳健,甚至会对观测系统产生负面影响。假如你能掌握物理世界中不同物体、不同材质、不同被观测对象对你的观测系统在质量或精度上的影响,那么整个观测体系的质量就是可控的。这是我们的基座。" 周源对我们表示。

高质量因子库 GData Quality Factor Library ( QFLab )

" 一把尺 " 指的是高质量场景基座。时空对齐一直是具身数据最基本的质量矛盾,际数科技通过对场景做精细化建模,让客户采集设备进入后能实现最准确的几何标定和时间对齐,从源头解决多模态观测的精度问题。

在整个数据管线过程中,除了空间的定位精度、时间对齐精度这些绝对质量问题以外,还掺杂着大量相对的质量问题。

比如对一个物体状态的评估,可能因人而异。对一个形状的语义描述,也相对模糊。这些相对的质量问题,单纯通过训练几何或精度标准去评估很难统一,需要大量专家知识或质检人员的判定。

际数科技通过构建一个数据质量飞轮,把带有质量问题的数据拿出来,通过专家知识和质检人员判定,学习质量问题和数据特征之间的关系,训出一套 " 质量模型 "。让模型学会专家的打分逻辑,替代庞大的专家和质检团队,对数据的质量进行评分、对问题进行诊断,甚至评估质量问题能否修复,来完成数据质量把控的最后一环。

就这样,际数科技用 " 一张图、一把尺、一个飞轮 " 构成了空间数据质量的基础模型。最后,际数科技还用一个智能体把这些模型能力、工具能力组织起来,调度这些能力来处理不同的 pipeline,为不同客户提供不同数据规格的产品服务,最终输出一个高质量数据集,用于成果交付。

际数的这套质量层解决方案在智驾领域已服务了 20 余家客户,让客户的可用数据规模有了 10 倍以上提升——原来 10Hz 数据一秒只标注 1-2 帧,而通过际数的管线处理,可以对 10 帧全部标注;数据漏斗也从之前的 10%-20% 提升到 70%-80%;同时,际数的质量大模型也实现了跟人工 PK 的完胜,基本实现替代了一支 100 人左右的数据质检团队。

一个头部智驾客户的合作历程,充分说明了这套方法论的复利效应。2024 年,该企业因 7 路环视相机与激光雷达的多模态自洽问题找到际数——空间误差需控制在 3 厘米以内,要素完整率要求 100%,此前自建平台半年未能达标。际数用 " 一张图、一把尺、一个飞轮 " 在 35 天内完成首期十万组交付,此后双方从单次项目延长为连续六期采购,累计完成 395 万组次多模态数据交付。

场景资产化

周源有一个判断:现在具身智能不是缺数据,而是缺场景。" 全季酒店所有房间几乎一模一样,真正有效场景仅 2-3 间;装配工厂 100 个工位,有效仅 4-5 个 ",周源举例说。

不是说市场上数据不够多,恰恰相反,各路玩家都在疯狂采集,数据量膨胀得很快。问题在于,这些大多是原始、孤立、未经过结构化处理的 " 数据原料 ",缺乏与具体场景的有效绑定。机器人需要的是 " 在厨房切菜 " 的数据,而不是一万小时杂乱无章的室内视频。没有场景定义的数据,就像没有经纬度的坐标,数量再多也难以转化为训练价值。

数据资产化要解决的就是这个断层。它的核心是把原始数据加工成可复用、可交易、可定价的场景化资产。对具身智能行业来说,这意味着数据从成本项变成生产要素——不再是采完即用的消耗品,而是可以沉淀、复用、甚至跨客户共享的战略资源。一旦数据具备了资产属性,整个行业才能从 " 每次从零开始采数据 " 的作坊模式,转向 " 基于已有资产持续迭代 " 的工业化模式。

际数科技的做法可以概括为 " 先定义场景,再评估质量,最后闭环迭代 "。他们先从训练需求反推,用因子库把物理空间拆解成机器可理解的场景要素,形成场景知识图谱。再通过采集 - 评估 - 反馈 - 再采集的飞轮,让每一轮数据都补上上一轮暴露的缺口。经过这个流程,原始数据就变成了带场景标签、有质量背书、可持续增值的数据资产。

这种资产化的价值在际数与之前的智驾客户的第三期合作中得到了更直接的验证。当时客户准备调整技术栈,需要更改模型技术方案,对数据提出了全新要求:路沿需要更精细的形态刻画,车道中心线和拓扑关系需要重新组织。按传统做法,这意味着重新采集、重新标注、重新质检——数百万元的额外投入和三四倍的交付周期。但际数复盘后发现,由于早期场景基座采用完整、高精度的刻画方式,数据规则又被拆分为原子化要素,历史数据可以按新任务要求重新组合。

团队从历史数据中抽取样本完成 POC 验证后,客户接受了以历史数据挖掘替代全面重新采集的方案——最终超过 60% 的历史数据被再次调用,边际成本降至首期项目的十分之一。而其余数据并非质量不合格,只是没有落入本轮任务需要的场景范围,未来仍可能用于其他标签或任务升级。

同一批数据,随着客户算法演进持续产生复购,并以更低的边际成本形成新的收入。这才是 " 空间数据炼厂 " 区别于一次性数据加工的商业价值。

高价值场景数据的极强复售性在智驾领域也得到了充分的验证。周源对我们表示,例如上海有一个十字路口,因为路口有一个加油站,很多货运车辆进出加油,创造了非规则化的长尾场景。在经过他们的精细化建模之后,这个场景的数据被客户采集了 1000 多次,复用率极高。

多模态数据处理流程

" 我们并不是一家智驾数据公司转型来做具身,而是从一开始就铆定空间智能,智驾只是突破口。" 在具身领域,际数已在武汉开始大规模寻找家庭和超市的高价值场景。按照他们的场景选择标准:物料丰富程度高、可完成 action 的数量多、对大多数传感器友好、能完成长时间任务的场景都是高价值场景。只要完成这类场景的资产化,后续的复用性将会成为际数科技一个更高的壁垒。

从测绘学到空间智能

际数科技的底气,很大程度上来自三位创始人的互补背景。

CEO 周源博士是武汉大学与俄亥俄州立大学联合培养博士,师从李德仁院士,长期从事测绘与空间定位研究,曾参与 NASA/JPL 火星车空间定位与制图,参与主持过多项国家重大项目与国家标准制定,现负责公司战略方向及空间智能质量基础模型。

CTO 叶文凯博士为同济大学佐治亚理工联合培养博士,师从李荣兴院士,曾参与南极冰川研究等国家重大科研项目,曾在华为、极氪从事智能驾驶研发,熟悉场景数据建模和智驾数据闭环,现负责技术体系搭建与产品实现。

联合创始人邹小弟拥有 20 年以上汽车行业经验,曾任博世中国销售总监、百度 IDG 销售总监,现负责商业化与项目交付。

三人的分工形成了 " 方向判断、技术实现、商业落地 " 的互补闭环。也让这支团队能把测绘学的精度体系,真正转化为可交付、可规模化的产品。

测绘行业的底层逻辑是看数据本质,看误差、看质量。而传统测绘工作的下游是修路、修桥、修大坝、卫星发射等重大工程,质量问题一旦传导下去,后果不堪设想。" 在没有北斗的时候 GPS 误差是米级,但三峡大坝形变监测要求毫米级定位。怎么抽丝剥茧分析去除误差、拿到最确定性数据,这就是测绘研究的内容。也是我们团队最擅长攻克的难题。" 周源自信地说道。

从智驾到具身,际数的路径始终围绕一件事:在数据进模型之前,先把质量问题解决掉。这不是测绘行业的跨界尝试,而是一个百年学科向空间智能时代的自然延伸——用测绘的精度,重新定义空间智能的数据底座。当整个行业的数采还在徘徊于低水平清洗和数据有效性的困境时,这支拥有深厚测绘学背景的团队,或许会给行业带来一些新的视角和希望。

多模态数据处理动态工作流

如果把过去三十年的科技产业史拉长来看,每一次代际权力的转移,争夺的从来不是硬件本身,而是底层标准的定义权。PC 时代,Wintel 联盟定义了计算的标准接口;移动互联网时代,iOS 与 Android 分割了数字世界的底层语法。而当 AI 从比特世界走向原子世界,Physical AI 的数据标准——真实世界数据的采集规范、处理范式与分发机制——正在成为下一个十年最大的战略制高点。

谁定义了机器人如何感知物理世界、如何积累并调用场景数据,谁就掌握了具身智能时代的底层语法。而际数在做的事,本质上就是在这场争夺中,为行业铸造一把 " 测绘精度 " 的尺。

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容