具身智能企业加快机器人落地场景的部署,让触觉赛道成为了新的风口。
近日,多模态触觉感知技术企业千觉机器人创始人马道林透露称," 今年上半年的产品订单量就已经是去年全年的几倍多。" 另外,还有多家投资机构和产业资本正在涌入。
据第一财经记者不完全统计,自今年 7 月以来,具身智能触觉赛道融资事件至少有 8 起,融资金额超 25 亿元。这股热潮还催生出两家百亿元独角兽企业,分别是帕西尼、一目科技。这两家公司最新的融资金额水平已和本体企业相当,都拿到了 10 亿元投资。
多位受访行业人士认为,机器人要学会干活,让其拥有触觉已经成为必选项。目前,触觉赛道发展分化出不同的技术路线和方案,而它们还需迈过真实场景验证阶段。
能干 " 精细活 ":把耳机放入充电盒
多家触觉赛道企业以及机构公开发布的 DEMO 视频显示,搭载触觉大模型的机器人可以夹取柔软水果和薯片、在人为干扰下完成叠纸盒、翻书页以及盲摸麻将等等。
智在无界大模型相关负责人李明(化名)向第一财经记者介绍了机器人从包中抓取物品的案例。他讲述称,传统机器人依赖于腕部摄像头拍摄到的视觉画面,将夹爪伸入包中时,摄像头无法捕捉到全局导致任务可能失败。拥有触觉的机器人则可以在夹爪和物品接触时获取更多信息,从而作出判断如何取出物品,任务成功概率更大。
除了这一案例,这类机器人还能完成更加精细的操作。

大晓机器人相关负责人也进一步解释,机器人的视觉能够判断 " 手 " 是否靠近物体,但很难准确知道接触发生在哪里、力度是否合适、物体是否正在滑动,以及柔性物体是否因受力持续形变。触觉能提供接触压力、受力分布、摩擦与滑移趋势等关键信号,让机器人在操作过程中动态调整抓取点、夹持力度和动作策略。
目前,行业内的触觉赛道已发展出不同的技术路线和方案。
据受访行业人士介绍,为了让机器人拥有触觉,他们首先要先获取带有触觉信息的数据,再将其用于机器人的预训练。硬件设备可以直接采集这类数据,包括触觉手套、传感器等。
按照传感器原理分类,压阻式、电容式以及霍尔效应式等为传统主流路线。视触觉传感器则是近两年颇受关注的新兴方向,这一方式用摄像头捕捉受力后软胶(如凝胶)的形变,通过视觉算法重建接触面的三维形变和受力分布。
千觉机器人采用了视触觉路线作为自研传感器的主要方向。马道林表示,压阻式、电容式等路线由于精度、电磁干扰等因素影响,在部分场景中存在性能局限。视触觉路线具有空间分辨率高、抗干扰能力强等优势。他介绍,除了高精度硬件体系建设,团队还通过自研数采设备、自研数据处理引擎、建立数据清洗及质检体系等工作,为训练机器人交互能力提供高质量的数据养料。此前,千觉机器人发布了 VTLA 具身触觉模型 X-TouchMind V1,以及面向真实物理交互的视触觉多模态具身数据集 TacVerse 1k。
不依赖于传感器等硬件,还有企业通过计算从人类视频当中提取触觉信息。
智在无界便是这一技术路线的代表企业之一。该企业介绍,其开发出面向大规模无标注人类视频的密集触觉伪标签系统 TactoHand。这一系统无需为数据采集者配备触觉手套或额外传感器,可以从人类视频中推断手部与物体交互过程中密集空间点的接触概率和连续接近度。
对于这个看似 " 天方夜谭 " 的方法,李明解释称,TactoHand 系统主要是通过物理法则、人类的先验知识等去估算出摩擦力、接触面以及抓取力度。相比于硬件设备,估算出来的数据不可避免会丧失一定的准确性。
也因此,智在无界在预训练时还会引入一部分高质量数据,即来自于硬件设备采集的数据。该公司推出的 Being-H0.8 便是结合大规模人类视频与触觉信息开展预训练的具身基础模型,其将触觉模态系统性地引入隐式世界模型架构。
层层门槛:数据稀缺、训练范式调整
触觉具身智能模型的训练并不简单。
受访行业人士提到,行业内带有触觉模态的数据量较少。马道林判断,这类高质量的数据规模或在万小时级。
这背后的一大原因便在于采集成本较高。李明介绍称,基于触觉手套或者 UMI 设备的数据采集成本较高,整套设备及方案可能就要数万元左右,有的甚至要十几万元。另外部分传感器设备还不够成熟,长时间使用下可能发生损坏。
他补充称," 触觉手套采集的一部分数据来自于数采工厂,背景和任务较为单一。虽然数据准确性高,但多样性不足。" 据其介绍,智在无界的技术路线可以直接省去硬件成本,还能较快拓展触觉模态数据的规模。
对于视触觉传感器的成本,千觉机器人选择从减少更换损耗入手。
一般来说,视触觉传感器往往被安装于机器人的末端执行器,即夹爪或灵巧手。马道林称,单个传感器价格在一两千元左右,两指夹爪会用到 4 个,灵巧手往往用到 10 个。传感器表面的柔性材料具有寿命限制,整体更换会进一步增加成本。千觉提供的传感器具有更换成本低的优势。" 基于模块化设计,我们的传感器只要替换掉表面柔性材料即可,无需重新适配,也无需更换其他高成本部件。" 他提到,近两年客户采购量加大后产品报价有所降低。
而将触觉数据引入到机器人预训练当中又是一道难题。直接将触觉数据加入到大模型当中,反而可能降低任务的成功率。
今年斯坦福教授李飞飞参与了一篇 " 触觉 " 相关的论文,其中提到 T-Rex 团队把触觉力信号直接拼接到一个预训练好的 VLA 模型里,任务成功率有所下降。论文分析的原因涉及多个信息的对齐、频率及表征浅等。
大晓机器人相关负责人分析称,视觉可以远距离连续记录,触觉只有在真实接触发生时才产生有效信号,还会受到安装位置、材料形变、摩擦变化、个体差异和传感器漂移等因素影响。
" 触觉数据真正难的地方,不是采到一个压力数值,而是把这个数值与视觉、动作、物体状态及任务过程精准对应起来。" 上述负责人认为,触觉数据标注不能停留在 " 是否接触 ",还要描述接触位置、压力大小、持续时间、滑移变化及其对应的物体状态。他们提出的环境式数据采集方案 2.0,通过 ACE Sense Glove、统一时空标定和多传感器同步,将 20 余种异构信号控制在 1 毫秒级误差内。
考虑到触觉数据特征、规模的情况,千觉机器人率先探索出触觉模型的训练范式。" 针对想要增加触觉能力的公司,目前比较合理的方法是先将自身原有的 VLA 模型能力训练到足够好,再将触觉信息规范化地纳入模型训练中。" 马道林介绍。
引入触觉信息,也意味着训练成本的上升,尤其是原本训练高性能世界模型的成本就比较高。据了解,世界模型方向目前分化出显式和隐式两大路径,其中显式的特征在于精确还原物理世界,隐式则在于将关键信息压缩至表征空间。
李明估算了一家头部公司的显式世界模型训练的成本。他提到,若训练数据规模达到 50 万小时,其研发成本低则数千万元、高则上亿元。智在无界选择的隐式世界模型路线一定程度上能降低训练成本。
记者了解到,千觉机器人、智在无界均专注于具身 " 大脑 " 的研究。千觉机器人的定位是触觉基础设施建设者,现阶段收入更多来自于数据产品以及采集方案,同时在探索具身模型场景落地。智在无界则和硬件公司合作为其提供模型支持,也正在进行模型商业落地的 POC 验证。
( 本文来自第一财经 )