真正的「Model-Ready Data」,高精度、多模态、多样性缺一不可。

作者丨高景辉

编辑丨马晓宁


(资料图片仅供参考)

“具身智能的数据需求,远没有摸到上限。”

在WAIC主论坛上的一次对话中,亮源新创创始人姜旭的判断引起了广泛共鸣。他进一步提到,具身智能本质是大模型向物理世界的延伸,会沿着“规模化预训练→规模化对齐→规模化部署”的三阶段范式演进,和大模型时代一样,智能供给的红利核心来自数据,现在行业连最基础的预训练阶段的数据缺口都没填上。

的确,这个直面行业核心的观点足够尖锐,但对于数据的问题要如何解决,论坛上的嘉宾似乎没有给出足够详细的解答。于是,带着这个疑问,雷峰网AI科技评论走访了WAIC上的具身智能企业,希望从一线从业者口中找到答案。

值得庆幸的是,今年参展的具身数据基建公司不在少数,提供的干货也很多,尤其是在和简智机器人的交流中,我们搞清楚了当前行业究竟缺什么数据、要如何获取这些高质量的数据。

01

具身行业真正缺的,是 "开箱即用" 的数据

很多人说具身行业缺数据,但事实果真如此吗?互联网沉淀的人类视频已经超过百亿小时,这曾被认为是具身模型预训练的重要燃料。但这些数据只能支撑模型"看懂世界",无法支撑机器人完成真实物理世界的精准交互。

具身行业真正需要的,其实是可以直接喂给模型、不需要二次加工的数据。

简智机器人将这种数据定义为"Model-Ready Data",翻译过来就是"开箱即用" 的数据。根据各大具身公司的实际反馈,这种数据需要同时具备三个核心特点:高精度、多模态、多样性,三者缺一不可。

高精度是基础门槛。具体而言,就是低误差、低延迟、低漂移。手部追踪的厘米级误差会沿训练链路持续放大,最终导致机器人操作失败;传感器之间几十毫秒的时间差,会让模型学到完全错误的因果关系;采集十几分钟后姿态开始漂移,整条数据的价值便大打折扣。

当前行业普通方案的手部关节追踪误差普遍在 2-3 厘米,什么概念?成年人手指直径也就 1-2 厘米,这个误差意味着模型看到的手指位置,和真实位置差了整整一个手指的距离,会导致抓杯子时手指穿进杯壁,拧瓶盖时手指根本没碰到瓶盖,训出来的策略永远抓不准物体。

多模态是能力边界。真正的人类操作不只是 RGB 画面,还包含人体姿态、手部轨迹、相机位姿、深度信息、触觉信息等多个维度。

纯视觉路线只采集了 "人看到了什么",完全缺失了 "人是怎么动的、用了多大劲" 的核心信息。没有手部关节数据,手一被物体遮挡就丢轨迹;没有触觉数据,模型永远不知道抓鸡蛋用多大劲;没有全身姿态数据,动作永远僵硬得像提线木偶。

多样性决定泛化上限。模型要面向一千个家庭、一千种角色,数据就必须从尽可能多的场景中采集。数据价值从来不是堆时长,核心是场景、任务、人物、物体的丰富度,这才是决定模型落地后泛化能力的关键。

如果几十万小时数据里 90% 都是实验室白墙前 "拿杯子、拧瓶盖" 的重复简单动作,模型训练后只能在演示环境里做固定动作,一到真实场景就失效。

为什么大多数数据公司做不到这三点?背后的难点各不相同。

高精度的核心,是接近 100% 还原人在现实中的移动与操作过程:眼睛看到了什么、手接触了什么、每个关节转动的角度、手部接触面的先后顺序,这一系列过程都要完整保留。这反过来要求足够强的算法能力,即通过算法将原始信号转化为精准的结构化数据。

多模态的难点,核心在硬件本身。硬件是模态的基础,如果硬件获取能力差、精度低,最终效果就无从谈起。很多团队用现成模组拼凑,摄像头、数据手套、IMU 各自为战,没有做硬件级的时间同步,不同传感器的数据时间差普遍在 20-50 毫秒,模态之间根本无法有效对齐。

多样性的难点,则考验公司的产品能力和运营体系。设备的易用性、价格、质量、适配性,决定了它能不能进入更多场景;完整的数据运营管线,决定了能不能高效处理来自不同场景的异构数据。产品做得不好,设备进不了更多家庭和商业空间,扩张速度就会很慢;管线效率低,现实数据清洗不过来,多样性就是空谈。

甚至,即使克服了以上三点,还要面临着一道终极考验:规模化。规模化对于数据公司而言是一种综合性大考,需要大规模的采集体系、数据处理管线以及对模型的理解。

当前,行业只有简智等少数几家企业能真正实现规模化,从他们的成功经验里,或许可以学到一些“干货”。

02

从算法到硬件,Model-Ready Data 怎么做?

开箱即用说起来简单,真正落地需要一整套体系的支撑。从模型理解到算法实现,从硬件设计到场景搭建,每一环都是漏斗,一环做不到位,最终的数据质量就会打折扣。

那么究竟要怎样才能实现全流程的闭环?在和简智机器人交流的过程中,我们逐渐摸清了门道。

▎懂模型,才能做出模型能用的数据

很多人有个误解:数据公司不需要懂模型,只要把数据采回来交给客户就行。但在简智看来,如果不懂模型,就做不到"Model-Ready Data",只会产出半成品,浪费下游客户大量的时间做二次加工。

懂模型分两个层面:

第一,要懂当前模型在每个细分模态下的质量要求是什么,知道针对这个模态该设计什么样的范式。比如标注,不是标得越多越好,而是价值驱动的COT链式标注:不止标注动作本身,更把人类行为背后的目标、常识、价值判断显性化--不仅标注“这是抓取动作”,还要标注任务目标、操作步骤逻辑、物体交互关系、力控原因、失败修正动作、环境约束与常识规则

简智做的全人工帧级CoT标注,不是简单标"这是开门",而是建立完整思考链路,让模型不仅学会"怎么做",还学会"为什么这么做"。

第二,要懂怎么用模型加工数据。如果靠人工、非系统化的方式处理数据,精度和效率都有明显天花板。简智自己做 Data Foundation Model(DFM数据基础模型)的核心目的,就是用模型实现"输入头手相关信息,直接输出完整人体数据"的端到端能力。

这其中最典型的应用就是遮挡补全。真实世界里,人做动作时手经常会被物体遮挡——手伸到抽屉里、拿东西时手指被挡住、叠衣服时手埋在布料下面……传统采集方案遇到遮挡就只能丢失数据,或者靠硬件加更多相机,但无论多少相机都不可能完全消除遮挡。

简智的解法是用视频生成模型补全关键帧:基于前后帧的信息,模型可以预测出被遮挡部分的手部姿态,就像人看到手伸到桌子下面再伸出来,自然知道中间手在做什么一样。这样就能保证给模型训练的数据是连续的、完整的,手部全程的动作状态都能准确输出。

"这就像一座自动化工厂,既解决效率问题,也解决严格的时空对齐问题。"简智团队解释,人的头和手在同一个时空坐标系里,因为神经传导的完整性,动作不会有中断,时空坐标系是连续的。如果没有完整的模型方案,靠先采集头部数据、再采集手部数据、最后人工拼接的方式,永远做不到真正全链路闭环,完整复刻人类感知-动作回路。

第三,要懂模型长期发展需要什么。

真正的人类数据,从来不是只采“手”和“眼睛”的数据人做动作是一个完整的整体:腰怎么转、腿怎么站、重心怎么移、身体怎么保持平衡,这些才是让人形机器人真正“像人”的核心。

简智的无本体采集方案从设计之初就是面向人形机器人的终极需求:不止采集手部和视觉数据,更完整覆盖腰、腿、全身的运动链,输出完整的SMPL-X人体网格,还原人做每一个动作时的全身协同、重心变化、平衡逻辑,而不是只给模型"一只手”和“一双眼睛”。

这才是人类数据的终极价值:不是为了适配某一款机器人,而是通过完整还原"人"本身,让模型的运动能力、行为逻辑无限向人对齐,当整个行业的数据都在向"完整的人"靠近时,模型能力、机器人能力才能形成正向循环,共同推动具身智能真正达到接近人的水平。

▎算法:端到端自研,多源融合,高效压缩

算法层面,核心是多套体系的配合。

比如是端到端自研算法。不同于基于开源算法的迭代优化,端到端自研可以从底层控制精度和稳定性。结合多源传感器数据的实时融合校正,最终实现手部关节追踪稳定误差小于 1 厘米 —— 这也是行业首个做到亚厘米级精度的无本体采集方案。

还有多源融合算法。视觉、IMU、触觉三端数据不是简单叠加,而是多特征、多源的融合与矫正。哪怕手完全被物体遮挡,多源融合算法也能精准还原手指姿态,不会跟丢轨迹,无效帧比例可以控制在3%以内。多模态输入不只是增加了信息维度,更可以通过交叉验证反向提升每个单一模态的精度。

还有一个被低估的是压缩算法。比如六目相机的数据量比双目相机多得多,如果没有好的压缩算法,传输和存储都会成为大问题。简智自研的感知压缩算法,不是简单做有损压缩,而是在帧率层面做智能优化,压缩比可以做到原始数据的2%,而且压缩是在设备端直接完成的,再加上端侧质检直接过滤掉30%的无效数据,大大降低了传输带宽和存储成本。

▎硬件:仿生的第一性原理——从骨骼、肌肉、皮肤来拆解、记录人的全模态

相比模型,硬件的共识要广泛得多,很多人都表示,在数据采集领域,硬件是一切的基础,像前文提到的“多模态”的核心就是硬件。但具体到硬件的选择上,简智却有不少“非共识”的地方。

其中最典型的就是摄像头方案。行业里大多数第一视角采集设备用双目甚至单目相机,简智却坚持用六目同步相机,这是为了拍得更清楚吗?

其实不是。六目相机不只是向外拍环境,同时也向内,视野覆盖人的腿、膝盖、腰部的全部动作。而且六目是两两组合的,全身每个角度都有多摄像头覆盖,组内效应能把精度提得很高。

没错,他们的目标从一开始就是同时记录人的全身动作以及人和物理环境的交互。人的行走、腿部动作、身体姿态,这些都是单一胸前视角的摄像头拍不到的,但对理解完整的行为逻辑至关重要,比如叠衣服时突然抬胳膊,单看手部数据像是异常值,但有全身数据就会知道,是旁边有东西过来需要避让。

而在手上,简智通过电子皮肤+仿生关节方式,直接测量抓握的力度、接触面积、摩擦力变化全部能精准捕捉,补足了全部模态。

硬件上另一个容易被忽视的点是量产可行性。行业里很多团队用现成的模组攒设备,做个demo看起来没问题,但一到量产就问题百出:过热、续航短、不同设备一致性差……

简智选择了全链路自研,从摄像头、关节传感器到计算单元、电池管理、热管理全部自己做。团队里有大量来自消费电子行业的资深工程师,他们从设计之初就考虑百台、千台甚至万台规模普及后的挑战。

▎场景:用系统化指标衡量多样性

多样性不能只停留在概念上,必须有可量化的指标。

简智提出了一个自研的综合性指标叫“DPH”,含义是:同一个技能下,每小时的数据由多少人、在多少场景下完成。这个指标能很好地概括多样性,用户采购数据时,只需要看对应技能下的 DPH 指标,就能保证数据的多样性。比如擦桌子的数据,不会是一个人擦 100 个小时,也不会是 10 个人在同一个房间擦同一张桌子 100 个小时,而是不同的人、在不同场景、擦不同的桌子。

专业场景的数据采集尤其讲究。家庭场景相对还好,最难的是实验室、学校、高精尖制造、化工这类专业场景,商业场景也一样,比如找好的厨师、理发师,难度都很高。专业人士的核心优势是能熟练完成动作,如果设备影响了他们的操作,破坏了他们的专业性,采集的数据就没有价值。

这又回到了产品力的问题。采集专业人士的数据,戴设备会影响他们工作,不戴设备又采集不到高精度的触觉、力觉数据。这个矛盾只能通过极致的产品力来解决:极致的轻量化,极致的无感化,沿着人体天然的生理结构设计,做到不干扰人的正常动作。

03

数据基础设施的重要性,才刚刚开始被认识

作为一家数据基建公司,把数据生产出来只是第一步,要真正让客户“开箱即用”,还要懂不同客户的真实需求,更要清楚自己的边界在哪里。

当前行业里的数据客户大致分两类:一类是有明确落地场景的客户,要在特定场景落地商用机器人,他们的需求和落地场景深度绑定,更看重单一技能的深度,要把某几个动作做到极致;另一类是做通用基座模型的客户,他们要做的是GPT级别的具身大脑,不追求单个技能做到100分,而是要掌握上万种技能,每种都做到95分,让技能之间能融会贯通。

对于后者来说,他们需要的是尽可能全的模态、尽可能高的多样性、尽可能大的数据量,百万小时数据可能只是起步,甚至需要上亿小时的真实场景数据,才会出现能力的涌现。但不管是哪类客户,对数据的核心要求是一致的:精度要够高,稳定性要好,拿到手就能直接用,不用再花几个月时间清洗处理。

要满足这些需求,光有技术还不够,还要有全链路的工程化交付能力。

数据从硬件采集到变成Model-Ready Data,是一条非常长的链路,每一环都是漏斗,一环慢就全链慢。这需要成熟的数据飞轮实践经验,从采集端的设备管理,到云端的数据处理、质检、标注,再到和客户的服务器打通,实现数据的流式交付。

如此一来客户不用等硬盘邮寄,也不用自己下载海量数据,直接在自己的服务器上就能按需调取需要的数据集,甚至可以直接对接训练流水线,实现数据到训练的无缝衔接。

同时,交付标准最好要高于客户的需求,不是客户要什么格式就做什么格式,而是用一套统一的、更高的标准来交付,比如画面覆盖范围比客户要求的更大,数据维度比客户需要的更多,这样不管客户是做机械臂、做人形机器人、做不同构型的机器人,都能从这套标准数据里提取自己需要的部分,不用再反复调整格式、重新对齐。

更重要的是,作为第三方数据基础设施厂商,要明确自己的业务边界,知道什么事不能做。

现在行业里很多数据公司做着做着就开始自己做模型、自己做机器人本体,看似延伸了产业链,实际上变成了客户的直接竞争对手,没人敢把自己的核心数据需求交给竞争对手。

真正要做全行业的基础设施,就要保持中立的第三方立场:不大规模做和客户绑定的真机数据,因为真机数据是和本体厂商深度绑定的,头部厂商都会自己做这部分,第三方做真机数据要么做不深,要么就会和客户抢赛道;也不自己做具身基座模型、不做机器人本体,不参与上下游的市场竞争,只专注把数据这一件事做深。

这种中立性看起来是放弃了短期的热点,实际上是建立长期信任的基础。不管是哪个领域的厂商、不管是大公司还是创业团队,都不用担心数据供应商会变成自己的对手,才能放心地把数据需求交过来,共同搭建行业的生态。

简智正是因为实现了以上几点,才获得了大厂客户的青睐,得以助力小米、蚂蚁灵波等头部模型公司。

总而言之,从WAIC现场的行业反馈来看,具身智能正在走出“拼参数、拼Demo”的早期阶段,开始进入拼落地、拼工业化能力的新阶段。很长一段时间里,行业的注意力都在模型架构和机器人硬件上,很多人觉得数据是“配套环节”,但随着越来越多模型走到商用试点阶段,大家终于意识到,数据才是整个大厦的地基。没有高质量的、开箱即用的数据,再厉害的模型架构也是无米之炊,再便宜的机器人也只能在实验室里做演示。

在雷峰网看来,具身数据正在走出“卖原材料”的粗放阶段,进入工业化、标准化的“开箱即用”时代。就像互联网时代的云计算、大语言模型时代的token服务,具身智能的发展最终也会建立在成熟、稳定、中立的数据基建之上:当所有模型团队、机器人团队都不用再从头搭自己的数据采集产线,不用再为数据清洗、校准浪费精力,整个行业的研发节奏才会真正快起来,具身智能走进真实生活的那天,才会真正到来。

推荐内容