Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
雷锋网 · 2026/7/22 07:06:00

WAIC深度观察:具身数据,进入「开箱即用」时代

AI 中文解读
WAIC上曝出一个猛料:具身智能行业最缺的不是数据,而是能直接喂给模型的「开箱即用」数据。简智机器人提出的「Model-Ready Data」概念,要求数据同时具备高精度、多模态和多样性,三者缺一不可。 通俗来说,现在互联网上有海量人类视频,但这些数据只能让机器人「看懂」画面,却无法教会它「动手操作」。比如教机器人抓杯子,光看视频没用,还得知道手指用了多大劲、关节怎么转、身体怎么保持平衡,这些精细信息才是关键。市面上的数据大多存在手部追踪误差大、传感器时间不同步、场景单一的问题——90%的数据都在实验室里重复「拿杯子拧瓶盖」,一出真实环境就抓瞎。简智机器人的解法是自研数据基础模型,通过算法补全遮挡、实现精准时空对齐,甚至用链式标注不仅教机器人「怎么做」,还教「为什么这么做」。 这套方案一旦普及,普通人很快就能感受到变化:家里的机器人不再是笨手笨脚的机械臂,而是能像人一样灵活地帮你端茶倒水、叠衣服甚至做饭。工厂里的机器人也能快速适应不同产品线,不再需要工程师反复调试。数据质量的提升将直接拉低机器人学习成本,让智能服务走进千家万户。
真正的「Model-Ready Data」,高精度、多模态、多样性缺一不可。 作者丨高景辉 编辑丨马晓宁 “具身智能的数据需求,远没有摸到上限。”在WAIC主论坛上的一次对话中,亮源新创创始人姜旭的判断引起了广泛共鸣。他进一步提到,具身智能本质是大模型向物理世界的延伸,会沿着“规模化预训练→规模化对齐→规模化部署”的三阶段范式演进,和大模型时代一样,智能供给的红利核心来自数据,现在行业连最基础的预训练阶段的数据缺口都没填上。的确,这个直面行业核心的观点足够尖锐,但对于数据的问题要如何解决,论坛上的嘉宾似乎没有给出足够详细的解答。于是,带着这个疑问,雷峰网AI科技评论走访了WAIC上的具身智能企业,希望从一线从业者口中找到答案。值得庆幸的是,今年参展的具身数据基建公司不在少数,提供的干货也很多,尤其是在和简智机器人的交流中,我们搞清楚了当前行业究竟缺什么数据、要如何获取这些高质量的数据。01具身行业真正缺的,是 "开箱即用" 的数据很多人说具身行业缺数据,但事实果真如此吗?互联网沉淀的人类视频已经超过百亿小时,这曾被认为是具身模型预训练的重要燃料。但这些数据只能支撑模型"看懂世界",无法支撑机器人完成真实物理世界的精准交互。具身行业真正需要的,其实是可以直接喂给模型、不需要二次加工的数据。简智机器人将这种数据定义为 "Model-Ready Data",翻译过来就是 "开箱即用" 的数据。根据各大具身公司的实际反馈,这种数据需要同时具备三个核心特点:高精度、多模态、多样性,三者缺一不可。高精度是基础门槛。具体而言,就是低误差、低延迟、低漂移。手部追踪的厘米级误差会沿训练链路持续放大,最终导致机器人操作失败;传感器之间几十毫秒的时间差,会让模型学到完全错误的因果关系;采集十几分钟后姿态开始漂移,整条数据的价值便大打折扣。当前行业普通方案的手部关节追踪误差普遍在 2-3 厘米,什么概念?成年人手指直径也就 1-2 厘米,这个误差意味着模型看到的手指位置,和真实位置差了整整一个手指的距离,会导致抓杯子时手指穿进杯壁,拧瓶盖时手指根本没碰到瓶盖,训出来的策略永远抓不准物体。多模态是能力边界。真正的人类操作不只是 RGB 画面,还包含人体姿态、手部轨迹、相机位姿、深度信息、触觉信息等多个维度。纯视觉路线只采集了 "人看到了什么",完全缺失了 "人是怎么动的、用了多大劲" 的核心信息。没有手部关节数据,手一被物体遮挡就丢轨迹;没有触觉数据,模型永远不知道抓鸡蛋用多大劲;没有全身姿态数据,动作永远僵硬得像提线木偶。多样性决定泛化上限。模型要面向一千个家庭、一千种角色,数据就必须从尽可能多的场景中采集。数据价值从来不是堆时长,核心是场景、任务、人物、物体的丰富度,这才是决定模型落地后泛化能力的关键。如果几十万小时数据里 90% 都是实验室白墙前 "拿杯子、拧瓶盖" 的重复简单动作,模型训练后只能在演示环境里做固定动作,一到真实场景就失效。为什么大多数数据公司做不到这三点?背后的难点各不相同。高精度的核心,是接近 100% 还原人在现实中的移动与操作过程:眼睛看到了什么、手接触了什么、每个关节转动的角度、手部接触面的先后顺序,这一系列过程都要完整保留。这反过来要求足够强的算法能力,即通过算法将原始信号转化为精准的结构化数据。多模态的难点,核心在硬件本身。硬件是模态的基础,如果硬件获取能力差、精度低,最终效果就无从谈起。很多团队用现成模组拼凑,摄像头、数据手套、IMU 各自为战,没有做硬件级的时间同步,不同传感器的数据时间差普遍在 20-50 毫秒,模态之间根本无法有效对齐。多样性的难点,则考验公司的产品能力和运营体系。设备的易用性、价格、质量、适配性,决定了它能不能进入更多场景;完整的数据运营管线,决定了能不能高效处理来自不同场景的异构数据。产品做得不好,设备进不了更多家庭和商业空间,扩张速度就会很慢;管线效率低,现实数据清洗不过来,多样性就是空谈。甚至,即使克服了以上三点,还要面临着一道终极考验:规模化。规模化对于数据公司而言是一种综合性大考,需要大规模的采集体系、数据处理管线以及对模型的理解。当前,行业只有简智等少数几家企业能真正实现规模化,从他们的成功经验里,或许可以学到一些“干货”。02从算法到硬件,Model-Ready Data 怎么做?开箱即用说起来简单,真正落地需要一整套体系的支撑。从模型理解到算法实现,从硬件设计到场景搭建,每一环都是漏斗,一环做不到位,最终的数据质量就会打折扣。那么究竟要怎样才能实现全流程的闭环?在和简智机器人交流的过程中,我们逐渐摸清了门道。▎懂模型,才能做出模型能用的数据很多人有个误解:数据公司不需要懂模型,只要把数据采回来交给客户就行。但在简智看来,如果不懂模型,就做不到"Model-Ready Data",只会产出半成品,浪费下游客户大量的时间做二次加工。懂模型分两个层面:第一,要懂当前模型在每个细分模态下的质量要求是什么,知道针对这个模态该设计什么样的范式。比如标注,不是标得越多越好,而是价值驱动的COT链式标注:不止标注动作本身,更把人类行为背后的目标、常识、价值判断显性化--不仅标注“这是抓取动作”,还要标注任务目标、操作步骤逻辑、物体交互关系、力控原因、失败修正动作、环境约束与常识规则简智做的全人工帧级CoT标注,不是简单标"这是开门",而是建立完整思考链路,让模型不仅学会"怎么做",还学会"为什么这么做"。第二,要懂怎么用模型加工数据。如果靠人工、非系统化的方式处理数据,精度和效率都有明显天花板。简智自己做 Data Foundation Model(DFM数据基础模型)的核心目的,就是用模型实现"输入头手相关信息,直接输出完整人体数据"的端到端能力。这其中最典型的应用就是遮挡补全。真实世界里,人做动作时手经常会被物体遮挡——手伸到抽屉里、拿东西时手指被挡住、叠衣服时手埋在布料下面……传统采集方案遇到遮挡就只能丢失数据,或者靠硬件加更多相机,但无论多少相机都不可能完全消除遮挡。简智的解法是用视频生成模型补全关键帧:基于前后帧的信息,模型可以预测出被遮挡部分的手部姿态,就像人看到手伸到桌子下面再伸出来,自然知道中间手在做什么一样。这样就能保证给模型训练的数据是连续的、完整的,手部全程的动作状态都能准确输出。"这就像一座自动化工厂,既解决效率问题,也解决严格的时空对齐问题。"简智团队解释,人的头和手在同一个时空坐标系里,因为神经传导的完整性,动作不会有中断,时空坐标系是连续的。如果没有完整的模型方案,靠先采集头部数据、再采集手部数据、最后人工拼接的方式,永远做不到真正全链路闭环,完整复刻人类感知-动作回路。第三,要懂模型长期发展需要什么。真正的人类数据,从来不是只采“手”和“眼睛”的数据人做动作是一个完整的整体:腰怎么转、腿怎么站、重心怎么移、身体怎么保持平衡,这些才是让人形机器人真正“像人”的核心。简智的无本体采集方案从设计之初就是面向人形机器人的终极需求:不止采集手部和视觉数据,更完整覆盖腰、腿、全身的运动链,输出完整的SMPL-X人体网格,还原人做每一个动作时的全身协同、重心变化、平衡逻辑,而不是只给模型"一只手”和“一双眼睛”。这才是人类数据的终极价值:不是为了适配某一款机器人,而是通过完整还原"人"本身,让模型的运动能力、行为逻辑无限向人对齐,当整个行业的数据都在向"完整的人"靠近时,模型能力、机器人能力才能形成正向循环,共同推动具身智能真正达到接近人的水平。▎算法:端到端自研,多源融合,高效压缩算法层面,核心是多套体系的配合。比如是端到端自研算法。不同于基于开源算法的迭代优化,端到端自研可以从底层控制精度和稳定性。结合多源传感器数据的实时融合校正,最终实现手部关节追踪稳定误差小于 1 厘米 —— 这也是行业首个做到亚厘米级精度的无本体采集方案。还有多源融合算法。视觉、IMU、触觉三端数据不是简单叠加,而是多特征、多源的融合与矫正。哪怕手完全被物体遮挡,多源融合算法也能精准还原手指姿态,不会跟丢轨迹,无效帧比例可以控制在3%以内。多模态输入不只是增加了信息维度,更可以通过交叉验证反向提升每个单一模态的精度。还有一个被低估的是压缩算法。比如六目相机的数据量比双目相机多得多,如果没有好的压缩算法,传输和存储都会成为大问题。简智自研的感知压缩算法,不是简单做有损压缩,而是在帧率层面做智能优化,压缩比可以做到原始数据的2%,而且压缩是在设备端直接完成的,再加上端侧质检直接过滤掉30%的无效数据,大大降低了传输带宽和存储成本。▎硬件:仿生的第一性原理——从骨骼、肌肉、皮肤来拆解、记录人的全模态相比模型,硬件的共识要广泛得多,很多人都表示,在数据采集领域,硬件是一切的基础,像前文提到的“多模态”的核心就是硬件。但具体到硬件的选择上,简智却有不少“非共识”的地方。其中最典型的就是摄像头方案。行业里大多数第一视角采集设备用双目甚至单目相机,简智却坚持用六目同步相机,这是为了拍得更清楚吗?其实不是。六目相机不只是向外拍环境,同时也向内,视野覆盖人的腿、膝盖、腰部的全部动作。而且六目是两两组合的,全身每个角度都有多摄像头覆盖,组内效应能把精度提得很高。没错,他们的目标从一开始就是同时记录人的全身动作以及人和物理环境的交互。人的行走、腿部动作、身体姿态,这些都是单一胸前视角的摄像头拍不到的,但对理解完整的行为逻辑至关重
分享
阅读原文