Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
钛媒体 · 2026/8/3 06:32:17

测绘科学,或许是具身智能数据问题的终极解法

AI 中文解读
际数科技这家公司把测绘学里的老办法用到了机器人数据上,堪称“给AI数据建质检站”。过去大家拼命采集海量数据,却发现真正能用的很少,清洗成本比采集还高,而且一到真实场景就失灵。他们用“一张图、一把尺、一个飞轮”来解决问题:建一个质量因子库,搞清什么物体、什么材质会影响观测精度;再做精细场景建模,保证机器人眼睛看到的时间空间对齐;最后训练一个“质量大模型”模仿专家打分,替代上百人的质检团队。这套做法在智驾领域已经让可用数据规模提升10倍,不合格数据从八成降到两三成。如今他们杀入具身智能,想当独立第三方,替所有机器人公司把关数据质量。对普通人来说,这意味着以后机器人学会新技能会更靠谱,不会像有些智能驾驶汽车那样升级后反而变笨。更长远看,当数据从一次性消耗品变成可复用的资产,整个行业的研发成本都会降下来,扫地机器人、养老机器人这些产品才有可能更快走进寻常百姓家。
(本文作者为 科技不焦虑,钛媒体经授权发布)过去一年,从遥操作数据采集到仿真数据生成,从本体厂商自建数据闭环到第三方数据服务商涌现,具身行业在数据生产端的投入急剧膨胀。IT桔子数据显示,2026年上半年数据服务与数据集企业共发生了19起融资,融资总金额近50亿元。放到更大的坐标系里看,这个赛道的体量还在快速膨胀。全球自动驾驶数据标注市场在2025年已达到约50亿美元,年复合增长率超过25%;而具身智能数据市场虽然起步更晚——2026年预计约10亿美元——但增速更猛,2030年有望突破100亿美元。数据服务的盘子在变大,但问题也在变复杂。一个越来越明显的矛盾是:数据数量在增长,真正能提升机器人能力的有效数据仍然稀缺。采集一小时视频很容易,但得到一小时可直接用于训练的洁净数据却很难。多家具身本体公司对我们表示,清洗数据的成本已经远远高于采集数据的成本。也因此,几乎所有的具身本体厂商才都开启了自建数据采集管线之路。更大的问题在于进入真实场景之后。很多团队在堆了大量数据之后发现,模型在评测集上表现不错,一到真实场景就暴露问题。接触、滑移、遮挡、过力、异常恢复,这些只在真实闭环中才浮现的变量,很难被仿真引擎捕捉,在预训练的数据集中也很难覆盖。这不是数采某个单一环节的问题,而是从场景选择、采集设计、过程控制、数据验收到质量修复、任务适配、资产复用,全链路都需要提升的质量能力。“这个行业需要一个独立三方的中立质量层”,际数科技的创始人周源对创投家表示。成立于2023年5月的际数科技,是一家专注做数据质量服务的创业公司。公司的两位联合创始人都有着深厚的测绘工作经历,也都曾在各自负责的知名测绘项目中吃尽了数据质量的苦头,而拥有相似背景的两位创始人加上商业化合伙人,也很早就达成了一个共识:要用测绘学的方法做空间智能的数据“精炼厂”。从左至右:邹小弟 首席运营官、周源 首席执行官、叶文凯 首席技术官。际数科技在2024年完成天使轮融资,2025年获长江产投产业融资,成立2年间,在智驾领域已服务了超20余家头部客户。2026年开始,际数也正式切入了具身智能的领域,也即将在近期完成新一轮的融资。中立质量层周源认为,目前具身数据行业面临六个核心卡点:有效数据成本高;数据质量难提前判断;跨本体复用困难,数据不能天然迁移;离线评测与真实部署脱节;数据资产化困难;本体厂与大脑厂各自做数据闭环,难以沉淀跨本体、跨场景、跨客户的中立质量基础设施。而这些问题天然需要一个中立质量层来解决。为什么在众多模型厂商都在自建数采管线的同时,仍需要一个外部独立的质量层?针对这一质疑,周源表示:目前行业惯例是用模型端到端效果来验证数据质量。数据好不好,全看训练出来的模型表现。这套机制在大语言模型阶段尚可,但空间智能的模型训练管线极长,等到真出了问题,其实很难归因:是模型问题、训练问题、调参问题还是数据本身的问题。而际数的解法是:在数据进入模型之前就构建一套数据质量标准和评估方法、治理方案,不让质量问题伴随数据传到模型里。这背后还有一个被忽视的行业认知错位:客户买的从来不是标注服务本身,而是“能训练出好模型的数据”。但在传统模式下,数据用完即弃,大家永远在重新花钱。中立质量层要做的,是把数据从成本项变成可沉淀、可复用、可增值的生产要素——同时,也是在为行业争夺空间智能数据标准的定义权。同样的问题在智驾行业其实早有体感:端到端大模型普及后,智驾体验没什么明显提升,甚至有些企业在把模型升级版本后,车辆反而变笨了。行业共识是应该重新构建基础数据质量框架。但当数据飞轮转起来以后——50万+辆车在回传数据——数据的质量控制就变成了一件成本极高的事情。在周源看来,这件事并不适合本体厂商或模型厂商自己做。因为建立质量模型评估数据本身需要更为开放的数据飞轮体系,单一厂商的管线不足以观测质量问题对整个数据域的影响。行业一定需要一个跨多方的组织来研究泛质量问题——研究不同场景对不同模态传感器、不同观测方案产生的影响,找到共性影响。而这正是中立质量层存在的价值,也是际数科技的终极愿景。“一张图、一把尺、一个飞轮”际数做的不是简单的数据标注,而是整个空间数据处理管线——从采集、清洗、标注、对齐到质检。周源将这套核心方法论称作“一张图、一把尺、一个飞轮”。而这套方法论的本质,正是用测绘百年积累的误差分析和不确定性分析方法论解决空间数据质量问题。“一张图”指的是际数自建的质量因子库,用来描述真实场景中物体、材质、动作、接触等因素与数据质量之间的关系,用来判断哪些因素的变化会对最终数据质量产生怎样的影响。“当我们进入一个环境观测物理世界时,有些因子非常稳健,有些就没那么稳健,甚至会对观测系统产生负面影响。假如你能掌握物理世界中不同物体、不同材质、不同被观测对象对你的观测系统在质量或精度上的影响,那么整个观测体系的质量就是可控的。这是我们的基座。”周源对我们表示。高质量因子库 GData Quality Factor Library (QFLab)“一把尺”指的是高质量场景基座。时空对齐一直是具身数据最基本的质量矛盾,际数科技通过对场景做精细化建模,让客户采集设备进入后能实现最准确的几何标定和时间对齐,从源头解决多模态观测的精度问题。在整个数据管线过程中,除了空间的定位精度、时间对齐精度这些绝对质量问题以外,还掺杂着大量相对的质量问题。比如对一个物体状态的评估,可能因人而异。对一个形状的语义描述,也相对模糊。这些相对的质量问题,单纯通过训练几何或精度标准去评估很难统一,需要大量专家知识或质检人员的判定。际数科技通过构建一个数据质量飞轮,把带有质量问题的数据拿出来,通过专家知识和质检人员判定,学习质量问题和数据特征之间的关系,训出一套“质量模型”。让模型学会专家的打分逻辑,替代庞大的专家和质检团队,对数据的质量进行评分、对问题进行诊断,甚至评估质量问题能否修复,来完成数据质量把控的最后一环。就这样,际数科技用“一张图、一把尺、一个飞轮”构成了空间数据质量的基础模型。最后,际数科技还用一个智能体把这些模型能力、工具能力组织起来,调度这些能力来处理不同的pipeline,为不同客户提供不同数据规格的产品服务,最终输出一个高质量数据集,用于成果交付。际数的这套质量层解决方案在智驾领域已服务了20余家客户,让客户的可用数据规模有了10倍以上提升——原来10Hz数据一秒只标注1-2帧,而通过际数的管线处理,可以对10帧全部标注;数据漏斗也从之前的10%-20%提升到70%-80%;同时,际数的质量大模型也实现了跟人工PK的完胜,基本实现替代了一支100人左右的数据质检团队。一个头部智驾客户的合作历程,充分说明了这套方法论的复利效应。2024年,该企业因7路环视相机与激光雷达的多模态自洽问题找到际数——空间误差需控制在3厘米以内,要素完整率要求100%,此前自建平台半年未能达标。际数用“一张图、一把尺、一个飞轮”在35天内完成首期十万组交付,此后双方从单次项目延长为连续六期采购,累计完成395万组次多模态数据交付。场景资产化周源有一个判断:现在具身智能不是缺数据,而是缺场景。“全季酒店所有房间几乎一模一样,真正有效场景仅2-3间;装配工厂100个工位,有效仅4-5个”,周源举例说。不是说市场上数据不够多,恰恰相反,各路玩家都在疯狂采集,数据量膨胀得很快。问题在于,这些大多是原始、孤立、未经过结构化处理的“数据原料”,缺乏与具体场景的有效绑定。机器人需要的是“在厨房切菜”的数据,而不是一万小时杂乱无章的室内视频。没有场景定义的数据,就像没有经纬度的坐标,数量再多也难以转化为训练价值。数据资产化要解决的就是这个断层。它的核心是把原始数据加工成可复用、可交易、可定价的场景化资产。对具身智能行业来说,这意味着数据从成本项变成生产要素——不再是采完即用的消耗品,而是可以沉淀、复用、甚至跨客户共享的战略资源。一旦数据具备了资产属性,整个行业才能从“每次从零开始采数据”的作坊模式,转向“基于已有资产持续迭代”的工业化模式。际数科技的做法可以概括为“先定义场景,再评估质量,最后闭环迭代”。他们先从训练需求反推,用因子库把物理空间拆解成机器可理解的场景要素,形成场景知识图谱。再通过采集 - 评估 - 反馈 - 再采集的飞轮,让每一轮数据都补上上一轮暴露的缺口。经过这个流程,原始数据就变成了带场景标签、有质量背书、可持续增值的数据资产。这种资产化的价值在际数与之前的智驾客户的第三期合作中得到了更直接的验证。当时客户准备调整技术栈,需要更改模型技术方案,对数据提出了全新要求:路沿需要更精细的形态刻画,车道中心线和拓扑关系需要重新组织。按传统做法,这意味着重新采集、重新标注、重新质检——数百万元的额外投入和三四倍的交付周期。但际数复盘后发现,由于早期场景基座采用完整、高精度的刻画方式,数据规则又被拆分为原子化要素
分享
阅读原文