Daily Tech Briefing
AI 科技速览
每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。
钛媒体 · 2026/8/4 06:41:00
物理AI不是下一个风口,而是下一轮工业革命
AI 中文解读
物理AI迎来爆发时刻!太平洋两岸同一天释放重磅信号:NVIDIA开源了能塞进芯片的“迷你世界模型”,Google则拿出了能操控机器人拧灯泡的智能系统。资本更是疯狂涌入——今年全球物理AI融资已达73.8亿美元,是去年的两倍多,单笔交易动辄上亿美元。
通俗地说,物理AI就是让机器人真正学会干活的技术。以前AI只会聊天、画图,现在它要走进现实世界,像人一样动手操作。这比数字AI难得多:没有现成数据可用,一条错误指令可能造成设备损坏甚至伤人。目前最大瓶颈是真实数据短缺——实验室里摆拍出来的“干净数据”没用,机器人需要面对外卖车乱窜、小孩奔跑、地面湿滑等真实混乱场景。
对普通人而言,这意味着未来几年工厂流水线、物流仓库会越来越常见到机器人身影,它们不再是执行固定程序的机械臂,而是能随机应变的新“同事”。不过也别担心明天就被抢饭碗——人形机器人量产才刚起步,中国今年预计产10万台,离大规模落地还早。但资本和巨头们已经在赌:这场变革必然发生,就像当年的互联网革命。
(本文作者为 山自,钛媒体经授权发布)文 | 山自7月20日,洛杉矶SIGGRAPH会场。NVIDIA的Neil Ashton站在台上,身后屏幕亮起四个大字:"Physical AI Day"。同一天,Google DeepMind的Carolina Parada对着WIRED的镜头说出另一句话:"这是通往物理AGI的里程碑。"她指的是Gemini Robotics 2——这个能控制人形机器人拧灯泡、系垃圾袋、整理货架的模型。而NVIDIA当天扔下的Cosmos 3 Edge,是一个40亿参数的"精悍型世界模型",能塞进Jetson Thor边缘芯片里实时运行,权重、代码、训练配方全部开源。太平洋两岸,同一天,同一个信号:数字AI的叙事正在让位于物理AI的叙事。这不是巧合。这是物理AI的历史性拐点。物理AI正在经历一场结构性重估先上数据,因为数字比任何形容词都诚实。CB Insights的数据显示,2026年Q1,Physical AI & robotics以11%的交易份额领跑所有AI细分领域,工业人形机器人开发商和机器人基础模型公司分别拿下交易量的前两位,各17笔和15笔交易。人形机器人公司2026年的融资规模有望达到创纪录的100亿美元。2026年至今,全球物理AI领域的公开融资已经达到约73.8亿美元,超过了2025年全年的37.7亿美元,更是2024年全年22.4亿美元的三倍多。中位数融资额从2025年的6100万美元飙升至1.65亿美元,72%的交易都是九位数起步。这是什么概念?这不是VC在投机器人,这是基础设施级别的资本在押注一个新时代。看看这些名字:Uber创始人Travis Kalanick的Atoms拿了17亿美元,a16z领投;Figure AI估值飙到390亿美元;NEURA Robotics完成14亿美元C轮融资,估值70亿美元;Mind Robotics成立仅一年就拿下4亿美元B轮,估值34亿美元。中国的势头同样凶猛。源自清华大学智能产业研究院(AIR)孵化的求之科技(DISCOVER Robotics)宣布完成1亿美元天使+轮融资,IDG、星连、武岳峰、达晨等联合投资。8个月内完成三轮天使轮融资的正奇未来,金额达数亿元。资方阵容也颇为亮眼:鼎晖VGC投资、线性资本、上汽恒旭、周大福战投,囊括了顶级VC、车圈产业资本和高端消费产业资本三大类。智平方B轮超10亿、星海图两个月拿近30亿、生数科技两个月26亿……2026年,'AI新贵们'集体押注世界模型。但最值得关注的变化不是"钱多了",而是钱的性质变了。2025年,物理AI市场还是"formation and experimentation"——50%的交易是首次融资,投的是"能不能做出来"。到了2026年,首次融资占比骤降到8%,92%的钱都流向了已经证明过自己的公司。投资者的问题从"有人能造出物理AI吗?"变成了"哪家公司能最快把数据、硬件、制造和部署闭环跑起来?"这不是泡沫。这是平台选择周期。真实数据瓶颈,物理AI的命门资本的狂热背后,一个被多数人有意无意回避的问题正在浮出水面:真实数据,才是物理AI的命门。Applied Intuition的CTO Peter Ludwig说得直接:物理AI比数字AI难多了。数字AI可以直接抓取互联网公开数据,物理AI所需的矿场、农田、港口数据没有公开渠道;数字AI出bug推个软件更新就行,物理AI出bug可能死人。但Ludwig没说完的那半句是:即便你有钱、有人、有场景,没有真实数据,一切都是空中楼阁。真实数据短缺,是当前机器人/物理AI赛道最核心的痛点与瓶颈。绝大多数公司的数据尚来自专业采集机构提供的"干净数据"——在实验室里,工程师把物体摆好、灯光调好、动作设计好,机器人按部就班地完成预设任务。这些数据看起来很美,但有个致命缺陷:它们不包含真实世界的混乱。真实世界里,外卖车会突然从拐角冲出来,儿童会在机器人面前不可预测地奔跑,地面会有积水和鹅卵石,电梯信号会中断,小型犬会在你脚下绕圈。这些"脏数据"——包含失败案例、环境干扰、人类意图博弈的数据——才是训练模型泛化能力的核心燃料。"完美数据教不出能干活的人形机器人。" 这句话正在成为物理AI行业的共识。Grid Dynamics与韩国斗山机器人的合作就体现了这一困境。双方试图把物理AI软件接入协作机器人,让机器人能够识别变化的物体姿态并根据目标调整抓取策略。但合作声明中特意强调了一点:企业必须明确生产数据的所有权、存储位置和网络安全要求,尤其是在汽车、电子和医药等对工艺信息敏感的行业。为什么?因为数据就是物理AI的石油,而大多数工厂宁愿把数据锁在保险柜里,也不愿分享给机器人公司。更残酷的是,物理AI的数据获取成本是指数级的。数字AI训练GPT-4,可以一次性喂进去整个互联网。物理AI训练一个拧螺丝的机器人,需要采集成千上万次"拧螺丝"的真实动作——每一次都要在真实环境里操作真实物体,失败一次就可能损坏设备。这意味着什么?意味着物理AI的竞争,本质上是"谁能以最低成本拿到最多真实交互数据"的竞争。 没有数据闭环的公司,模型再漂亮也只是PPT。物理AI时刻:技术、政策、资本三线并进如果只看融资数字,可能会以为物理AI还是"画饼"阶段。但过去两周发生的一系列事件,正在把这个饼变成真的。技术线:大脑正在从云端走向关节7月20日NVIDIA SIGGRAPH的"Physical AI Day"上,Cosmos 3 Edge的发布是一个标志性事件。这不是又一个云端大模型,而是一个40亿参数的"精悍型世界模型",能塞进Jetson Thor边缘芯片里实时运行,推理吞吐每秒28帧,在VANTAGE-Bench视觉理解榜单上拿下同规模模型TOP1。更狠的是,权重、代码、训练配方全部开源。这意味着什么?意味着物理AI的"大脑"正在从数据中心走向每一个机器人的关节。 以前你需要一个DGX超算集群才能训练机器人,现在一块Jetson开发板就能让机器人"边跑边思考"。同一天,Google DeepMind发布了Gemini Robotics 2。这个模型能控制Apptronik的Apollo 2机器人拧灯泡、系垃圾袋、整理货架——不是预编程的固定动作,而是理解场景后自主规划。Google的野心很明确:做一个机器人的"Android操作系统",让所有硬件厂商接入同一个智能层。政策线:地缘政治的冷风7月28日,FCC把"外国制造的人形机器人和四足机器人"加入了"覆盖清单"(Covered List),意味着新的外国机器人将无法获得进入美国市场的设备授权。虽然没点名,但谁都知道这针对的是谁——中国的人形机器人出货量正在碾压美国。工信部预计2026年全国人形机器人产量将超10万台,一季度出口同比增长210%。Unitree 2025年出货超5500台,占据全球约32%的市场份额。中国制造商正把数千台人形机器人推入物流中心和工厂,主要目的不是干活,是收集训练数据。这种"以量换数据"的策略,正在把中美之间的物理AI差距从"技术代差"变成"数据代差"——而数据,才是物理AI的石油。资本线:上市潮来了7月底8月初,Unitree的科创板IPO启动,募资约6.22亿美元,估值62亿美元,即将成为全球首家纯人形机器人上市公司。CEO王兴兴宣布2026年计划出货多达2万台人形机器人,约为2025年的四倍。Agility Robotics通过SPAC上市,估值25亿美元,其Digit机器人已累积超65000小时的运行数据,手握超3亿美元多年订单。物理AI公司正在从"一级市场的宠儿"变成"二级市场的标的"——这通常是一个技术赛道从"概念验证"走向"商业验证"的分水岭。从Token到Action:两条路线的分野与合流如果把AI比作一场攀登AGI的远征,2026年的行业已经悄然分出了两条关键路径。第一条路径是"Token"——数字世界的认知登顶。 代表是Kimi K3、GPT-5、Claude Opus 5。它们解决的是理解、推理、编码和智能体任务。拼的是参数规模、上下文窗口、代码能力。这条路的头部格局已经日趋稳定:OpenAI、Anthropic、Kimi、智谱各自占据了生态位。第二条路径是"Action"——物理世界的根系扎根。 代表是NVIDIA的Cosmos 3、Google的Gemini Robotics、各家具身智能公司的VLA模型。它们解决的是机器人如何感知真实世界、规划连续动作、在动态变化中持续完成任务。Token决定AI能想多远,Action决定AI能走多实。但这两条路不是平行线,它们在加速合流。Google的Gemini Robotics 2本质上就是一个VLA(视觉-语言-动作)模型——它把语言模型的理解能力和动作模型的执行能力缝合在了一起。NVIDIA的Cosmos 3 Edge也是世界模型与动作模型的融合,让机器人能够"边感知、边决策、边调整"。未来的物理AI,不会是一个"会动的ChatGPT",而是一个"有身体的AGI"。 它既能理解"把桌上的可乐放进冰箱"这个自然语言指令,又能自主拆解成"抓取→移动→开门→放入→关门"的子任务,
分享
阅读原文 ↗