Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
雷锋网 · 2026/7/27 02:32:00

顶会具身辩论赛实况:徐丹飞激辩,PI连输三轮,谷歌大佬倒戈

AI 中文解读
最近机器人圈子里吵翻了天,一场顶级学术辩论火药味十足:到底该让机器人像人类一样通过日常视频学习,还是必须用专门采集的“亲手操作”数据?来自谷歌、英伟达、Physical Intelligence等机构的五位专家激烈交锋,甚至有人现场“倒戈”。辩论核心围绕两个问题:世界模型和策略模型该合体还是分开?控制机器人到底该靠生成逼真视频还是精准动作?最终大家勉强达成共识——分开干更稳妥,视频和动作也需要结合,单纯靠任何一边都走不远。这场辩论看似技术,其实跟普通人息息相关。未来你家机器人能不能稳稳端菜、灵活收拾玩具,就取决于科学家们如何平衡“想象力”和“执行力”。如果只追求生成漂亮画面而忽略动作精准度,机器人可能摔碎杯子;如果一味死磕动作数据,机器人又学不会灵活应对新场景。这场争论的结果,直接决定了机器人何时能真正走进家庭。
数据从哪来?控制靠像素还是动作? 作者丨张 璐 编辑丨齐铖湧 在具身智能与机器人领域迅速演进的今天,一个问题正在浮出水面:要想让机器人真正走进千家万户,我们到底该靠特定硬件采集的“具身数据”,还是该拥抱浩瀚如海的“互联网与人类行为数据”?2026年RSS大会最后一天的workshop圆桌讨论,现场火药味十足。五位专家围绕世界模型的实际落地展开激烈交锋。来自Georgia Tech和Nvidia的徐丹飞,以组合世界模型的研究闻名;Google与NYU的Sherry Yang,专注物理代理的世界模型评估与改进;Physical Intelligence的Laura Smith,强调具身智能的实践落地;NVIDIA的Max Li,长期深耕大模型架构;OpenDriveLab的Li Chen,则在机器人数据与控制领域有丰富经验。主持人抛出三个核心辩题,让五位专家分成两派正面碰撞。雷峰网AI科技评论小队在现场记录下这场思想碰撞,以下是完整实录:01第一轮辩论:世界模型和策略模型,应该合体还是分开?大家都知道现在搞AI都在追求大一统,但在机器人领域,这条路真的走得通吗?主持人一上来就抛出问题——世界模型和策略模型,应该合体还是分开?现场的几位大佬瞬间根据各自的学术立场分成了两大阵营。▎本轮对阵的双方是:“大一统”合体派: PI科学家Laura Smith、英伟达Max Li(主张把所有功能塞进一个超级模型里,既动脑又动手)“各司其职”分开派: 谷歌Sherry Yang、源策未来陈立(Lee)、徐丹飞(主张分开搞,看重工程运行效率和调试清晰度)支持“合体”的一方认为,现在AI的大趋势就是Everything in One。Laura认为,MoE模型都能把成百上千个专家塞进一个网络,为什么世界模型和策略不能合并?最终我们肯定想要一个超级模型,既能理解世界,又能直接行动。她的观点得到了同阵营 Max Li 的赞同。从长远来看,Max 也相信未来的终局一定是全能的大模型,但他非常务实地补充道:现在AI“能想象到什么”和机器人“实际能做到什么”之间,其实存在着一条巨大的鸿沟。视频模型学得再好,动作数据太少也发挥不出来,所以目前的当务之急,是怎么通过表征学习把世界模型的想象力翻译成机器人的执行力。听到这里,坐在“分开派”阵营的 陈立(Lee) 坐不住了,他直接从底层工程的“运行效率”出发,给合体派泼了一盆冷水。陈立强调,机器人是要在现实中实时干活的,策略模型的响应速度和运算效率是命根子,必须保证它跑得飞快。要是为了盲目追求合体,把世界模型这个庞然大物强行塞进同一个网络里,导致策略模型被拖慢、机器人动作卡顿,那在实际落地中根本没办法用。为了效率,必须分开调试和特殊化处理。陈立的说法得到了 Sherry Yang 的强烈声援。Sherry 指出:“目前绝大多数模型其实还处于欠拟合阶段。世界模型要吃下海量具身交互数据已经非常吃力,如果再强行塞进策略学习的任务,两个目标会互相打架,训练效果反而下降。”她进一步解释了两个模块的本质差异:世界模型需要大量失败数据来真正理解物理规律,比如机器人撞到东西、滑倒、抓不稳等场景,这些对提升模型鲁棒性非常重要。但策略模型的主要目标是学习成功行为。如果强行合体,失败数据可能会污染策略,让机器人学到更多错误的动作模式。徐丹飞也站在分开派这一边。他补充道:分开还有一个很大实际好处——调试和迭代更清晰。当机器人任务失败时,我们能快速定位:到底是世界模型没想对(预测未来不准),还是策略没执行好(动作选错了)。如果全塞到一个黑箱模型里,出了问题就很难指责具体哪个部分。现场有观众立刻通过Slido提问:“如果合并了,失败了到底怪谁?”这个问题引起全场笑声,也让辩论更加接地气。最终,这一轮“分开派”在观众投票中略占优势。第一轮辩完,现场观众的投票里,各司其职派胜过了大一统派,但嘉宾最后互相之间算是勉强达成了共识:世界模型和策略最好还是各回各家、各司其职。但问题马上又来了,既然把世界模型单独拎出来了,那我们怎么知道这个模型到底有没有把这个世界“看懂、学对”呢?是看它能不能像拍好莱坞大片一样,生成极其逼真的画面?还是看它能不能精准指导机器人的下一个动作?顺着这个话茬,两派圆桌嘉宾在第二轮直接陷入了更深层的技术纠结。02第二轮辩论:可控性到底靠像素,还是动作?到了第二轮,关于怎么控制世界模型的讨论,让上一轮的阵营直接打破重组,学术新星和产业专家开始各执一词。▎本轮对阵的是:“视觉颜值”像素派: Max Li、Laura Smith、陈立(主张视频画面最直观,是人类看懂大模型在想什么的便利接口)“硬核实操”动作派: 徐丹飞、Sherry Yang(中途根据实验修正立场)(主张机器人最终是在现实里干活,动作价值和语义先验高于画面颜值)第二个问题更加技术化:世界模型的可控性,到底应该主要依赖生成真实像素(视频),还是更应该关注动作层面的 grounding?支持像素派的英伟达科学家Max Li 一上来就金句频出。他认为视频是目前最自然、最有效的监督信号,而且他生动地打了个比方:生成高保真的视频,能让我们看清这个大模型到底在想什么——这就好比父母总想搞懂自己处于青春期叛逆孩子的内心想法一样。英伟达的Max 坚信,人类需要这种视觉上的高保真度,这能带来极佳的可解释性,是人类调试黑盒子系统最方便的接口。同阵营来自PI的Laura Smith 顺着 Max 的话茬表达了支持。她认为,把未来的画面用视频直观地生动展示出来,最大的好处就是当机器人干砸了的时候,人类能一眼看过去进行“责任划分”(blame assignment),瞬间揪出到底是哪个环节在推卸责任。但支持动作 grounding 的反方很快泼了冷水。他们承认视频作为人类接口很有用,但指出过度追求像素级真实性有时反而是一种干扰和算力浪费。机器人最终要执行的是可靠的物理动作,而不是去拍一部奥斯卡电影。把算力都花在生成漂亮画面上,可能会牺牲动作的物理一致性和精度,尤其在接触丰富(contact-rich)的任务上。面对两派的拉扯,Sherry Yang 在这一轮分享了自己的“倒戈”心路历程。她坦言,自己以前也是像素派的坚定支持者,但最近的大模型实验让她开始动摇。因为她发现即使把模型规模做到极大,单纯靠堆像素和扩大规模,在遇到需要精细接触的任务时画面依然不够稳健。所以她现在更倾向于在视频生成中引入更多语义信息和物理先验,而不是单纯看画面好不好看。徐丹飞 也表达了类似的观点。他一针见血地指出,视频其实只是现实世界的一个部分切片。人类在黑暗中摸索或者抓取物品时,根本不需要在脑子里想象出一幅画面,而是更依赖触觉和力反馈。因此,判断一个世界模型好不好,核心不能看它画画美不美,而是要看它能不能产出真正的动作价值。这一轮讨论虽然没有明确赢家,但大家逐渐形成共识:视频和动作不是对立关系,而是需要更好结合。单纯靠哪一边都走不远。讨论到这里,台上的气氛已经有点胶着了。大家发现,无论是追求炫酷的视频画面,还是死磕精细的手感反馈,说到底都是“下游”的应用和表现。科学家们心里都清楚,再聪明的模型、再完美的算法,没有数据喂养也只是个空壳子。那么,去哪里给机器人找最顶级、最管饱的“自学教材”?是去白嫖铺天盖地的互联网人类视频,还是必须收集机器人自己的亲身体验?这也就是本场圆桌的最后一问。03第三轮辩论:数据该从哪里来?最后一轮辩论直指根本问题:训练世界模型,主要应该靠互联网和人类视频数据,还是靠具身机器人数据?▎本轮对阵的双方是:“借鉴全网”互联网视频派: 徐丹飞、Sherry Yang、Max Li(主张人类视频规模巨大,能极大提升机器人的泛化能力)崇尚“亲身体验”具身控制派: 陈立、Laura Smith(主张互联网视频难救具体应用,高精度控制必须靠机器人自己的真实数据)支持具身数据优先的专家认为,机器人数据包含真实的物理参数、动作反馈和接触力,是最“干净”、最直接的信号。没有这些,模型很难准确学到接触动力学等关键知识。具身数据才是地基,人类视频只是锦上添花。甚至连作为“细节控”的 陈立(Lee) 这一轮也站出来公开表达了对互联网数据的怀疑。他直言不讳地指出,现在业界一谈到大模型就盲目崇拜互联网上的海量数据,但在他看来,那些铺天盖地的互联网视频对机器人具体的、高精度的具身应用来说,并没有那么直接的帮助。陈立认为,互联网视频顶多在宏观上帮机器人规划一个“子目标”(sub-goals),但要解决底层的抓取和手脚控制,还是得死磕机器人自己的具身数据。但支持人类/互联网数据的一方则从规模和泛化角度反驳。徐丹飞说:“纯靠机器人数据,规模太有限,很难覆盖现实中的长尾场景。人类视频数据量巨大,包含各种各样的交互方式和技能组合,能极大提升模型的泛化能力。”Sherry补充道:“人类本身就是地球上最强大的物理代理。我们可以把人类视频看作另一种‘机器人数据’,通过端到端控制或者姿态表示来对齐二者,这条路非常值得探索。”尽管双方最终达成较高共识:两者都不可或缺。但现场观众依然对这轮辩论给出了“现场法官”的评判:“借鉴全网”互联网视频派,以61%的投票率,胜过了39%的崇尚“亲身体验”具身控制派。当前阶段,如何高效利用人类视频数据、并通过世界模型把它和机器人数据桥接起来,可能是最重要的突破方向。未来很可能形成一个混合数据飞轮:互联网数据提供广度,机器人数据提
分享
阅读原文