Daily Tech Briefing
AI 科技速览
每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。
雷锋网 · 2026/7/22 00:48:00
从生成到行动,生数科技用通用世界模型连接「两个世界」
AI 中文解读
生数科技提出了一个大胆的新方向:让AI不再只是“生成视频”,还能“指挥机器人”,用同一个模型连接数字世界和物理世界。这则新闻最吸引人的地方在于,一家以视频生成闻名的公司,正试图打通AI从“看懂世界”到“动手做事”的全链路。
简单来说,传统做法是把视频生成和机器人控制当成两件独立的事:一个画画面,一个做动作。而生数科技认为,两者底层都需要理解“世界如何变化”——比如人物奔跑时衣服怎样飘动、机械臂抓杯子时杯子怎么受力。他们用一个统一的模型架构,在像素空间里生成连贯视频,在动作空间里输出机器人可执行的指令。已经推出的三款产品里,Vidu负责生成动态内容,Vidu S1能根据用户语音实时改变画面,Motubrain则直接将理解转化为机器人的抓取、移动等动作。
对我们普通人来说,这意味着AI生成视频将更逼真、更可控,未来还能让机器人更聪明地适应家庭或工作环境。比如你对着摄像头说“把花插进花瓶”,机器人不仅能听懂,还能预判动作后果,稳稳完成任务。这项技术让AI从“纸上谈兵”的创作者,变成了能亲自动手的执行者。
在世界人工智能大会(WAIC)的展馆里,机器人通常是最抢镜的一类展品。机械臂抓取物体、人形机器人听从指令完成家务,“世界模型”也常常伴随这些演示出现,用来解释机器人如何理解环境、预测变化并完成行动。久而久之,世界模型似乎逐渐成为机器人和自动驾驶领域的专属概念。但在生数科技创始人、清华大学人工智能研究院副院长朱军看来,通用世界模型并不只服务于某个单一场景,其核心是通过统一的基座与架构,实现对世界的理解、预测与行动。7 月 20 日,在生数科技与万兴科技联合承办的“世界模型驱动下的 AI 影视生产力新范式”专题论坛上,朱军提出世界模型不是视频模型的升级,也不是语言模型的延伸,而是 AI 从“生成内容”迈向“理解世界、推演世界、实时交互世界”的新范式。基于同一底层基座,模型既可以在像素空间生成视频内容,也可以在动作空间输出机器人可执行的动作。AI 视频与具身智能因此并非两条割裂的技术路线,而是世界建模能力在数字世界和物理世界中的不同延伸。这也是理解生数科技通用世界模型战略的关键。公众最早通过视频大模型 Vidu 认识这家公司。如今,其产品体系已经从数字内容生成拓展至实时交互和物理行动:世界生成模型 Vidu 理解并生成动态数字内容;实时交互模型 Vidu S1 将用户指令纳入生成过程;世界动作模型 Motubrain 则将对环境的理解和预测转化为机器人动作。看似分属 AI 视频与具身智能两条赛道,实际上,三款产品沿着同一条路径展开:生成世界、在世界中交互,并最终行动于世界。01世界模型的核心,不只是“预测下一帧”世界模型究竟需要具备什么能力?朱军将其概括为三个部分:理解、想象和行动。首先,模型要感知并理解当前环境;其次,要预测不同输入或动作可能带来的变化;最后,还要把理解和预测转化为可执行的决策。这与人类学习骑车、开车等技能的过程相似。人在采取动作前,会预判不同操作的结果,再选择更安全、稳定的方案。因此,世界模型不只是生成一个看起来真实的未来,也不只是预测下一帧画面,而是要形成从理解当前状态、推演未来变化到指导行动的闭环。机器人是这套能力最直观、要求也最高的应用之一,但不是唯一应用。数字内容同样需要世界建模。图片记录的是一个瞬间,视频则包含时间、空间和状态的连续变化。人物运动时,身体、衣服和背景要保持合理变化;镜头切换后,角色外貌、服装和空间位置不能无故改变;随着内容延长,模型还要处理物体关系、事件顺序和环境状态。视频模型不仅要知道物体“长什么样”,还要学习它如何运动、如何与环境发生关系,以及一个状态如何演变为下一个状态。当然,生成连贯视频并不等同于拥有完整的通用世界模型能力,但视频生成所要求的时空建模、动态预测和状态一致性,为进一步走向实时交互和物理行动提供了基础。02视频数据,是构建通用世界模型的重要底座从第一性原理出发,构建通用世界模型需要解决两个问题:数据和架构。过去,大模型通过通用架构、规模化数据和算力形成 Scaling Law。要让世界模型从特定场景的小模型走向通用基座,同样需要大规模、多样化的数据。生数科技将相关数据归纳为一个从互联网视频到机器人实采轨迹的“数据金字塔”,其中包括通用视频、第一视角人类动作视频、合成数据和机器人轨迹数据。这些数据的差异,主要体现在规模和精度上。互联网视频规模庞大,记录了人物、物体、环境、动作及其时空关系。影视剧、纪录片、监控视频和第一视角影像,都保存了真实世界运行的一部分信息。机器人轨迹数据则能够提供关节角度、控制信号、力反馈和动作结果,但采集成本高,规模远小于互联网视频。过去,由于缺少动作标注和机器人控制信号,通用视频很难直接用于从状态到动作的学习。但随着视频生成模型发展,模型可以通过预测和重建视频,学习空间、时间、动作和结果之间的关系,视频数据也由此成为世界模型大规模预训练的重要基础。不过,视频数据不能替代机器人数据。视频可以告诉模型动作在视觉上如何发生、环境如何变化,却无法完整提供机器人执行所需的关节角度、力反馈、本体状态和控制信号。更合理的路径,是先通过海量视频学习通用的世界规律,再通过机器人数据补充精确的动作知识和物理反馈:前者拓展世界模型的认知广度,后者提升行动精度。03从 Vidu 到 Motubrain,是同一套能力的逐步延伸如果只看产品形态,生数科技从视频生成走向具身智能,像是一次横跨两条赛道的业务扩张。但从其模型发展路径来看,这更像是视频建模能力向实时交互和物理行动的自然延伸。生数科技从成立之初便定位于基础模型,并将视频建模作为技术起点。在模型训练过程中,团队逐渐发现,视频模型的能力上限并不只体现在画质、时长和生成效果上。随着数据和模型规模扩大,模型对人物、物体、空间关系与动态变化的理解也在持续增强。这意味着,视频模型学习的不只是如何生成画面,还包括世界如何随时间变化。模型对时空结构、运动规律和状态演化理解得越深入,就越有可能从内容生成进一步走向实时交互,乃至物理行动。过去两年,视频基模也经历了从展示技术可能性,到进入真实生产环节的快速演进。早期的视频生成更多用于展示模型能够“生成什么”,如今,模型开始被用于广告、短剧、影视等实际生产场景,并逐步承担提高内容可用率、缩短制作周期和降低生产成本的任务。以 Vidu Q1 为例,其推出的参考生视频能力,允许用户通过主体参考图生成角色和视觉元素相对一致的视频。此后,参考生视频逐渐成为行业中的重要产品范式,也让视频模型从随机生成工具,进一步走向可控制、可复用的生产工具。对于生数科技而言,这一过程也强化了一个判断:高质量视频基模不仅能够服务内容生产,其在大规模训练中形成的时空理解、动态预测和状态一致性能力,也可以继续迁移至更广泛的智能任务。解决数据之后,还需要一套能够统一组织这些能力的模型架构。目前,一些具身智能方案仍然采用分离式结构:感知模型负责识别环境,世界模型负责预测未来,策略模型负责输出动作。不同模块分别优化,容易带来信息割裂和误差累积。生数科技的思路,是通过 Mixture-of-Transformer(MoT)架构,将环境理解、世界状态预测和动作轨迹生成整合至统一框架。模型既可以在像素空间生成视频,也可以在动作空间输出机器人动作,还可以根据任务需要进行联合预测。基于这一架构,生数科技的三项产品分别承担不同层级的任务。世界生成模型 Vidu 支持文生视频、图生视频、参考生视频等创作方式,持续提升主体与场景一致性、运动表现、物理合理性、镜头控制及内容交互性,帮助创作者更加高效地完成高保真内容创作。实时交互模型 Vidu S1 进一步将外部输入纳入生成循环。用户可以在互动过程中持续发出语音指令,让角色实时改变表情、动作和行为。每一次输入都可能影响下一时刻的画面,模型不仅要生成内容,还要根据反馈持续更新状态。Vidu S1 支持无限时长连续生成,可实现 540P、25FPS 输出,最高支持 42FPS,并允许用户基于真人、动漫或萌宠形象及个性化音色创建交互角色。到了世界动作模型 Motubrain,模型的输出则从数字内容变为机器人可以执行的动作。Motubrain 定位于具身智能机器人的通用大脑,将环境理解、世界状态预测与动作轨迹生成统一建模。面对插花、浇水等任务,模型需要理解当前环境和任务目标,预测不同行动可能带来的结果,并生成机器人可以执行的动作轨迹。三款产品分别回答了三个递进的问题:能否生成一个持续变化的数字世界?能否让这个世界根据外部输入实时更新?能否将对世界的理解和预测转化为物理行动?它们不是三款产品的简单并列,也不是生数科技从视频生成突然转向机器人,而是同一套世界建模能力从生成、交互到行动的逐步延伸。从 Vidu Q1 建立参考生视频的生产范式,到 Vidu Q3 提升复杂音视频内容生成能力,再到 Vidu S1 和 Motubrain 分别走向实时交互与物理行动,生数科技试图建立的是一套能够同时服务高质量内容生产和具身智能落地的通用基础模型。04机器人之外,世界模型还有更大边界行业习惯将世界模型与机器人绑定,一个重要原因是机器人能够把预测转化为可见的物理结果。杯子是被成功拿起,还是被机械臂碰倒,结果一目了然。真实环境也会严格检验模型是否理解空间关系、接触关系和动作后果。但类似问题同样存在于数字内容中。角色上一镜拿起的杯子,下一镜是否还在;人物转身后,服装和背景是否合理变化;导演修改动作后,角色身份、空间关系和镜头节奏能否保持稳定。这里虽然没有机械臂,模型仍然需要维护一个持续变化的环境。两类任务的差异主要在于输出形式和风险等级。数字内容出错可以重新生成,机器人行动失误则可能造成现实损失。因此,物理世界对实时感知、控制精度、稳定性和安全性提出了更高要求。但世界模型所学习的内容,不应只由最终连接的是屏幕还是电机来定义。只要模型需要表示当前状态、预测未来变化,并根据外部输入更新环境或作出行动,世界建模能力就已经参与其中。机器人不是世界模型的唯一归宿,而是其中对感知、预测、决策和执行闭环要求更高的一种应用。05数字世界与物理世界如何形成互补生数科技同时布局数字世界和物理世界,不只是因为二者可以共享底层技术,还因为两条路线有可能在数据、反馈和能力验证上形成互补。数字世界的优势在于数据规模大、使用频率高、试错成本低。海量视频可以帮助模型学习物体运动、人物行为和环境变化;广告、短剧、影视和互动内容的生产,又能持续产生真实反馈,例如哪些结果被采用、哪些镜头频繁返工、角色一致性和动作表现在哪些场景下容易出错。物理世界则提供更精确的动作数据和更严格的因果检验。机器人必须遵守真实空间中的尺寸、接触、受力和运动约束。任务是否完成、物体是否被碰倒、动作是否安
分享
阅读原文 ↗