Daily Tech Briefing
AI 科技速览
每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。
InfoQ AI · 2026/7/27 11:43:50

昆仑万维押注世界模型的两大产业路径:内容创作实时、可交互,机器人先“预演”再行动
AI 中文解读
昆仑万维一口气发布三款世界模型,让AI不再只是“画图”,而是能记住过去、理解环境,并预测用户动作带来的变化。核心突破在于:AI开始像人类一样,在行动前先“脑补”后果。
通俗来说,以前的AI生成视频,只是凭空创造画面;而世界模型能记住你走过的路、碰过的物品,当你转动视角或按下按钮,它能实时算出环境该怎样变化。比如在游戏里,你推倒一堵墙,墙后的空间会立刻生成,而不是提前做好的固定场景。这种能力也让机器人更聪明——它先在虚拟世界里模拟走一遍,确认不会撞到障碍再真正行动。
这项技术将直接影响我们的日常。游戏体验会颠覆:开放世界不再需要几百人花几年手绘,而是由AI像“造梦师”一样实时搭建,每次探索都独一无二。音乐创作门槛骤降:过去做一首歌要砸几十万,现在普通人凭一个灵感就能生成旋律、歌词甚至MV,还能反复修改。影视导演也能用AI快速做出分镜草图,省下巨额预演成本。不过,AI并没有减轻创作者的判断责任,反而要求他们具备更全面的审美——从镜头到节奏,从情感到结构,每一个选择仍然需要人来把关。世界模型正在把“创造”变成一种像说话一样自然的能力。
近日,昆仑万维集中发布 Matrix-3.5 世界模型、Mureka V9.5 及 O3 音乐模型,以及面向机器人的 Riemann-1.0 具身世界模型。三款模型分别指向游戏和视频内容生成、音乐创作以及机器人决策,其背后的理念都是:AI 要开始理解环境状态、记住此前发生的事情,并预测不同动作将如何改变未来。昆仑万维董事长兼 CEO 方汉将 2026 年称为“世界模型元年”。在他看来,世界模型正在沿着两条路径进入产业:一条发生在虚拟世界,游戏、视频、音乐等内容生产将率先被实时生成和可交互技术改造;另一条则通向物理世界,机器人需要在真正行动之前,先对环境变化和动作后果进行内部推演。世界模型首先改造内容生产传统视频生成模型解决的是“生成什么画面”,世界模型需要进一步回答“如果用户做出某个动作,接下来会发生什么”。昆仑万维 Skywork 首席科学家成宇将世界模型概括为一种状态预测范式:模型接收当前环境、当前状态以及用户或智能体的动作,再生成下一时刻的环境变化。它与一次性生成图像或视频的区别,在于模型不仅需要保证单个画面的质量,还要维持长期状态、空间结构和前后因果关系。这种能力在游戏中尤其重要。传统开放世界游戏通常依靠大量美术、关卡、动画和程序人员,提前制作地图、人物、交互规则及任务内容。世界模型则提供了另一种可能:虚拟环境不必全部预制,而是可以根据玩家的移动、视角和操作实时生成,并在玩家返回此前区域时,继续保持建筑、物体和空间关系的一致性。方汉判断,游戏行业可能是最早被世界模型系统性改造的产业。过去,一个开放世界游戏往往需要数百人团队投入数年时间手工搭建;如果模型能够让场景随玩家行动持续生成和演化,未来世界模型有可能成为游戏行业新的基础设施。Matrix-3.5 正是沿着这一方向升级。三个月前,昆仑万维发布 Matrix-3.0,实现了在约 50 亿参数规模下生成 720P、可实时交互的场景。此次推出的 Matrix-3.5 进一步加强了长期记忆、空间一致性、动作控制和推理效率,重点面向游戏、互动内容及部分机器人仿真场景。从技术路径看,昆仑万维将 Matrix-3.5 的升级拆分为数据、模型和推理三个部分。在数据侧,团队不再完全依赖人工采集,而是引入游戏引擎、自动化智能体和数据处理工具,构建自动探索、自动录制、镜头切分、质量评分及标注流程。其数据来源包括虚幻引擎生成的虚拟环境、真实游戏运行画面以及互联网公开视频,最终形成约 1 万小时训练数据,覆盖约 1200 类游戏及虚拟场景。在模型侧,Matrix-3.5 将此前以完整视频帧为单位的记忆机制,进一步升级为基于空间信息的 Patch Memory。传统方案会直接检索历史画面,并把整帧内容重新输入模型,但当相机视角变化时,画面中的同一物体可能出现位置偏移,进而造成结构漂移。Matrix-3.5 尝试将场景拆解为带有深度、相机位置和空间坐标的三维局部信息,只提取与当前生成区域相关的部分,再注入模型。相比直接回看完整画面,这种方式更接近对空间结构的持续记忆,使模型在长时间生成中能够更稳定地保留建筑、道路、物体和环境布局。团队还对动态对象和静态场景进行了分离处理。人物、车辆等动态元素可以持续变化,但建筑、地形和房间结构需要保持稳定。将两者拆开建模,有助于减少长时间交互中的场景重构和物体漂移。在推理侧,昆仑万维通过蒸馏、量化、采样优化及模型结构加速,将大型教师模型的生成能力迁移到更轻量的学生模型,目标是在较小参数规模和有限硬件条件下维持实时生成。成宇认为,世界模型从研究走向产业,最大的分界线并不只是画面质量,而是能否实时运行。传统视频模型可以等待几十秒甚至几分钟生成一段内容,但交互式游戏和机器人无法接受这样的延迟。用户按下一个按键、改变一个方向或者让机器人完成某个动作,模型必须迅速给出反馈。Reactor Technologies 联合创始人 Alberto Taiuti 也强调,世界模型不能继续完全建立在为大模型和离线媒体生成设计的基础设施上。大模型通常以请求和响应的形式工作,图像、视频模型也以批处理方式生成一次性资产;世界模型则需要持续接收双向数据,保存状态,并以低延迟不断输出下一帧环境。在他看来,实时、持续、有状态、可交互和具备因果连续性,是世界模型区别于传统生成模型的核心特征。这意味着行业不仅需要新的模型架构,也需要专门为世界模型设计的推理和服务平台。Alberto 认为,世界模型的意义也不只在游戏和视频。随着模型能够同时生成画面、声音、交互规则和状态变化,它最终可能推动“生成式软件”出现。未来的应用程序不一定由开发者预先写好每个界面和逻辑,而可能由世界模型根据用户需求动态生成完整体验。AI 并没有减少创作者做判断的责任除了 Matrix-3.5,昆仑万维还发布了 Mureka V9.5 和 Mureka O3 音乐模型,并展示了从灵感、歌词、歌曲到音乐视频的完整创作流程。昆仑万维认为,AI 音乐正在从技术演示走向大众创作工具。过去很多音乐生成模型能够输出旋律完整、节奏规整的歌曲,但作品常被认为过于平均化,缺少停顿、留白、呼吸和情绪起伏。Mureka V9.5 的升级重点,是降低这种“模型感”,增加音乐的真实感和情绪变化。成宇介绍称,Mureka V9.5 并没有只围绕传统自动评测指标优化,而是更加重视人对音乐真实感的主观判断,包括旋律、人声、音质、结构、停顿和情感表达。Mureka O3 则在此基础上引入更强的推理和反思机制,让模型在生成过程中反复检查歌曲结构、用户要求和局部表现,并根据结果进行调整。与早期“一句话生成一首歌”的产品不同,昆仑万维正在把 Mureka 改造成一个可编辑、可迭代的创作系统。用户可以从一个模糊主题开始,让模型辅助生成歌词、确定风格、构建歌曲,再针对人声、节奏、段落和情绪进行调整,最终还可以把音乐与图像、视频结合,生成相应的 MV 内容。方汉认为,AI 音乐的意义并不是替代音乐人,而是把音乐创作从少数人的专业能力,变成更多人的表达工具。他表示,传统歌曲的完整制作成本可能达到 20 万元甚至 100 万元,而通过 AI 模型生成歌曲,边际成本可以降至非常低的水平。这一变化已经开始影响影视和内容产业的生产流程。在发布现场,演员王珞丹分享了自己使用 AI 制作短片的经历。她从剧本、分镜到人物资产均参与设计,但为了获得符合预期的镜头,仍需要不断调整提示词和反复生成。在她看来,AI 并没有减少创作者做判断的责任,反而要求创作者具备更综合的审美。过去,演员、摄影、美术、剪辑和导演分别承担不同工作;当一个人使用 AI 独立制作短片时,需要同时理解镜头、空间、人物、节奏和视觉风格。模型可以提供意料之外的运镜和画面,但创作者仍然需要决定哪些结果能够进入作品。青年导演崔睿认为,AI 目前对影视行业最直接的价值,首先体现在工作流程和前期视觉化环节。过去,导演需要手绘故事板,或由专业团队制作预演内容,这会消耗大量时间和资金。现在,导演可以通过 AI 快速生成镜头草图,用于和摄影、美术及制作团队沟通。在后期环节,AI 也可以补充实际拍摄中缺失的镜头。例如,当剧组因为天气或时间限制无法完成某个特写或视角时,可以利用已有素材生成补充画面。崔睿称,部分 AI 生成镜头已经很难与实拍素材区分。不过,他并不认为 AI 会直接替代导演。即使一部作品由模型生成,模型仍然需要有人决定题材、人物、镜头、节奏和情绪。导演的核心工作不是执行某项技术,而是在每个环节做出创作决策。演员黄晓明也提到,AI 可以帮助影视项目实现过去由于预算和技术限制难以完成的大场面。他透露,其团队正在推动一个科幻题材 IP 的影视化,希望将真人拍摄与 AI 特效结合,把小说中难以实拍的环境和动作呈现出来。他认为,AI 创作已是不可逆趋势,影视从业者应主动学习、拥抱并使用 AI,以降低制作成本、实现过去难以拍摄的场景。但他也强调,AI 作品仍需要人的审美、情感和判断来主导,真人演员基于人生经验产生的即兴反应与独特表演难以被模型复制。在黄晓明看来,AI 对影视行业的影响并非单纯取代,而是与行业降本需求同时发生。当长视频和电影行业面临成本压力时,AI 提供了重新组织制作流程的机会。但他同时强调,AI 生成内容应当明确标识,演员形象、声音和表演也需要建立授权及版权机制。从平台侧看,AI 内容供给已经开始快速增长。爱奇艺高级副总裁杨海涛透露,平台近期每天可以收到约 3000 部创作者上传的 AI 作品和上千部 AI 漫画。这些内容正在分流一部分真人影视作品的观看时间,但目前尚未形成稳定的用户偏好规律。据悉,爱奇艺已经在创意、剧本、拍摄、剪辑和后期等环节建设 AI 工作流,其专业影视制作平台已有超过 2 万名创作者使用,服务超过 200 个影视项目。杨海涛以网络电影《勿念》为例称,AI 在镜头剪辑等环节带来的效率提升超过 50%。这表明,AI 对内容产业的首轮影响,很可能不是立刻生成一部完整电影,而是先进入每个细小环节:生成分镜、制作概念图、补充镜头、完成特效、辅助配乐、优化剪辑,再逐渐形成端到端工作流。方汉也承认,现阶段模型在可控性和易用性方面仍有明显不足。大规模爆炸、战争、追逐等高复杂度场景,反而可能是 AI 更容易产生价值的部分,因为传统制作成本高,而观众对局部细节错误的敏感度较低。真正困难的是日常环境、人物微表情和小众场景,因为训练数据不足,模型容易把人脸和表演平均化,产生缺少真实缺陷的“塑料感”。因此,世界模型进入创作产业,并不意味着内容可以完全自动生成,它更可能是先改变生产成本和角色边界。世界模型走出屏幕:让机器人同时预测动作与未来画面相比游戏、
分享
阅读原文 ↗