Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
量子位 · 2026/8/5 07:05:41
114B参数、6B激活,Sand.ai刚刚开源全球首个千亿MoE视频生成模型

114B参数、6B激活,Sand.ai刚刚开源全球首个千亿MoE视频生成模型

AI 中文解读
Sand.ai今天放了个大招,开源了全球首个千亿参数的视频生成模型MAGI-2-preview,参数高达114B但每次只激活6B,生成10秒1080P视频成本仅5毛钱,只有行业主流模型的十分之一。这相当于用一辆小排量汽车的油耗,跑出了超跑的加速度,直接把视频生成的"不可能三角"——大模型、长视频、低成本——给解开了。 通俗点说,以前视频生成模型要么效果一般,要么烧钱烧得肉疼,而Sand.ai用MoE架构把模型容量和实际计算量解耦,就像一个大公司平时只让少数精英干活,效率高还省钱。更厉害的是,他们从底层重构了架构,让文本、视频、音频从一开始就协同工作,画面和声音的配合更自然,运镜、对焦、人物表现都能和闭源第一梯队掰手腕。 对普通人来说,这意味着以后AI做视频的门槛和成本会大幅下降,无论是做短视频、AI漫剧还是商业广告,都能用更便宜的价格拿到高质量成品。千亿级开源模型的出现,也会倒逼整个行业提速,未来我们看到的AI生成内容会越来越像"真电影"。
首页 资讯 智能车 智库 活动 MEET大会 AIGC 扫码关注量子位 // $('.biaojiwei').click(function(){ $('.biaojiwei').click(function(event){ event.stopPropagation(); $('#pophead').show(); }) $('.weixin_pop').click(function(){ $('.weixin_pop').hide(); }) // }) < img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 114B参数、6B激活,Sand.ai刚刚开源全球首个千亿MoE视频生成模型 鹭羽 2026-08-05 15:05:41 来源:量子位 10秒1080P,成本只要5毛钱 鹭羽 发自 凹非寺 量子位 | 公众号 QbitAI 再牛的大模型,也要放到行业面前公开露个面,才算真交卷。 现下,就有这样一支清华系团队再展锋芒,规模不大、实力却不小—— 抢先用MoE架构把视频生成模型卷上千亿参数,代码权重还全!开!源! 模型一出,直接刷屏国内外科技圈。那么大,那么强,说开源就开源。 且先来看看生成效果一探究竟: 视频链接:https://mp.weixin.qq.com/s/Wtw4Ui4whdGEQ8vyWQ3Ipg 如何?最近爆火的AI漫剧,声台形表四角俱全。 亦或是来一场酣畅淋漓的长镜头,视角跟随人物动作切换自如。 视频链接:https://mp.weixin.qq.com/s/Wtw4Ui4whdGEQ8vyWQ3Ipg 闹归闹,商业场景也不在话下。 视频链接:https://mp.weixin.qq.com/s/Wtw4Ui4whdGEQ8vyWQ3Ipg 光这运镜、对焦和人物表现,拉出去和闭源第一梯队同台PK,也照样能打。 不卖关子了,这便是Sand.ai的最新力作——MAGI-2-preview。继Magi-1横空出世后,新模型又一次瞄准开源C位。 模型总参数114B,单次前向只激活约6B。 按8卡H100当下的行情算,要生成一段10秒1080P视频,其成本仅需5毛钱,差不多只有行业主流模型的十分之一。 Benchmark排名也相当亮眼,MAGI-2-preview在AA视频生成榜单排名第六。仅用6B激活参数,效果就已经非常接近第一梯队。 好好好,这下视频生成行业,又多了一个千亿级新变量。 视频模型Scaling不能照抄LLM 这一变,直击视频生成模型的Scaling路线。 其实这个问题现在看来挺刚需的,做大模型,最怕的事情就是钱不够烧。 文本模型倒还好,处理的都是离散token,叠参数、加算力,模型就能越滚越强。但视频模型呢?面对的却是一整个动态世界。 每一帧画面都要被拆成大量空间patch,连续帧还要记录人物动作、物体关系和镜头变化。如果再叠加文本、音频等信息,序列长度直接超级加倍…… 如果还用稠密模型,Scaling的训推成本简直想都不敢想。 模型要更大、视频要更长、成本还要可承受,这三件事就是摆在视频生成面前的近乎「不可能三角」。 图片由AI生成 当然,解法不是没有——MoE。 所谓MoE,就是把模型容量和单次计算部分解耦。模型可以继续拥有百亿千亿的总容量,但每次推理只激活其中一小部分,成本相对可控。 但视频MoE也有自己的麻烦,首先卡住的是通信。 传统专家并行会先为token选出Top-K专家,再把token送到专家所在的GPU。换言之,只要激活专家数越多,需要运输的数据就越多。 对于本就拥有超长序列的视频模型,这部分通信成本很快就会盖过专家计算本身。 更别提训练稳定性,动态变化的路由、随时波动的专家负载,以及需要处理的多模态数据,都会让大模型Scaling过程中常见的问题,在视频MoE上成倍放大。 因此视频生成的Scaling路径,跟大语言模型不完全是一回事。 单纯迁移MoE不管用,还要扛得住超长序列和跨卡通信,同时保证音频、视频、文本在同一套系统里顺畅协作。 说白了,得从底层开始一点点重构。 行业里很少有人能做到。要说将视频MoE从纸上谈兵搬到千亿参数视频模型上,Sand.ai是第一个。 让千亿MoE模型真正跑起来 要想跑通,架构和系统缺一不可。 先打地基,MAGI-2-preview延续了Sand.ai在daVinci-MagiHuman中验证过的单流架构—— 文本、视频和音频进入同一个Transformer,然后在每一层自注意力里直接交换信息。 传统做法里,是视频走视频的,音频走音频的,最后再靠cross-attention(交叉注意力)把两边粘起来。 而MAGI-2-preview是从第一层开始,画面和声音就在共同建模,从而更适合处理细微的音画对应关系,效果be like: 视频链接:https://mp.weixin.qq.com/s/Wtw4Ui4whdGEQ8vyWQ3Ipg 这样设计还另有额外的好处,统一主干能够让延迟和维护成本比模型串联低得多,也更天然适配MoE扩展。 有了框架,再把专家颗粒度推到极致。 MAGI-2-preview采用Multi-Head LatentMoE的思路,将3072维的隐藏表示拆成12个256维head,再让每个head独立路由。 同一个token由此被拆进多个低维子空间,有的head更关注人物外观,有的处理动作和时序,各司其职。 于是在36层主体网络里,每层总共3072个独立专家单元,每个token在每个head内选择6个专家,合计激活72个小专家。 看起来同时调用的专家变多了,但每个专家处理的子空间尺寸更小,分工更细,模型能够拼凑出更多能力组合。 作为参照,DeepSeek-V4-Pro等主流MoE大模型的每层专家数大多还停留在几百个,MAGI-2-preview直接推到了三千级别。 这么细的专家,单靠通用MoE是实现不了的,还需要一套完整的自研infra。 Sand.ai自己写了MagiMoE kernel库,把路由、排序、专家计算整条链路压在一起,减少中间结果的显存搬运。 还针对Multi-Head MoE的计算形态,前向和反向过程都做了专门优化。 并行策略也重新设计了。 Head Parallel在路由发生之前就按head把计算分配到不同设备,设备间传输的是形状固定的head表示,而不是路由后数量不断变化的专家token。 通信量不随激活专家数波动,视频的长序列就不再是要命的瓶颈。 优化器同样做了混合设计。矩阵参数用Muon,专家参数用AdamW,不同性质的参数用不同的更新节奏。 最后一环是数据。 很多团队做数据是层层过滤,最后留一个干净但窄的数据集。 但生成模型需要的恰恰相反,要的就是多样性,见得越多,生成才能越逼真。 MAGI-2-preview的思路是从「删减」转向「组织」。 先扩大有效数据的规模,尽量保留广度,再通过更精准的标注把数据组织起来,让模型依次学会不同场景、动作、声音之间的对应关系。 预训练和后训练的分工也随之变化。 预训练负责尽可能完整地覆盖数据分布,让基础模型吃全,后训练则回到自己更擅长的部分,处理偏好对齐、可控性、安全性和产品适配。 视频链接:https://mp.weixin.qq.com/s/Wtw4Ui4whdGEQ8vyWQ3Ipg 至此,MAGI-2-preview得以跑通一整套Scaling系统。 通过模型结构、通信机制、底层infra和数据体系协同设计,在扩大总容量的同时,把单次激活参数控制在可执行范围内。 当然,这里的6B激活参数并不等于一款6B稠密模型的实际成本,专家通信、路由、显存和部署方式仍会产生额外开销。 但作为一款开源的千亿级视频模型,效果已然next level~ 尤其是开源,其带来的变化,要比想象中大得多。 开源不只是「秀肌肉」 过去开源的视频模型大多都是百亿级,千亿参数直接改变的是整
分享
阅读原文