Daily Tech Briefing
AI 科技速览
每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。
雷锋网 · 2026/7/31 11:58:00
比 Seedance 便宜七成的模型,宣布开源:视频生成行业变天了?
AI 中文解读
MiniMax今天甩出了一张王牌:视频旗舰模型H3正式发布,效果对标字节的Seedance 2.0,价格却只有人家的三分之一,而且马上要开源了。这是全球第一个达到这个水平的开源视频模型,相当于把“顶级制作能力”直接免费分发到所有人手里。
这款H3最大的特点是“全能”。以前要做一条像样的视频,得分别找AI生成画面、另找工具配音、再手动加字幕,最后还要剪辑拼装。H3把这些活全包了,你只需要用文字描述创意,它就能一次性产出画面、声音、文字都配好的完整视频片段,连换人、换背景、改台词这些精细操作都能直接编辑。
对普通人来说,最大的变化是视频创作门槛被彻底拉平。过去做广告、短剧片头、产品演示这些专业活,可能要一个团队花几天时间,未来一个人用H3可能几小时就搞定了。结合三分之一的价格,中小商家、自媒体创作者都能用上顶级视频工具,视频生成行业很可能像当年Stable Diffusion改变图像生成一样,迎来一次生态大爆发。
第一次,效果对标 Seedance 2.0 的视频旗舰模型交到了所有人手里。 作者丨吴海明 编辑丨李 娜 马晓宁 今天,MiniMax 发布了视频旗舰模型 H3。在模型效果得到一众创作者认可之余,引人注意的是价格:H3 的价格仅为 Seedance 2.0 的三分之一。更关键的是:即将开源了。这是第一个做到这个水平的开源视频模型。接下来的事,可能会改变整个行业的游戏规则。当一个旗舰能力的视频模型开始开放,视频生成会不会复制 Stable Diffusion 曾经在图像生成领域掀起的生态扩散?而 MiniMax,又能否借此在视频生成赛道中,走出一条不同的路?下面,我们从模型能力、行业位置和开源意义三个层面,拆解 H3 为什么值得关注。01AA 榜单:MiniMax H3 反超 Omni、SeedanceH3 的重点不仅是视频模型,而且是通用多模态。H3 把文本、图片、音频、视频等素材纳入同一个上下文,由模型统一理解创作意图,并在此基础上完成从脚本理解、分镜生成、角色与场景保持、动作迁移、音画同步,到字幕、品牌文字、转场包装和局部编辑等一系列任务,最终一次性生成更接近商业成片的视频内容。Artificial Analysis 最新榜单截图在 Artificial Analysis 最新的视频编辑排行榜单中,MiniMax H3 以 1130 Elo 排名第一,领先 Google Gemini Omni、字节 Seedance 2.0等模型。榜单排名证明了 H3 的效果水平,但真正决定其商业价值的是它能否进入真实的商业应用场景。相比单纯生成画面,H3 更强调编辑、文字、声音和素材参考的一体化能力。经过实测,其差异化能力可以体现在下面三个方面:1.全模态精准编辑。H3 支持在已有视频上进行换人、换物、换背景、绿幕合成、改台词、调光影和视频续写等操作。2.复杂文本的保持与视觉融合。视频中的文字需要在连续帧中保持稳定,不能变形或漂移。H3 在电影片头字幕、产品 UI 文字、动态海报排版等场景中极具优势。3.一站式成片。H3 将画面生成、声音生成、文字呈现和镜头节奏整合在同一模型中,让用户无需依赖额外后期处理流程即可获得交付所需的完整视频片段。Prompt:两位魔术师站在舞台上面向观众表演互换魔术:两人同时挥动魔杖,一阵烟雾升起。烟雾散去后,两人的西装颜色互换——左边的人穿白色西装,右边的人现在穿黑色西装,但两人手套颜色不变。两人鞠躬致谢,身后的红色幕布拉上,从深红色渐变为深蓝色。H3(上)抽卡成功率非常高,Seedance(下)略逊一筹。此外,H3 的价格仅为 Seedance 2.0 的 1/3,H3 的竞争力并不只体现在模型效果上,也体现在性价比上。对于需要高频生成和快速迭代的商业场景而言,其商业化吸引力有望进一步放大。整体来看,H3 的看点是 MiniMax 试图把视频生成、音频生成、素材参考和视频编辑等特定任务统一到一个模型框架中。02H3 如何统一多个模态的创作链路,还能保持模型泛化?根据 MiniMax 官方公众号分享,H3 的技术目标是实现任务的统一和泛化。多模态模型面临多种能力要求:图像生成中有文生图、图像编辑、主体参考等任务;声音生成中有人声、音效、音乐等不同模型;视频生成则进一步细分为文生视频、图生视频、视频编辑、动作参考等能力。H3 生成的技术路线图与现有多模态生成模型由多个专家模型组成不同,H3 以语言作为泛化的桥梁,将这些能力纳入同一个预训练范式:文生视频可以同时生成画面和音频,声音不再区分人声、音效和音乐,参考与编辑关系也通过自然语言描述,不用依赖固定功能入口,并构建四项核心技术:1.Contextual Omni Representation:增强多模态 Caption 能力,使模型在描述目标视频的同时,还能理解素材之间、素材与目标视频之间,以及画面与声音之间的关系。2.H3-VAE:升级视频 tokenizer,在重建质量和压缩效率上提升。官方称其带来 4 倍序列长度收益,是 H3 支持原生 2K 输出的关键。3.H3-Omni Transformer:采用理解与生成异构的训练架构,并通过样本间负载均衡,将端到端训练吞吐提升近 30%。4.In-context Regeneration:与传统专用超分模块不同,H3 让基模基于低分辨率结果和上下文信息重新生成 2K 细节,以提升小文字、纹理和画面细节的还原能力。03H3 卡在了行业的什么位置?要理解 H3 的位置,得先回顾一下视觉内容生产工具这些年的演进历程。过去十多年,视觉生产经历了从专业软件、AI 辅助工具、图像生成模型,再到视频生成模型的连续跃迁。H3 所处的节点,正是视频模型从素材生成走向商业级成片级交付的关键阶段。在生成式 AI 出现之前,视觉内容生产主要依赖专业软件完成。修图靠 Photoshop,动效包装靠 After Effects,剪辑靠 Premiere,调色靠 DaVinci Resolve,导致一条十几秒的广告短片,往往需要设计、剪辑、后期、动画师等多个角色协同完成。在这一时期,虽然专业软件提供了足够强的创作能力,但也抬高了内容生产的技术门槛和协作成本,导致视频的制作成本极其昂贵。紧接着,在 2016 年前后 AI 开始以辅助工具的形态进入这条生产流水线。自动抠图、智能修图、视频补帧、内容识别填充等功能逐渐普及,帮助创作者减少重复劳动。但在这一阶段,AI 工具更多是嵌入既有软件体系中的效率插件,承担辅助工作。2021 到 2023 年,Midjourney、Stable Diffusion让AI内容生成成为现实,其中 Stable Diffusion 的开源尤其关键,围绕开源模型催生出了LoRA、ControlNet、ComfyUI等完整生态,形成了“开发者做插件,创作者搭工作流,企业训行业模型,云厂商做推理优化”的新型产业格局。由此证明了一件事:一个足够强的开源模型,往往会成为整个生态的底座。早期视频模型只能生成几秒钟片段,人物容易变形,物体边界闪烁,动作连续性差,更像会动的图片。2023 年下半年之后,Runway、Pika、可灵、海螺、Vidu 等产品把 AI 视频从几秒 Demo推向可用素材:分辨率提升,时长变长,运动稳定性也更好。越来越多的社媒短片、电商素材、广告创意开始真正使用 AI 生成内容。但这一阶段的大部分视频模型仍然停留在素材级。创作者可以用模型生成一段画面,但要变成能交付的广告、短剧片头、游戏预告或产品视频,还需要回到剪映、Premiere、After Effects 里做剪辑、包装、字幕、调色、合成和音效。这也是为什么 2024 年之后,视频模型的竞争标准发生了变化,行业开始看谁更接近真实生产流程。OpenAI 的 Sora 曾经被视为视频生成赛道正式进入加速期的标志性事件,Google Veo 系列继续以高画质、原生音频和复杂场景生成维持质量标杆,字节 Seedance 则把视频模型推向更高可用性,尤其在镜头一致性、动作表现和商业素材生成上获得大量关注。一些创作者已经开始用 Seedance 替代部分实拍环节,尤其是在广告创意预演、短片概念片、电商展示和社交媒体素材中。已经开始替代一部分为了验证创意而拍的低成本实拍需求。过去线性的视频生产流程正在被 AI 模型压缩:从素材生成、剪辑包装到调色配音,越来越多原本需要后期完成的执行环节,开始被模型直接吸收进生成过程。创作者仍负责节奏、审美和商业判断,但单位内容的生产成本、交付周期和试错速度正在被改写,而 H3 正是卡在这一转折点上。H3 的设计明显是冲着真实生产场景去的,是冲着商业级成片交付去的。这些任务考验的更多是商业视频生产中最核心的几件事:文字能不能保持稳定,品牌信息能不能准确出现,镜头之间有没有节奏,声音和画面能不能同步,包装是不是像一个完整交付物,而不是一段孤立素材。比如,H3 把一部分后期包装能力前置到模型内部,实现了AI原生后期。在海外开发者 @hasantoxr 的测试中,H3 可以给实拍视频增加手绘发光动画,通过自然语言描述即可指挥动画路线,可以并匹配场景光线同时保留真实光影关系。过去,这类工作通常属于 Adobe AE 和人工后期的领地;视频模型更多只是提供原始素材,再由创作者拿回后期软件精修。如果 H3 的这些能力能够在真实工作流中稳定复现,那 H3 代表的将多模态模型发展历程上的一次新的突破:从生成素材,进一步走向理解内容、执行包装、完成编辑和接近交付。这也是 H3 在行业中的真正位置:它处在视频模型从文娱工具转向工业生产力工具的拐点上。过去 AI 视频的主要价值是能不能生成,现在工业界真正关心的是能不能交付,H3 要回答的,正是后一个问题。04开放最新视频旗舰,H3想改变什么?如果说 H3 的商业级成片交付能力是“本分”,那么开源才是它真正试图撬动行业格局的地方:MiniMax 不仅是把一款视频旗舰模型推向市场,还把它交给开发者、企业和创作工具链共同改造。在大模型行业,开源并不罕见,但在视频生成领域,真正具备头部能力的模型开放权重,仍是少数事件。原因在于,视频模型的训练成本、推理成本、数据组织和工程复杂度都远高于文本与图像模型,越接近旗舰能力,模型厂商越倾向于用闭源产品和 API 回收成本。此前,视频生成的开源阵营中,阿里万相、腾讯混元视频、
分享
阅读原文 ↗