Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

thu-ml

DiT-Extrapolation

825+0/dayPython去 GitHub
分享
AI 中文解读
这个项目来自清华大学的机器学习团队,一口气解决了视频生成和图像生成领域最让人头疼的“长度限制”问题。简单说,现在主流的视频生成模型,比如HunyuanVideo、CogVideoX、Wan2.1这些,训练时固定生成几秒钟的视频,一旦你想让它生成更长的视频,画面就会崩坏,出现重复、模糊或者动作不连贯的问题。DiT-Extrapolation这个项目就是专门来打破这个天花板的。 项目里包含三个核心方法,都是即插即用的插件式方案。第一个是RIFLEx,它拿到了ICML 2025的录用,主打“零成本”实现长度外推,不需要重新训练模型,直接改一下推理方式,就能让现有的视频扩散模型生成比训练时长更长的视频,而且画质不掉线。第二个是UltraViCo,已经被ICLR 2026接收,它更进一步,针对长视频生成做了优化,让生成的长视频在时间连贯性和动态表现上更自然。第三个是UltraImage,专门用来做高分辨率图像生成,解决了扩散模型在生成超大尺寸图片时容易出现的结构崩坏问题。 这个项目的最大亮点是兼容性极强。它没有绑定某一家模型,而是把主流开源视频和图像生成模型都适配了一遍,比如HunyuanVideo、CogVideoX、Wan2.1、Flux、Qwen-Image等,开发者可以直接在现有模型上接入这些方法,不用从头训练,省时省力。而且代码完全开源,还分了不同的分支,比如单GPU推理和多GPU并行推理都有对应的版本。 适合谁用呢?如果你在做AI视频创作工具、短视频生成应用,或者需要批量生成高质量长视频素材,这个项目能帮你直接提升生成能力,不用等下一代更大的模型。对于研究扩散模型、Transformer架构的算法工程师来说,这也是一个很好的学习范本,可以看到如何通过改进位置编码和注意力机制来突破序列长度限制。 上手难度方面,项目提供了基于diffusers的示例代码,如果你用过HuggingFace的diffusers库,基本能直接跑通。需要一定的Python基础和对扩散模型的基本了解,但不需要从零训练模型,门槛不算高。建议从RIFLEx的main分支开始尝试,它最轻量,效果立竿见影。
Official implementation for "RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers" (ICML 2025) , UltraViCo (ICLR 2026) and UltraImage