Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

thu-ml

DiT-Extrapolation

820+0/dayPython去 GitHub
分享
AI 中文解读
想制作超长视频或高清图像,却总被模型“长度限制”卡脖子?清华团队开源的DiT-Extrapolation项目,像是给视频生成模型打了个“补丁”,让它能轻松处理超出训练长度的内容,并且完全不收费!这个项目一口气端出了三份成果:RIFLEx(已入选ICML 2025)专门解决视频扩散Transformer的长度外推问题,UltraViCo(入选ICLR 2026)进一步把长视频生成能力升级,UltraImage则把同样的思路用在图像生成上,让Flux、Qwen-Image等模型也能直接产出超高分辨率图片。最妙的是,这三个方法全部是即插即用——你不用重新训练模型,只需要在推理时替换几行代码,就能让HunyuanVideo、CogVideoX、Wan2.1等主流工具“长出”更长的视频尾巴。 技术上的魔法在于它发现了“位置编码”的局限。传统扩散Transformer在训练时见过的序列长度有限,超长时位置表示会失真。RIFLEx通过巧妙的插值策略,让模型在推理时自动适配任意长度,相当于给位置编码加了“自适应缩放”,算力开销几乎为零(论文标题里就叫“Free Lunch”)。UltraViCo则在此基础上引入分块策略,把长视频切成重叠片段再融合,保证了画面连续不跳帧。而UltraImage直接用类似思路,让图像生成模型突破分辨率天花板。 说人话就是:以前你想让AI生成一段10秒的视频,它可能只能稳定产5秒,后面就开始“胡编乱造”;现在装上这个扩展包,同样一个模型能稳定输出更长的时间,甚至画面质量还能保持。对于做短视频、游戏特效、影视预演的团队来说,等于白捡一个“免费升级包”。新手也不用慌——项目代码完全开源,分成多个分支(RIFLEx、UltraViCo、UltraImage各有一个分支),依赖主流框架(diffusers、HuggingFace),懂点Python、会用命令行就能跑。你只需要下载预训练模型,再运行几行推理脚本,就能立刻体验到长视频生成的效果。社区已给出详细教程和Demo,连显卡配置要求都贴出来了,基本上RTX 3090级别的卡就能玩转,门槛真不算高。想低成本提升视频生成长度的朋友,这个仓库值得直接官网加星。
Official implementation for "RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers" (ICML 2025) , UltraViCo (ICLR 2026) and UltraImage