Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

PKU-YuanGroup

ConsisID

845+0/dayPython去 GitHub
分享
AI 中文解读
北大和腾讯联合出品的ConsisID项目,刚刚在CVPR 2025上拿下了Highlight,绝对是当前身份保持视频生成领域的一匹黑马!简单说,你给它一张人物照片和一段文字描述,比如“一位男士在沙滩上戴着墨镜微笑”,它就能生成一个视频,视频里的人物长相和你给的照片完全一致,动作、表情还跟文字描述严丝合缝。这解决了现有视频生成中“换脸不换人”的痛点——以前很多模型生成的角色总是“千人一面”,或者一转身就变成另一张脸,而ConsisID通过频率分解技术,把身份信息(比如五官轮廓这种低频特征)和动作细节(比如眨眼、嘴唇运动这种高频特征)分开处理,再巧妙融合,从而稳定保持人物身份。 技术上它有两把刷子:一是设计了双分支架构,一个分支专门负责提取和保持人脸的身份特征,另一个分支负责生成与文字匹配的动作和场景,两个分支通过频率域交互,避免身份信息被干扰;二是采用了渐进式训练策略,先用大量数据让模型学会保持身份,再微调出流畅的动作。这让生成的视频不仅身份一致性强,而且动作自然、风格多变。 这个项目能用在很多地方:影视行业可以快速生成数字替身、虚拟主播;广告营销可以批量制作带固定人物的宣传视频;个人创作者也能用它做故事短片、表情包。更棒的是,它开源免费,Apache 2.0协议,个人和商业都能用。上手门槛很低:官方提供了Hugging Face在线体验空间,点开就能玩;也有Colab笔记本,一键运行;如果你熟悉Python和PyTorch,按GitHub上的文档下载预训练模型,几行代码就能跑通。新手完全可以在线试玩,高级玩家也能深度二次开发。整体来看,ConsisID把身份保持视频生成的门槛降到了新低,而且效果惊艳,值得每一个对AI视频创作感兴趣的人关注。
[CVPR 2025 Highlight🔥] Identity-Preserving Text-to-Video Generation by Frequency Decomposition