Daily Tech Briefing
AI 科技速览
每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。
36氪 AI · 2026/8/3 08:12:09
可灵观察②|用可灵重现《霸王别姬》:电影感足了,复杂叙事如何更稳?
AI 中文解读
可灵AI视频生成工具迎来最新实战评测,这次直接挑战经典题材《霸王别姬》。核心结论很明确:可灵3.0拍“单张精彩画面”堪称惊艳,但想让它独立导演整部短片,还得靠人类把故事拆碎成一个个小片段。好比让AI画一帧精美的电影海报,它绝对靠谱;但让它一口气演完整场戏,就常常出乱子。不过,它在画面构图、光影质感和人物脸部一致性方面确实表现出色,能做出一眼就有“电影味”的镜头。这意味着,以后普通人想拍点有质感的短视频,门槛大大降低了。你只需要构思好分镜,让AI生成出彩的关键画面,再自己动手剪辑组合,就能做出比以往精致得多的作品。但也要明白,AI目前还只是个得力的“摄影师”,导演和编剧的统筹思维,依然得靠人脑来负责。
其中高质量画面、电影感镜头、广告和商业短片是用户提及率最高的应用场景。
这次,我们进一步展开测试:如果可灵最被期待的是电影感,它能否支撑包含人物、动作和情绪的完整短片创作?
围绕“霸王别姬”主题,我们原创了测试脚本《霸王别姬·前世今生》,使用可灵3.0的首尾帧图生视频与主体绑定功能,完成了一轮压力测试。本次测试围绕人物一致性、构图与空间层次、光影与氛围塑造、动作与运镜设计四大维度展开,既保留了完成度较高的镜头,也完整记录了复杂任务中的试错过程。
先说核心结论:可灵3.0更适合关键镜头的创作。
模型在构图、光影、情绪氛围和人物主体一致性上表现突出,针对目标明确的短动作镜头,可以稳定产出高质量画面。若需用可灵处理复杂叙事影片,更稳妥的思路是把长动作拆成单目标的短镜头,再通过分镜设计与后期剪辑串联为完整段落。
当任务同时涉及跨空间移动、多道具与多人物打斗场景时,最终画面效果高度依赖提示词、参考图、镜头时长和拆分方法。
这次压力测试,目的是找到更稳定的创作方法,而非对模型能力下定论。
【图1|本次测试使用的参考图】
标题
电影感,率先在关键镜头中落地
从测试结果来看,可灵3.0的核心优势集中在关键镜头的画面完整度。
当镜头目标明确、人物关系简洁、动作时长较短时,模型能生成高质量画面。光影、构图、人物和情绪氛围均表现亮眼。
例如戏子镜前准备的画面,最能直观体现可灵的画面表现力。
【图2|戏子镜前准备】
这个画面可灵并非只进行了简单的动态化处理,镜框把人物限定在视觉中心,左侧珠串和戏服形成前景,人物与铜镜置于中景,后台走廊与暖光充当远景,形成标准的前中后三层纵深结构。
画面摆脱了平面感,呈现出鲜明的电影空间质感。
可灵在这类镜头里的核心价值,在于一次性生成构图、光线和人物状态完整的视觉画面。
这也侧面印证了第一篇测评中,用户普遍将可灵与“电影感”“高质感镜头”绑定的核心原因。
标题
短动作镜头,可稳定输出高质量动态效果
电影感并非仅来源于静态构图。可灵同样能完成具备冲击力的电影感动态镜头。
项羽在战场打斗的场景,我们经多轮测试,得到了一版完成度较高的短镜头。
 
【视频1|项羽突围画面】
画面重点:短时间内人物气势、战场压迫感和动作方向的合理性。
该片段中,项羽的突围路线清晰,人物动态传递出杀伐张力。黄沙战地、兵器交锋、人体倒地和尘土弥漫的效果,共同构建出混战中的压迫感。
让可灵在生成长镜头动作画面时,核心前提在于有明确的目标镜头,只承载一个主要的动作,目标越清晰,输出的结果稳定性越高。
标题
氛围塑造和人物一致性:为叙事提供锚点
1. 氛围塑造方面
项羽乌江自刎前后的情绪镜头,是本轮测试中另一组完成度较高的素材。
 
【视频2|项羽乌江自刎】
画面重点:光影和暗部细节。
这段画面的整体亮度偏低,项羽近景镜头里,剑身呈现微弱反光,冷灰天光搭配脸上的泥土、血污和泪痕,共同烘托出英雄末路的悲壮情绪。
2. 人物一致性方面
主体绑定主体的能力也为成片提供了支撑。项羽、虞姬和戏子在不同镜头中,保持人脸、服饰与人物身份的一致,未出现偏差。
主体绑定解决了叙事的基本问题:保障角色的可识别性,让观众能够持续识别同一角色。
人物稳定以后,不同地点、景别和情绪的镜头才具备剪辑进同一段叙事的基础。
标题
复杂叙事:需要先拆成一套标准镜头工作流
经过本轮测试,我们进一步明确了可灵 3.0的合理创作方式。完整叙事并非无法实现,但不能将所有创作任务集中于单个长镜头。
1. 单镜头承载单一任务
如果一个镜头同时包含走位、转身、舞剑、追兵、马匹和镜头环绕等元素,模型需要同时处理的信息过多。更稳妥的方式是,需缩短镜头时长,使其仅完成一次清晰动作,避免长时间运动中出现形态偏差。
2. 战斗场景通过分镜与剪辑实现
“冲锋、挥剑、击中、敌人受力、倒地、追兵包围”的完整动作链,无需由单个镜头全部呈现。可拆解为冲锋、挥剑、敌军后退与战场反应等独立镜头,再通过音效与剪辑,让观众感知完整的战斗过程。
3. 空间路径提前拆分为节点
人物从后台走向侧台、再进入舞台的动线,本身包含多个空间节点。将每个节点设为独立镜头,或为关键转折分别设置首尾帧,比仅在提示词中强调“从侧方上台”更易控制效果。
这套创作方法并非绕开模型能力,而是将模型擅长的关键镜头,有机组织为完整叙事。AI负责镜头生成,创作者负责任务拆解、连续性构建与最终效果判定。
标题
压力测试验证:复杂空间和物理交互仍需加强控制
明确优势与创作工作流后,再来看本轮压力测试中难度最高的场景。
测试结果受提示词、首尾帧设计、主体参考图、镜头时长和生成随机性等多重因素影响,结论仅适用于本轮测试参数,不代表所有场景效果。
1. 精确空间路线需更精细化的镜头约束
我们测试了戏子从后台准备走向舞台的连续场面调度。该任务要求模型理解后台、侧台与舞台的空间关系,而非仅完成“人物登台”的动作。
5轮测试结果显示,人物可稳定完成“走上舞台”的语义结果,但很难持续遵循“从侧方上台”的具体动线。
 
【视频3|戏子从后台到舞台空间衔接】
画面重点:人物是否从侧方进入舞台,以及后台与舞台之间的空间连接逻辑。
该画面的色调、人物状态与舞台氛围均符合预期,偏差主要出现在第7秒前后的路径衔接处。可灵生成了视觉顺滑的移动效果,但无法稳定复现真实剧场的登台动线。
在实际创作中,更合理的处理方式是将后台、侧台与舞台拆分为两个镜头,通过人物朝向、视线引导与剪辑手法,构建空间连续性。
2. 多道具和多人战斗,对生成条件更敏感
戏曲与战场镜头同时包含双剑、水袖、盔甲、长矛、手部动作、身体重心与摄影机运动,是本轮信息密度最高的测试任务。
部分测试版本中,出现了双剑的数量变化、水袖的形变、击杀人物反馈不匹配等问题。提示词可提供方向约束,但在较长的连续动作中,无法完全消除此类偏差。
 
 
 
【视频4-6|舞剑镜头中的道具变化】
画面重点:剑、水袖与手部动作在连续运动中的一致性。
战斗镜头经数十轮测试,不同版本的输出效果差异较大。部分版本出现粉末化击打效果,被击中后的身体反馈逻辑不正确。
 
 
【视频7-8|战斗镜头中的击打反馈差异】
画面重点:兵器接触与敌军反应能否形成连贯的逻辑关系。
这组结果可总结为:在本轮测试方法下,复杂交互场景的产出确定性远低于单目标短镜头。
标题
结论:可灵更适合关键镜头生产,复杂叙事需要拆解工作流
回到开篇的核心问题:可灵能否支撑具备电影感的短片创作?
答案是肯定的,但创作方式的选择至关重要。
可灵3.0可实现优质构图、氛围感光影与相对稳定的人物主体,也能在短镜头中生成兼具压迫感和情绪张力的动态画面。这些能力已足以支撑其参与高质量内容的关键镜头生产环节。
当任务涉及跨空间调度、多道具连续动作与多人战斗场景时,创作者需将叙事拆解为更明确的单镜头任务,复杂交互逻辑通过后期剪辑完成。
现阶段可得出明确判断:可灵适合生产高质量短镜头和电影感氛围影片;在进行复杂叙事时,通过拆解式工作流可获得更稳定的输出效果。
其价值不仅在于画面生成的能力上限,也在于融入创作者的镜头生产流程。创作者主导叙事设计、分镜规划与内容取舍,可灵负责高质量完成部分镜头的生成工作。这也呼应了第一篇测评中用户的真实诉求:专业创作者既需要画面能力的上限,也需要项目落地的确定性。
将可灵应用在适配的镜头创作场景中,它将成为专业创作者的高价值AI生产工具。
下一篇,我们将测试场景延伸至商业领域:可灵能够产出电影感画面,它能否进一步支撑品牌广告与商业性创作?生成内容距离可直接落地的商业成品,还有多大差距?
资料说明:本文为36氪 AI测评基于自制《霸王别姬·前世今生》测试脚本展开的可灵3.0图生视频实测。本次结论仅反映本轮提示词、参考图、生成参数、剪辑逻辑下的模型表现,不代表模型所有场景的通用能力。
THE END
扫码添加
图例
本文来自微信公众号“36氪AI测评”,36氪经授权发布。
分享
阅读原文 ↗