Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
36氪 AI · 2026/8/3 08:12:09

可灵观察②|用可灵重现《霸王别姬》:电影感足了,复杂叙事如何更稳?

AI 中文解读
可灵AI视频生成工具迎来最新实战评测,这次直接挑战经典题材《霸王别姬》。核心结论很明确:可灵3.0拍“单张精彩画面”堪称惊艳,但想让它独立导演整部短片,还得靠人类把故事拆碎成一个个小片段。好比让AI画一帧精美的电影海报,它绝对靠谱;但让它一口气演完整场戏,就常常出乱子。不过,它在画面构图、光影质感和人物脸部一致性方面确实表现出色,能做出一眼就有“电影味”的镜头。这意味着,以后普通人想拍点有质感的短视频,门槛大大降低了。你只需要构思好分镜,让AI生成出彩的关键画面,再自己动手剪辑组合,就能做出比以往精致得多的作品。但也要明白,AI目前还只是个得力的“摄影师”,导演和编剧的统筹思维,依然得靠人脑来负责。
其中高质量画面、电影感镜头、广告和商业短片是用户提及率最高的应用场景。 这次,我们进一步展开测试:如果可灵最被期待的是电影感,它能否支撑包含人物、动作和情绪的完整短片创作? 围绕“霸王别姬”主题,我们原创了测试脚本《霸王别姬·前世今生》,使用可灵3.0的首尾帧图生视频与主体绑定功能,完成了一轮压力测试。本次测试围绕人物一致性、构图与空间层次、光影与氛围塑造、动作与运镜设计四大维度展开,既保留了完成度较高的镜头,也完整记录了复杂任务中的试错过程。 先说核心结论:可灵3.0更适合关键镜头的创作。 模型在构图、光影、情绪氛围和人物主体一致性上表现突出,针对目标明确的短动作镜头,可以稳定产出高质量画面。若需用可灵处理复杂叙事影片,更稳妥的思路是把长动作拆成单目标的短镜头,再通过分镜设计与后期剪辑串联为完整段落。 当任务同时涉及跨空间移动、多道具与多人物打斗场景时,最终画面效果高度依赖提示词、参考图、镜头时长和拆分方法。 这次压力测试,目的是找到更稳定的创作方法,而非对模型能力下定论。 【图1|本次测试使用的参考图】 标题 电影感,率先在关键镜头中落地 从测试结果来看,可灵3.0的核心优势集中在关键镜头的画面完整度。 当镜头目标明确、人物关系简洁、动作时长较短时,模型能生成高质量画面。光影、构图、人物和情绪氛围均表现亮眼。 例如戏子镜前准备的画面,最能直观体现可灵的画面表现力。 【图2|戏子镜前准备】 这个画面可灵并非只进行了简单的动态化处理,镜框把人物限定在视觉中心,左侧珠串和戏服形成前景,人物与铜镜置于中景,后台走廊与暖光充当远景,形成标准的前中后三层纵深结构。 画面摆脱了平面感,呈现出鲜明的电影空间质感。 可灵在这类镜头里的核心价值,在于一次性生成构图、光线和人物状态完整的视觉画面。 这也侧面印证了第一篇测评中,用户普遍将可灵与“电影感”“高质感镜头”绑定的核心原因。 标题 短动作镜头,可稳定输出高质量动态效果 电影感并非仅来源于静态构图。可灵同样能完成具备冲击力的电影感动态镜头。 项羽在战场打斗的场景,我们经多轮测试,得到了一版完成度较高的短镜头。   【视频1|项羽突围画面】 画面重点:短时间内人物气势、战场压迫感和动作方向的合理性。 该片段中,项羽的突围路线清晰,人物动态传递出杀伐张力。黄沙战地、兵器交锋、人体倒地和尘土弥漫的效果,共同构建出混战中的压迫感。 让可灵在生成长镜头动作画面时,核心前提在于有明确的目标镜头,只承载一个主要的动作,目标越清晰,输出的结果稳定性越高。 标题 氛围塑造和人物一致性:为叙事提供锚点 1. 氛围塑造方面 项羽乌江自刎前后的情绪镜头,是本轮测试中另一组完成度较高的素材。   【视频2|项羽乌江自刎】 画面重点:光影和暗部细节。 这段画面的整体亮度偏低,项羽近景镜头里,剑身呈现微弱反光,冷灰天光搭配脸上的泥土、血污和泪痕,共同烘托出英雄末路的悲壮情绪。 2. 人物一致性方面 主体绑定主体的能力也为成片提供了支撑。项羽、虞姬和戏子在不同镜头中,保持人脸、服饰与人物身份的一致,未出现偏差。 主体绑定解决了叙事的基本问题:保障角色的可识别性,让观众能够持续识别同一角色。 人物稳定以后,不同地点、景别和情绪的镜头才具备剪辑进同一段叙事的基础。 标题 复杂叙事:需要先拆成一套标准镜头工作流 经过本轮测试,我们进一步明确了可灵 3.0的合理创作方式。完整叙事并非无法实现,但不能将所有创作任务集中于单个长镜头。 1. 单镜头承载单一任务 如果一个镜头同时包含走位、转身、舞剑、追兵、马匹和镜头环绕等元素,模型需要同时处理的信息过多。更稳妥的方式是,需缩短镜头时长,使其仅完成一次清晰动作,避免长时间运动中出现形态偏差。 2. 战斗场景通过分镜与剪辑实现 “冲锋、挥剑、击中、敌人受力、倒地、追兵包围”的完整动作链,无需由单个镜头全部呈现。可拆解为冲锋、挥剑、敌军后退与战场反应等独立镜头,再通过音效与剪辑,让观众感知完整的战斗过程。 3. 空间路径提前拆分为节点 人物从后台走向侧台、再进入舞台的动线,本身包含多个空间节点。将每个节点设为独立镜头,或为关键转折分别设置首尾帧,比仅在提示词中强调“从侧方上台”更易控制效果。 这套创作方法并非绕开模型能力,而是将模型擅长的关键镜头,有机组织为完整叙事。AI负责镜头生成,创作者负责任务拆解、连续性构建与最终效果判定。 标题 压力测试验证:复杂空间和物理交互仍需加强控制 明确优势与创作工作流后,再来看本轮压力测试中难度最高的场景。 测试结果受提示词、首尾帧设计、主体参考图、镜头时长和生成随机性等多重因素影响,结论仅适用于本轮测试参数,不代表所有场景效果。 1. 精确空间路线需更精细化的镜头约束 我们测试了戏子从后台准备走向舞台的连续场面调度。该任务要求模型理解后台、侧台与舞台的空间关系,而非仅完成“人物登台”的动作。 5轮测试结果显示,人物可稳定完成“走上舞台”的语义结果,但很难持续遵循“从侧方上台”的具体动线。   【视频3|戏子从后台到舞台空间衔接】 画面重点:人物是否从侧方进入舞台,以及后台与舞台之间的空间连接逻辑。 该画面的色调、人物状态与舞台氛围均符合预期,偏差主要出现在第7秒前后的路径衔接处。可灵生成了视觉顺滑的移动效果,但无法稳定复现真实剧场的登台动线。 在实际创作中,更合理的处理方式是将后台、侧台与舞台拆分为两个镜头,通过人物朝向、视线引导与剪辑手法,构建空间连续性。 2. 多道具和多人战斗,对生成条件更敏感 戏曲与战场镜头同时包含双剑、水袖、盔甲、长矛、手部动作、身体重心与摄影机运动,是本轮信息密度最高的测试任务。 部分测试版本中,出现了双剑的数量变化、水袖的形变、击杀人物反馈不匹配等问题。提示词可提供方向约束,但在较长的连续动作中,无法完全消除此类偏差。       【视频4-6|舞剑镜头中的道具变化】 画面重点:剑、水袖与手部动作在连续运动中的一致性。 战斗镜头经数十轮测试,不同版本的输出效果差异较大。部分版本出现粉末化击打效果,被击中后的身体反馈逻辑不正确。     【视频7-8|战斗镜头中的击打反馈差异】 画面重点:兵器接触与敌军反应能否形成连贯的逻辑关系。 这组结果可总结为:在本轮测试方法下,复杂交互场景的产出确定性远低于单目标短镜头。 标题 结论:可灵更适合关键镜头生产,复杂叙事需要拆解工作流 回到开篇的核心问题:可灵能否支撑具备电影感的短片创作? 答案是肯定的,但创作方式的选择至关重要。 可灵3.0可实现优质构图、氛围感光影与相对稳定的人物主体,也能在短镜头中生成兼具压迫感和情绪张力的动态画面。这些能力已足以支撑其参与高质量内容的关键镜头生产环节。 当任务涉及跨空间调度、多道具连续动作与多人战斗场景时,创作者需将叙事拆解为更明确的单镜头任务,复杂交互逻辑通过后期剪辑完成。 现阶段可得出明确判断:可灵适合生产高质量短镜头和电影感氛围影片;在进行复杂叙事时,通过拆解式工作流可获得更稳定的输出效果。 其价值不仅在于画面生成的能力上限,也在于融入创作者的镜头生产流程。创作者主导叙事设计、分镜规划与内容取舍,可灵负责高质量完成部分镜头的生成工作。这也呼应了第一篇测评中用户的真实诉求:专业创作者既需要画面能力的上限,也需要项目落地的确定性。 将可灵应用在适配的镜头创作场景中,它将成为专业创作者的高价值AI生产工具。 下一篇,我们将测试场景延伸至商业领域:可灵能够产出电影感画面,它能否进一步支撑品牌广告与商业性创作?生成内容距离可直接落地的商业成品,还有多大差距? 资料说明:本文为36氪 AI测评基于自制《霸王别姬·前世今生》测试脚本展开的可灵3.0图生视频实测。本次结论仅反映本轮提示词、参考图、生成参数、剪辑逻辑下的模型表现,不代表模型所有场景的通用能力。 THE END 扫码添加 图例 本文来自微信公众号“36氪AI测评”,36氪经授权发布。
分享
阅读原文