Daily Tech Briefing
AI 科技速览
每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。
雷锋网 · 2026/8/3 03:27:00
我们让 vivago R1 拍了一部土耳其山寨「星战」,结果出乎意料
AI 中文解读
AI视频一夜进化:从几秒短片到无限时长成片。智象未来在WAIC大会发布了全球首个无限时长视频智能体vivago R1,刚拿到超20亿元融资就拿出真本事,实测拍了一部土耳其山寨《星战》,意外地稳。以前AI生成视频卡在几十秒,画面一长就人物崩坏、剧情断裂。这次R1跳出“拼素材”的思路,像导演一样自己规划脚本、协调各路开源模型分工干活,还配上质检环节,把成片成功率拉到85%左右。对普通人来说,最大的变化是拍“长片”不再烧钱烧时间。以后你想做一条五分钟的品牌宣传片、一部短剧,甚至给家里老人做段回忆录视频,AI能一口气帮你从剧本写到成片,风格统一、逻辑在线,不用再一段段拼接修修补补。这片子能成,靠的不是某个天才模型,而是踏踏实实的编排调度能力,这或许才是AI视频下半场真正的分水岭。
vivago R1 实测:模型聚合之上,长视频编排能力成新护城河。(雷峰网) 作者丨Rhea 编辑丨马晓宁 李娜 7月18日,在2026世界人工智能大会(WAIC)现场,智象未来正式发布全球首个无限时长内容创作多模态智能体vivago R1,随后,智象官宣已经完成了 C 轮融资,在近三个月完成超 20 亿元人民币的融资。01编排即护城河:AI 视频的新共识2026 年 6 月 23 日,伯克利哈斯商学院官网发过一篇专栏评论 Insight 文章,作者 Akash Rathi 是谷歌 Pixel 的产品经理,里面提到一个关键的判断和论点(作者表示仅代表个人不代表谷歌):模型和编排框架都在商品化;纯软件的 Agent,包括编排层恰恰是护城河最弱的,类似"几周就能被克隆""一键导入就能搬走"的质疑一直存在所以护城河从大脑(模型)迁移到 Physical Experience(物理体验)图注:《The AI Moat Is Migrating – And Most Leaders Are Looking in the Wrong Place》另一边在资本市场上,Cursor 在 2026-06 被 SpaceX 以 600 亿美元收购,之前 Manus 差点以 20 亿美金收购,最近 OpenRouter 也在和多家科技巨头谈收购机会。而就在几天前,智象未来刚宣布完成 15 亿元 C 轮融资,近三个月累计融资超 21 亿元,正式跻身独角兽行列。Manus 已经证实了聚合是手段,编排出来的体验才是人们真正需要的产品。现在面对这大把的开源模型,谁都能做微调,但是看着用户需求在自己的沙箱里一步步完成的成就感才是产品人最 aha 的时刻。所以在面对平台型的 AI 产品时,我们更应该关注的是在人人都能聚合的前提下,它在上面多做的那层 Agent 编排,有没有做出别人做不出的、能验证的东西 。这个问题的区别就是我们做这个测评的核心。想清楚了就知道 vivago R1 这类产品该怎么看;想不清楚,就会永远卡在又一个套壳的条件反射里,既高估了它也低估了它。vivago R1 只是这个更大问题的一个切片。这款产品于 2026 年 WAIC 大会期间刚刚发布,号称全球首个具备无限时长视频生成与编辑能力的多模态创作智能体,核心卖点是“长、长、稳”——无限时长、长任务思考、高稳定生成,也正是这次实测要验证的东西。vivago.ai 官网02vivago R1 是谁?从 Video Agent 到无限时长vivago的母公司是智象未来(HiDream.ai),2023 年 3 月成立在北京,创始人兼 CEO 是梅涛。这个名字在计算机视觉圈不算陌生,他之前是微软亚洲研究院的高级研究员,后来是京东的高级副总裁,2025 年当选 ACM Fellow。智象未来的定位是「全球唯一同时支持文本、图像、视频、3D 四个模态的基础模型厂商」,此前开源过文生图模型 HiDream-I1。vivago 是智象面向专业创作者的那个智能体平台。vivago R1 是目前最新的模型但要理解 vivago R1 到底新在哪,也许得看看它的前身——就在两个月前,2026 年 5 月,智象在 Product Hunt 上发过一个叫 Vivago Video Agent 的产品,靠一群 AI 导演帮你编角色、写叙事、做故事板,还能在渲染前先看关键帧。当时它拿了当日产品榜第一。但那个版本的输出时长封顶就是3分钟,无法再长了。Vivago Video Agent 评测:R1 的前身五个月前登上 Product Hunt 当日第一,当时单条视频还封顶在 3分钟两个月后,vivago R1 的目标是做到 无限时长 视频创作。这是全球首个具备无限时长视频生成与编辑能力的多模态创作智能体,标志着AI在创意生产领域的一次范式转移:从辅助生成单点素材,进化为能够自主规划、调度并完成长链路创作任务的“智能搭子”。vivago R1的核心优势可以概括为“长、长、稳”三大特质,精准回应了行业长期存在的时长受限、逻辑混乱、效果不稳三大痛点:▎一是无限时长,全场景无限制适配。当前行业主流AI视频产品仅支持15-30秒短镜头生成,vivago R1彻底打破行业时长壁垒,支持长时长视频连续、连贯生成,全面适配短剧、专题片、品牌宣传片、影视成片等不同品类长周期创作场景,填补了行业长视频创作的市场空白。▎二是长任务思考,保障创作逻辑连贯统一。vivago R1 具备长任务推理能力,可自主完成精细化逻辑构思、镜头排布与风格校准等,有效解决AI生成视频的画面跳变、人设崩塌、叙事断层、风格割裂的行业难题,保障全片创作的完整性与专业性。▎三是高稳定生成,赋能商业规模化交付。依托 AgentOS 全流程调度与治理能力,vivago R1 实现创作全链路可控可校准,将内容有效可用成功率提升至85% 左右,远高于行业平均水平,极大降低反复修改调试的时间与人力成本,生成内容可直接应用于商业制作、品牌传播与市场化交付。03方向对了:长视频编排为何是正道?▎第一,编排是这条赛道的正路,不是偷懒。很多人一听 它自己编排别人的模型 ,就觉得没技术含量。但这恰恰是长视频生成领域现在的主流解法。2026 年有一批做长片生成的论文,比如那套 ScripterAgent 写脚本、DirectorAgent 去编排多个 SOTA 视频模型、再用 CriticAgent 校验的框架,走的都是 编排现有模型 + 保长程一致 这条路,而不是从零训一个能一口气生成十分钟的巨型模型。腾讯团队的长视频 Agent 研究显示,主流做法都是"编排现有 SOTA 模型 + 跨镜头缝合",因为单段模型一次只能生成约 8–12 秒因为单个视频模型受物理限制,一次能稳定生成的时长就是有限的;要出长片,编排几乎是唯一现实的路。 所以 vivago R1 选择做编排层本来在方向上就是被行业已经证实的。▎第二,长片生成确实是苦天下久矣。今天主流的 AI 视频,绝大多数还卡在秒级到两分钟:谷歌 Veo 3.1 单段大约 8 秒、多镜头拼到一两分钟,OpenAI Sora 2 大约 60 秒(而且消费端在 2026 年 4 月已经关停了),快手可灵 3.0 号称 导演级 、能到两分钟。换句话说,如果 vivago R1 真能稳定产出五分钟以上、还连贯不崩的成片,那它踩中的绝对是一块真实的市场空白和需求▎第三,野心的方向是对的。Sora 2 很早都到 60 秒了,它和 vivago R1 都想解决的问题是短镜头再好看,也拼不出一部能叙事、有人物、风格统一的片子。 长视频不是短视频的简单拼接——这句官方自己都承认的话,恰恰是这件事最难的地方。所以从以上调研的情况来看,R1 的产品决策是想清楚过的,不是蹭热点。 但 决策对 不等于 做得好 。方向选对了,能不能在一条五分钟的片子里真把活干成是另一回事——接下来我们就通过实测看看真实表现04自研还是聚合? 拆解 R1 的技术底牌现在声称自研的团队太多了,也许很多人同样也好奇 vivago 究竟有哪些创新和自研?1.底层那个真正生成画面的视频模型,是自研的吗?2.还是说上面那层做规划、编排、保一致性的 Agent 是自研的?这两件事的含金量完全不同,也对应完全不同的故事。现有的公开证据指向一个比 纯自研 或 纯套壳 都更微妙的答案:聚合侧:上文有提到 vivago 自己的 llms.txt 列了 Sora 2 / 可灵 v2.6 Pro / Veo 3 / Veo 3.1 + 自研 Vivago 2.0,并自称 多模型平台而非单一模型工具 。vivago llms.txt:vivago 官网给 AI 看的说明文件里描述了自己是聚合 Sora 2、可灵、Veo 加自研 Vivago 2.0 的多模型平台。自研侧:智象确实有自己的HiDream-O1-image 系列以及 video系列的自研模型——Vivago 2.0/2.1(图像+视频)在第三方评测站被独立测过(该视频模型现在已经改名叫 HiDream 2.0);公司也确有多模态自研底座的积累。第三方模型库把 Vivago 2.1 列为智象自研的图像生成模型也就是说 vivago 是一个 自研模型+ 聚合第三方视频模型 + 上层 Agent 编排 的混合体。R1 的独家价值,大概率不在 底层画面全是自研模型画的 ,而在编排 + 长程一致性 + 长片能力这个领域。后来生成视频的过程我通过逆向发现了一些有意思的信息:首先请求的域名都在 vivago 自己家,没有任何第三方模型域名,说明模型调用全在服务端完成,前端只跟 vivago 网关对话。这是编排型平台的典型架构,也意味着底层调谁无法从域名层看出来。vivago R1 是一个技能驱动的编排 Agent(同 Kimi Work / Anthropic Skills 谱系),17 个功能技能,覆盖视频/图像/电商/社媒等垂类。其中 cinematic-story-director 是最成熟的旗舰,后面实测我也发现效果最好的就是这个skill模型被功能和技能抽象了,前端全程看不到模型名。比如用户看到的是 text-to-video、reference-to-video、cinematic-story-director,没有一个按模型命名。也就是说模型路由完全在服务端
分享
阅读原文 ↗