Daily Tech Briefing
AI 科技速览
每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。
雷锋网 · 2026/7/27 07:52:00
8位AI Infra高管复盘WAIC:当堆砌「暴力美学」触顶,AI Infra如何求变?
AI 中文解读
1. 核心亮点:WAIC 2026上,AI基础设施行业集体“换赛道”——不再比谁显卡多、集群大,而是拼谁能让AI运行更稳定、成本更低、产出Token更高效。
2. 通俗解读:过去两年大家疯狂堆显卡、比参数,就像军备竞赛。但今年上海的人工智能大会上,行业大佬们达成新共识:光有“蛮力”不够了,关键是让AI“干活”又快又省钱。现在AI调用量暴涨300倍,每产出一次Token的成本和稳定性成了新焦点。更惊人的是,未来99%的Token不是人用的,而是AI代理(Agent)自己“烧”的——比如AI写代码、自动处理客服,它们一次任务消耗的算力是人类的成百上千倍。于是,“AI工厂”和“Token工厂”概念火了,前者是完整生产线,后者专攻把算力变成标准化“数字石油”。行业不再盲目堆料,而是转向系统效率竞争。
3. 实际影响:这意味着我们很快能用上更便宜的AI服务——比如语音助手反应更快、客服不再答非所问、AI写报告更可靠。企业开发AI应用的门槛也在降低,因为底层算力调度更智能,成本可能下降一半以上。对普通人来说,AI将从“偶尔玩玩”变成“天天用的工具”,甚至像水电一样成为基础设施。
7月的上海,WAIC 2026的热度,或许比蝉鸣来得更盛。几乎每个展台都人头攒动,人群的目光在展板的铅字和展商的面庞间来回切换。无数人来到这里,心里总带着同一个问题:中国的人工智能产业,到底走到哪一步了?雷峰网特别策划WAIC 2026观察报道,我们与8位参展AI Infra公司的决策者聊了聊,试图从展台边的对话里,捕捉今年大家真正在关心什么,以及这个行业正在形成哪些新方向和新共识。01扬帆 | 从拼规模升级为比效率今年产生了这样一种有意思的趋势,不管是来自CEO还是业务负责人,都不约而同地提到同一件事——WAIC 2026,行业关注的重心发生了改变。过去大家更多在聊千卡集群、GPU性能等指标;而现在,话题更多转向了如何稳定、低成本批量产出Token,以及在此基础上,要怎么样利用这些稳定的、低成本的token去支撑Agent和AI应用持续稳定运行。市场数据能清晰地印证这轮转变。2025年全市场Token调用量同比暴涨300倍,头部大模型企业的增长已完全由API和Token调用拉动。以智谱为例,其年化收入已从预期的7亿突破至10亿美金,增长核心全部来自推理侧规模化调用。据Gartner测算,推理目前已经占到企业AI计算支出的65%以上。这不再是一场“谁有更多卡谁就是赢家”的规模竞赛——用产出衡量能力,是推理时代的必然。九章云极市场部负责人陈庶观察到,去年大家还在讨论如何把模型训练出来,今年讨论已经变成了“如何让模型规模化地跑起来”。推理效率、调度能力、成本管控替代了算力规模,成为展台和论坛上最高频的词。这一看法成为了默契的共识,首都在线COO董直烨提到,行业的关注点已经从“算力资源的有无和规模大小”,转向了“算力的落地效率与价值确定性”。并行科技董事长,CCF中国计算机学会副理事长陈健指出,前两年行业算力需求基本上训练、推理五五分,但今年开始,随着AI Coding、小龙虾式自主智能应用批量落地,直接把算力推理需求推到了绝对主导地位。陈健将其概括为行业的一个共识判断——2026是AI大规模商业化元年,推理才是算力消耗的长期主体。02暗涌 | 99%的Token会被Agent消耗如果说Token是AI时代的石油,那Agentic AI就是那个轰鸣的内燃机。Agent正在推动AI从“生成内容”走向“完成内容”,在执行任务的过程中不断调动多个模型、多个工具,这会带来比传统单轮问答成百上千倍的Token消耗量。当AI Coding、智能客服和企业Agent等场景成为业务板块的一部分,单次请求将面临着更复杂的任务,也会更频繁的调用工具——毫无疑问,Agent的消耗速度绝对不是人可以比拟的。PPIO的创始人兼CEO姚欣给出这样的判断,现在人类和Agent的Token消耗量能打个平手,但未来Agent才会是Token的第一用户。“99%的Token都会由Agent消耗,而不是人。”这意味着,Agentic AI会明显提高对Infra的要求。趋境科技创始人兼CEO艾智远有一个判断,未来AI基础设施的竞争不会只停留在单点性能,而是更看重复杂任务中的连续稳定服务能力。博大数据董事长余武旺表示,未来竞争不会只是拼 GPU 数量,而是拼整个系统的协同能力,包括 AI 网络、高速互联、能源保障、资源调度,以及能否快速响应不同业务场景。需求端的变化已经清晰,供给端要如何回应?(关于AI Infra的产业需求变革,欢迎添加作者微信 treelog10 交流)03合流 | AI工厂和Token工厂:双帆共舞Agent让Token消耗呈现指数级增长,行业的回应是“AI工厂”和“Token工厂”。从2022年,英伟达CEO黄仁勋提出AI工厂,到2025年AI工厂被明确为像互联网和电力一样的基础设施。这场关于“造Token”的革命,在2026年已经进入了发展的关键阶段。8位站在行业最前沿的人均认同,AI工厂和Token工厂并非对立关系,二者更像一体两面的共生关系:AI工厂将包含推理和训练两大板块,是整个Token生产体系的完整载体;而Token工厂则更加注重规模化交付,把算力输出为标准的Token产能。董直烨认为,AI工厂的概念更宽泛,覆盖从数据处理、模型训练、微调、推理到应用分装的全流程;Token工厂则是聚焦智能最小单位——Token的全生命周期,本质是把算力转化为标准化的Token产能,更侧重推理侧的效率和确定性。清程极智联合创始人师天麾提出,AI工厂和Token工厂之间的概念异同,更多是一种观察尺度和叙事重点的区别。“AI工厂”这一概念强调的是完整的生产体系;而Token工厂则是把视角聚焦到推理和服务交付环节。“Token 工厂可以理解为 AI 工厂在推理时代、特别是在大规模 Agent 应用场景下的一种具体运营形态。”师天麾说。陈健则对二者关系做出了分层。他认为完整AI工厂分为两大模块,训练工厂和推理工厂,而推理工厂就是行业所说的Token工厂。他还指出二者之间存在的差异,是产业变革的核心。第一是需求体量与长期占比的改变。陈健表示,长期来看,训练算力整体占比会萎缩至10%左右,研发类算力占比5%,剩余85%以上的算力需求将全部归属Token推理工厂。行业算力资源投入重心不可逆的向推理倾斜。第二是集群设计逻辑完全相反。大规模训练任务是典型的超大规模单一计算任务,允许外部互联网络临时波动,但无法接受集群内单点硬件故障;而Token推理是线上持续服务,可容忍单张GPU失效等集群内故障,但无法承受对外服务互联网络的不稳定。“总而言之,AI工厂是完整产业载体,Token工厂是AI工厂当下和未来的价值核心——所有商业化收入、规模化应用增量,将由Token推理承载。”陈健说。(如果对AI工厂和Token工厂有独到的见解和看法,欢迎添加作者微信 treelog10 交流)04深海 | 效率决胜,玩家分层“后Scaling时代”是今年WAIC大会的热点词之一,意思是单纯堆算力、堆参数的方法,边际效益在递减。这个解读是否符合产业真实情况?目前从一些方面看来,答案是肯定的。早期,行业靠放大模型参数、建立千卡、万卡集群实现算力的跃升,但是来到2026年,已有厂商仅靠传统方案10%的训练算力,就做出了顶尖模型;企业也越来越“现实”,同样的资源要能产出更多有效的Token。但后Scaling并不意味着Scaling的终结。师天麾判断,Scaling并没有失效。只不过,靠扩大参数和堆叠算力,已经不能再自动换来等同比例的业务价值。训练和推理规模仍会增长,只是行业必须同时回答成本、能耗、延迟、稳定性和商业回报的问题。共绩科技创始人兼CEO付智,也有类似的判断:后Scaling并非“不再Scaling”,而是进入一种更加精细的系统Scaling、效率Scaling和调度Scaling。陈庶也提出,Scaling并没有结束,但是它的优先级在下降;模型能力的上限仍然在向前推进,但竞争的焦点确实在转移。既然单纯拼规模的时代已经过去,那现在行业要如何满足Agent的需求?市场给出了一个更加现实的答案——“效率为王”。“我们的判断是,AI Infra正从资源竞争转向系统效率竞争。”师天麾说。付智把这种效率竞争划分为三个层面。一是计算效率,通过芯片、网络、推理框架、模型优化和系统架构,让同样的硬件产生更多有效计算。第二是资源效率。通过弹性调度、异构资源整合和跨区域协同,让更多原本闲置或利用率不足的算力进入生产体系。第三是能源效率。算力任务如何与能源条件进行匹配,会越来越影响最终的Token成本。艾智远的观察是,企业会非常现实地计算:同样一批资源,能产出多少有效Token;服务能稳定运行多久;成本能不能支撑长期使用。未来竞争的关键,是提升单位资源产出、提高有效利用率、跨过成本线,并把这套能力复制到更多客户和场景中。姚欣则给出一个锋利的判断:随着赛道进入白热化竞争,绝大多数Token工厂目前都应处于亏损状态。比赛已经进入下半场,不同赛道的玩家在这场变革中各怀优势,也各有短板。陈健对雷峰网表示,他判断当下Token工厂赛道的玩家正在加速分层。其中,具备万卡GPU集群和全栈调度优化能力的算力服务商,优化后集群TPS和单位算力Token吞吐能拉开中小玩家10倍差距。但重资产模式注定了更长的扩张周期。自研大模型厂商自建推理集群,可以深度贴合自有模型架构,但硬件出处不对外开放,无法承接第三方海量Token需求。硬件采购上也有对外服务性价比不足的弱势。至于中小型算力服务商和初创团队,体量小、决策灵活,可承接定制化零散小单,却缺少长期稳定大客户订单、大批量GPU锁货渠道和底层调度与性能的优化能力。“稳定大客户订单、强GPU供给、顶尖性能算力优化能力三者缺一不可。同时,具备的头部玩家会持续收割份额,中小玩家的生存空间正在持续收窄。”陈健说。AI产业的发展进入深水区,百川归海,构建起新的行业共识。故事更迭背后,是技术浪潮的自然延续,Token产出取代GPU卡数成为新的标尺,效率接替规模成为新的命题。AI Infra企业纷纷在地图上圈出了新的目的地——让AI真正成为可度量、可交付、可依赖的生产力。百舸扬帆,向深海驶去。05掌舵者说关于竞争和优势,8位决策者还给出了不同的判断和解读。算力基础设施与规模化交付并行科技董事长,CCF中国计算机学会副理事长 陈健站在2026 WAIC现场,我感受到最直观的行业变化只有一句话概括:推理落地了。整个会场厂商、客户交流的核心不再是“能搭多大训练集群”,而是“如何稳定、低成本批量产出Token”,Token工厂、推理服务、低时延调度成为全场高频词。本次WAIC并行科技集中释放全栈算力服务落地成果,核心想向行业传
分享
阅读原文 ↗