Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
钛媒体 · 2026/8/5 02:05:04

毒圈缩圈:AI大模型的“斩杀线”还在上移

AI 中文解读
DeepSeek发布V4 Flash 0731,性能飙升的同时价格低到离谱,直接划出一条“斩杀线”——比它贵还比它弱的模型,基本宣告出局。 你可以把AI模型想象成游戏里的角色:能力值是攻击力,跑任务要花的钱是蓝耗。以前大家比谁单次回答更聪明,现在AI要独立完成整个任务链条,好比从“答一道题”变成“独立做完一个项目”。这期间消耗的计算量暴涨上千倍,模型之间的成本差距也被瞬间放大。V4 Flash 0731的能力跟对手差不多,但每项任务的花费只有对方的零头,性价比优势直接碾压。 对普通人来说,最直观的变化是以后用AI干复杂活儿会越来越便宜。无论是让AI帮你写代码、做数据分析,还是处理繁琐的文档工作,选择性价比高的模型能省下真金白银。同时,那些能力不够的模型会被市场迅速淘汰,未来我们能用上更聪明、更便宜的AI助手,就像当年智能手机淘汰功能机一样自然。
(本文作者为 云涌AI,钛媒体经授权发布)文 | 云涌AI ,作者 | 黄云皓2026年7月31日,DeepSeek发布V4 Flash 0731。新版在Artificial Analysis的Intelligence Index上得50分,比上一版V4 Flash高出10分。基于Intelligence Index v4.1评测数据,将各家模型放入一张散点图,纵轴是Intelligence Index得分,越往上能力越强;横轴是每任务成本,越往右成本越高。V4 Flash 0731落在左上,以它为起点向右下划出一片区域,区域内的模型成本更高、能力更弱。Artificial Analysis Intelligence Index v4.1,DeepSeek V4 Flash 0731“斩杀线”来源:Panda@Cerul.ai,XArtificial Analysis Intelligence Index v4.1,网友制作的DeepSeek V4 Pro预测“斩杀线”版本来源:Jen Zhu,X中文AI圈把这片区域称作“斩杀线”,血量低于这条线的模型,一击即死。英文一侧叫Kill Zone(斩杀区)。而对斩杀线附近的模型来说,毒圈正在不断缩小。两个词都出自电子游戏,同时在中英文AI圈流行,正是大模型行业竞争转向、烈度升级的信号。一. Agent定义“斩杀线”从对话到任务Agent改变了模型的使用方式,从一次对话变成一项任务。为了完成任务,模型需要连续执行多个步骤、调用外部工具、在出错后重试,交付的是一项任务的结果。因此,单次回答的准确性已不能反映出模型交付任务结果的能力,而按token计价的测试也无法准确体现一项任务的支出。2026年5月,美国国家标准与技术研究院下属的CAISI公布DeepSeek V4 Pro评估,将其与GPT-5.4 mini在7个基准上逐项对比,实际支出从便宜53%到贵41%。同一对模型,换一组任务,成本高低便可颠倒。成本随任务而定,评测口径也随之聚焦到“任务”上。GPT-5.4 mini和DeepSeek V4 Pro在不同基准测试上的端到端成本,仅统计两个模型均能正确解决的任务 来源:CAISIIntelligence Index v4.1的两个坐标轴,都以“任务”为评测基准。纵轴的Intelligence Index能力指数,衡量的是完成任务的能力,由9个评测加权构成,其中Agents(智能体)占比34%,Coding(编程)占比24%,Scientific Reasoning(科学推理)占比24%,General(通用)占比18%。Artificial Analysis在方法论页面上明确了评测方向:the weighting emphasizes agentic tasks权重向智能体任务倾斜横轴的每任务成本,取模型跑完整套Intelligence Index的总成本,除以各项评测的任务总数。这笔总成本按input(输入)、cache hit(缓存命中)、cache write(缓存写入)、reasoning(推理)、answer(回答)五类token分别计价,再按各评测在指数中的权重加权。按这一口径,Claude Opus 4.8 (max)能力得分为56分,每任务成本1.78美元;DeepSeek V4 Pro (max)得44分,0.04美元。V4 Flash 0731能力得分为50分,高出DeepSeek V4 Pro (max)六分。能力与V4 Flash 0731最接近的是GPT-5.6 Luna (max),得分为51分,高出一分。GPT-5.6 Luna (max)在7月30日下调价格80%,降价之后,V4 Flash 0731的每任务成本仍低约60%。能力最接近的对手降价八成之后,每任务成本仍然更高,凸显了V4 Flash 0731现阶段的性价比优势。散点图中左上方完全空白。放大器Agent的应用放大了模型之间的成本差距。一次单轮问答消耗数百至数千tokens,一项Agent任务的tokens消耗量高出数个数量级。模型之间的单价差距不变,最终支出却随消耗量增加而同步扩大。Bai Longju等人在2026年4月的论文《How Do AI Agents Spend Your Money?》(AI智能体如何花掉你的钱)中,分析了八个前沿模型在SWE-bench Verified上的执行轨迹,统计发现Agent编码任务的tokens消耗为代码问答与代码推理的一千倍。按官方定价,Claude Opus 4.8的输出tokens为每百万25美元,DeepSeek V4 Flash为0.28美元。一次消耗数千tokens的问答,两者的支出差额以美分计。在一项Intelligence Index任务上,Artificial Analysis给出的每任务成本是Claude Opus 4.8 (max) 1.78美元、V4 Flash 0731约0.09美元(推算),支出差额接近1.7美元。模型之间的单价差距没有变化,支出差额由美分级变成美元级。同时,Agent任务中所消耗的tokens还在快速增长。Artificial Analysis在2026年6月30日的文章《Claude Sonnet 5 Agentic cost》(Claude Sonnet 5的智能体成本)中指出,Sonnet 5的每任务成本为2.29美元,较上一代翻倍,输入输出价格未变,增量全部来自tokens用量增加而非单价上涨。Sonnet 5在Intelligence Index任务上的max档输出tokens较前代高出约40%;在AA-Briefcase和GDPval-AA两项知识工作评测中,智能体轮次约为前代的三倍。消耗量继续上升,在模型上的最终支出也将持续增加。Agent的应用也放大了模型之间的能力差距,这主要源自Agent任务的步骤数快速增加。单轮问答里,能力差异表现为一次回答的准确率差异。Agent任务由多步骤串联,任一步骤出错,整体即告失败,成功率约等于各步成功率的连乘。一次回答的准确率为95%与90%,相差五个百分点。二十步之后,成功率分别为36%与12%,前者接近后者的三倍。此外,Agent常设的重试机制进一步放大了两侧差距。失败发生在长任务中途,重跑需重新支付tokens开销,能力不足将直接转化为额外支出。Agent对模型能力和成本差距的放大效应,直接导致模型分化。性价比落在斩杀线以内的模型,将快速失去市场地位和商业潜力。模型只是一个部件Agent给模型的评测带来了更多的变数。7月,Reddit的r/LocalLLaMA上发表的一篇独立评测,测试者将DeepSeek V4 Flash分别接入Pi、OpenCode、Claude Code、Nanocoder四个Agent,执行同一批真实bug修复任务,并用同一套评分标准。四个框架的能力得分落在同一个重叠区间,但消耗的tokens和时间相差四倍。单次运行的实际耗时(上)与输出tokens数(下)来源:nqawhc.github.io为了有效对比模型的任务执行能力和成本,Artificial Analysis自建并开源了harness Stirrup,这是一个统一的Agent测试框架,E2B沙箱、六个固定工具、250轮上限。所有模型的Intelligence Index跑分都在这个框架里完成。V4 Flash 0731在Terminal-Bench 2.1这项Agent评测上有两个得分。Artificial Analysis使用Stirrup测得79%,DeepSeek在2026年7月31日更新日志中公布的是82.7%,后者用的是自家DeepSeek Harness的极简模式。Agent已成为大模型的主流使用场景,单纯的模型能力分数往往不能说明全部问题,真正的能力只存在于系统层级。二. 毒圈缩圈没有二等奖斩杀线意味着斩杀彻底且迅速。一旦落入斩杀范围,模型在市场中往往直接失去竞争力。大模型的切换成本极低。我在《再谈OpenAI:8000亿的估值,建不起的壁垒》中曾分析过:与苹果等拥有网络效应的业务不同,AI大模型的业务架构完全不同——API调用标准化,操作协议(如MCP)开放,开发者可以多渠道并行触达用户,用户也不知道更不在乎底层模型是谁。开发者可以快速且低成本自由切换模型。同时,基础模型层的进步已明显放缓,同质化竞争加剧。同一能力档位的模型之间,只要工程配套完备,切换不会带来交付质量的明显下降。市场份额不随性价比差距线性分配,而是向性价比优者快速聚集。性价比处于劣势的模型,将快速失去商业潜力。“斩杀线”之内没有二等奖,所有模型厂商都必须勇夺第一。不是飞轮,是跑步机即便跟上了,也停不下来。目前,由于模型优化迭代和硬件升级,tokens成本处于快速下降通道。但降下来的成本在激烈的价格竞争中无法转化为利润。2026年7月30日,OpenAI在GPT-5.6的页面上追加更新,将GPT-5.6 Luna的价格下调80%,GPT-5.6 Terra下调20%。次日,DeepSeek发布V4 Flash 0731。只要有一家把降本传导为降价,在“毒圈”不断缩小的威胁下,其余厂商不跟进就得交出市场份额。通过性价比获得的优势可以维持,但难以形成壁垒。我在《再谈OpenAI:8000亿的估
分享
阅读原文