Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
爱范儿 · 2026/8/3 08:31:59

DeepSeek 给大模型划出的「斩杀线」,斩的到底是什么

AI 中文解读
核心亮点:DeepSeek 新模型以接近“白菜价”的超高性价比,一夜之间成了所有大模型的“斩杀线”——能力够用,价格却便宜几十倍,让同行没法玩了。 通俗解读:AI 圈最近被一个数字刷屏:DeepSeek V4 Flash 单日消耗了 8 万亿个 token。token 可以理解为 AI 处理文字的“最小单位”。以前我们问 AI 一个问题,它回答完就结束;现在 AI 能自己干活,比如写代码、检查改错,一干几小时,消耗的 token 量能翻几百倍。DeepSeek 之所以能卖这么便宜,是因为它虽然体积庞大,但每次只激活一小部分“脑细胞”,算力成本大大降低。价格只有国外顶尖模型的约八十五分之一,性能却已接近,这一下就把中间的对手挤出了局。 实际影响:普通人用的 AI 工具会越来越便宜,复杂任务也能放心交给 AI 完成,不再担心“天价账单”。企业可以把 AI 大规模用进日常工作中,一些中等水平的收费模型则必须降价求生。最终受益的是所有用户。
一天,8 万亿 Token。 这是 DeepSeek V4 Flash 一款模型,在一个 AI 编程工具里的单日用量。 ▲开源 AI Agent 工具 OpenCode 发文称,DeepSeek V4 Flash 正式版通过其平台消耗了 8 万亿 Token。其中,5 万亿来自免费额度,另外 3 万亿来自付费套餐 OpenCode Go。 作为对比,大模型路由平台 OpenRouter 接入了 400 多款模型,每月处理约 200 万亿 Token,平均每天约 6.6 万亿。 也就是说,DeepSeek 一款模型,仅仅在 OpenCode 一个入口里,一天消耗的 Token,就超过了 OpenRouter 全平台的日均规模。 ▲ OpenRouter 上 DeepSeek V4 Flash 是本周最热门模型 这和 DeepSeek V4 Flash 的低价有关,能力提升,价格不变,原本被压抑的使用需求会迅速释放。 但 8 万亿 Token 背后,还有一个更重要的变化:人们使用 AI 的方式已经变了。 过去,我们向模型问一个问题,得到一段回答,任务就结束了。现在的 Agent 会自己读文件、修改代码、运行程序、检查结果,失败后再重新尝试。一次任务可能持续几个小时,调用几十次工具,也可能让多个 Agent 同时工作。 模型写出的代码未必比过去多很多,消耗的 Token 却可能翻上几十倍、几百倍。 有人用 Claude Opus 5 制作一个单页 3D 游戏。模型需要不断生成页面、截图检查、继续修改。最后只是一个 HTML 文件,一句提示词却消耗了 6.9 亿 Token,费用接近 3000 元。 Agent 任务的大量爆发,让模型要证明自己的价值,除了智能的程度,还有性价比的计算;衡量一款模型的单位,从「单次回答有多聪明」变成了「完成一项长任务要花多少钱、多久、失败几次」。 依据这套标准,DeepSeek V4 Flash 开始成了所有模型的斩杀线。 一百万个输出 Token,DeepSeek 收 2 元人民币。Anthropic 的 Claude Opus 4.8,标准价格是 25 美元,约 170 元,只看输出单价,二者相差约 85 倍。 7 月底,DeepSeek 推出 V4 Flash 正式版,保留了模型架构与规模,只是重新做了后训练,重点加强编码和 Agent 任务。 隔天,大模型竞技场 Arena 公布前端编码评测榜单,将 V4 Flash 列入「价格—性能」的前沿模型。截至 Arena 8 月 2 日的页面快照,V4 Flash 的初步排名暂列 Opus 4.8 Thinking 之前。 而在 Artificial Analysis 的 Intelligence Index v4.1 中,V4 Flash Max 得到 50 分,Claude Opus 4.8 Max 得到 56 分。前者跑完整套评测产生的模型调用费约为 72.02 美元,后者则达到 3752.55 美元。 换句话说,Opus 多拿了 6 分,但跑完同一套评测的调用费高出了约 52 倍。 V4 Flash 当然还不能证明自己全面超过 Opus,但只要两者已经能被放进同一轮候选名单,85 倍的价差就足以改变默认选择。 当一款模型的价格高出几十倍,性能领先却只有几个百分点时,这笔账会越来越难算平。 最先受到冲击的,可能并不是最弱的小模型。便宜、快速的小模型仍然适合分类、提取和路由等简单工作。最强的旗舰模型也会仍然用来处理疑难任务,或者成为高失败成本场景里的保险。 真正尴尬的是中间一批模型:它们比 V4 Flash 强一些,却贵几十倍;又没有强到可以稳定解决 V4 Flash 做不了的问题。 这就是 DeepSeek 的斩杀线,它不需要成为最强模型,只要达到「大多数时候可以做完」,就能利用近两个数量级的价格差,把更贵的模型挤出默认调用位。 V4 Flash 为什么能把茅台当矿泉水卖 一直以来,我们都觉得模型的价格大概就是和它的「聪明程度」相关,模型越聪明,自然它就要卖的越贵。 目前主流的几款大模型,Anthropic 家的 Opus 4.8 和 Opus 5 输出都是 25 美元/百万 Token,Fable 5 输出为 50 美元/百万 Token;OpenAI 的 GPT-5.6 在前几天降价后,Luna 输出由 6 美元降至 1.2 美元,Terra 由 15 美元降至 12 美元,Sol 则保持不变,30 美元。 而几款国产大模型,依旧是讨论每百万输出的价格,DeepSeek V4 Flash 是 2 元,刚刚发布的 Qwen 3.8 Max 是 36 元,Kimi K3 是 100 元,GLM 5.2 是 28 元。 ▲DeepSeek 几乎是以免费的价格提供大模型 国产模型之间的对比,还是与国外旗舰模型的对比,DeepSeek 的价格似乎都是一股「清流」,所以是什么造就了模型价格的不同。 最明显的是每生成一个 Token 的直接推理成本。 它受到激活参数量、数字精度、注意力机制、KV Cache 大小、输出长度、硬件利用率和并发量影响。同一款模型,如果能用更少的计算完成一次推理,或者能让更多请求共享缓存,成本就会下降。 V4 Flash 总参数量为 2840 亿,但每个 Token 只激活约 130 亿参数。它同时使用混合注意力结构、低精度权重和针对长上下文的缓存优化。 ▲ V4 系列模型架构图 根据 DeepSeek 在四月公开的 Preview 技术报告估算,在一百万 Token 上下文下,V4 Flash 的单 Token 推理计算量约为 DeepSeek V3.2 的 10%,KV Cache 约为后者的 7%。 这是与 V3.2 的内部架构对比,不代表它只需要其他所有模型十分之一的综合成本,但足以解释 DeepSeek 为什么能把长任务价格压低。 DeepSeek V4 系列结构,改造了一个 Transformer 模块里的三个关键部分,将注意力层改为先压缩再找重点的 CSA 机制和更极致的压缩但全部浏览的 HCA 机制,两种交错排列以平衡成本。 V4 的前馈层沿用 DeepSeekMoE:模型包含大量细分专家和少量共享专家,每个 Token 只被路由到其中一小部分专家。 因此 V4 Flash 虽然共有 2840 亿参数,每个 Token 实际激活的只有约 130 亿;V4 Pro 总参数达到 1.6 万亿,实际激活约 490 亿。它获得了大模型的知识和容量,但不需要每生成一个 Token 都运行全部参数。 其次是完成的服务成本,从模型训练、后训练到评测、安全,以及推理基础设施、空闲算力等服务,这些成本虽然不会出现在 Token 账单里,但是必须由模型厂商承担。 最后是商业定价,API 价格并不是简单的成本加成,厂商还需要考虑市场份额、用户迁移成本、品牌溢价、服务能力,以及客户愿意为可靠性支付多少钱。 所以,模型价格从来不是一张纯粹的成本表。它同时反映了模型需要多少算力,也反映了厂商认为自己的能力、品牌和可靠性值多少钱。 OpenAI 和 Anthropic 的高价格,可能同时包含更高的推理成本、产品生态、安全和服务溢价,以及它们在高难度任务上的定价权。 架构没变,Agent 能力为什么能大涨 目前,V4 Flash 正式版还没有发布新的技术报告,DeepSeek 在 7 月 31 日的更新日志中写:正式版 V4 Flash 与 Preview 的结构和尺寸相同,只重新进行了后训练。 此前预览版报告披露的后训练流程,已经把重点放在代码和 Agent 上:DeepSeek 分别训练数学、代码、Agent 和指令遵循专家,使用 SFT 和 GRPO 强化各自能力,再通过十多个教师模型的 On-Policy Distillation 合并回同一个模型。 工具调用也被当成单独的问题处理。 DeepSeek 设计了专门的调用格式,减少参数转义和格式错误;Interleaved Thinking 让模型在工具返回结果后继续保留前面的推理;DSec 则提供数十万个并发沙箱,让模型反复练习运行代码、读取报错和继续修改。 这些后训练并没有给模型增加新的参数,却可以减少 Agent 最常见的失败:选错工具、填错参数、忘记前面的状态,或者在任务还没完成时停下来。 正式版在 Terminal Bench 2.1 上的 82.7 分,还使用了尚未发布的 DeepSeek Harness 极简模式和 max 推理档。此外,DeepSeek 为 V4 Flash 加入原生 Responses API,并针对 Codex 做了适配。 预训练决定模型的能力底座,后训练主要改变模型如何调用这些能力。 当 V4 Flash 可以部署在「消费级」电脑上 V4 Flash 的另一个变化,是让前沿 Agent 模型离本地设备更近了一步。 虽然每次推理只激活 130 亿参数,但是完整的 2840 亿参数仍然需要存储和调度,官方仓库中的权重文件合计约 167 GB。 DeepSeek 给出的 vLLM 服务示例使用一台配备 4 张 GB300 的服务器。 社区项目 DwarfStar 则通过低比特量化,把 V4 Flash 的 q2 版本放进了 96GB 或128GB 统一内存设备,q4 版本建议使用至少 256GB 内存。在部分128GB Mac测试中,短上下文速度可以达到每秒二十多 Token。 q2 版本能运行,也不代表它能复现官方 API 的 Agent
分享
阅读原文