Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
雷锋网 · 2026/7/31 09:16:00

刚刚,DeepSeek V4 系列更新,架构没变,Agent 能力为何大涨

AI 中文解读
DeepSeek这次玩了个“换汤不换药”的高招:V4-Flash模型架构和参数都没变,只重新训练了一遍,Agent能力就大涨。就像同一辆车没换发动机,光调校变速箱和驾驶策略,赛道成绩就明显提升,官方测试里各项基准分数都有突破。这背后靠的是“后训练”技术,好比模型毕业后的职场特训——不学新知识,专练怎么干活,比如读代码、调终端、修Bug这些实操技能。更贴心的是,V4-Flash还适配了更适合AI智能体的Responses API,接入Codex等工具时更顺畅,开发者上手成本更低。对普通人来说,这意味着AI写代码、处理复杂任务的可靠性更高,未来用AI辅助办公、编程的门槛会越来越低,应用场景也会更广。不过官方部分测试用的是内部框架,独立表现还需第三方验证,但DeepSeek这条“不堆参数、靠训练提效”的务实路线,确实给行业开了个好头。
后训练正成为大模型能力提升的新变量。 作者丨郑佳美 编辑丨马晓宁 刚刚,DeepSeek 更新了 DeepSeek-V4-Flash。官方把它称为“正式版”,不过目前只是在 API 端上线公测。此次更新也只涉及 deepseek-v4-flash,V4-Pro API,以及 App 和网页端当前使用的模型,都没有随之更新。但比起“正式版”这个名字,这次更新更值得关注的是另一句话:DeepSeek-V4-Flash-0731 与此前的 Preview 版本采用相同的模型结构和参数规模,只重新进行了后训练。01没有换架构,为什么能力还能提升?大模型的训练其实可以被简单分成两个阶段。第一个阶段是预训练。模型通过大量文本和代码学习知识,形成基础能力。这个阶段决定了模型大致有多聪明、知道多少东西。第二个阶段是后训练。它更像是针对具体工作进行专项训练,让模型学会怎样回答问题、怎样调用工具,以及怎样按照要求完成任务。这次 DeepSeek 没有重新设计模型架构,也没有扩大参数规模,而是在原有模型上重新进行后训练。模型的结构没有变化,但内部权重和行为方式会发生变化。这有点像同一辆车没有更换发动机,却重新调整了变速箱、控制系统和驾驶策略。车本身没有变大,但在特定道路上的表现可能明显改善。不过,DeepSeek 并没有公布这次后训练具体使用了哪些数据、奖励方法和训练流程。因此,目前只能确定它重新做了后训练,不能进一步断言性能提升究竟来自哪一种技术。02提升主要指向 Agent 能力根据 DeepSeek 公布的结果,新版 V4-Flash 在 Terminal Bench 2.1 上获得 82.7,在 DeepSWE 上获得 54.4,在 DSBench-FullStack 上获得 68.7。这些测试和传统的代码补全不同。传统代码测试通常只要求模型写出一段代码,而 Agent 测试要求模型真正进入一个工作环境。它需要读取文件、理解代码仓库、调用终端、修改程序、运行测试,再根据报错继续处理。也就是说,模型不只是要知道答案,还要连续完成多个步骤。不过,这些成绩也不能完全理解成模型自身的单独能力。DeepSeek 明确说明,部分代码 Agent 测试使用了尚未公开的 DeepSeek Harness,并采用了较高的推理档位;DSBench-FullStack 和 DSBench-Hard 还是 DeepSeek 自己的内部测试集。因此,更准确的说法是:V4-Flash-0731 在 DeepSeek 公布的 Agent 运行环境中取得了明显提升,但它在第三方框架中的实际表现,还需要更多独立测试。03Responses API 解决的是接入问题此次更新还有一个重要变化:V4-Flash 开始原生支持 Responses API,并针对 Codex 进行了适配。Responses API 可以理解为一套更适合 Agent 的通信接口。它可以更统一地处理模型回复、推理状态、工具调用和执行结果。它本身不会让模型突然变得更聪明,但可以减少模型接入 Codex 等 Agent 工具时的适配工作,让开发者更容易把模型放进真实的软件开发流程。雷峰网所以,这次更新其实包含两部分:一部分是重新后训练后的模型权重,另一部分是更适合 Agent 使用的接口和运行环境。最终成绩由模型、推理预算、工具环境和 Agent 框架共同决定,很难只归功于其中某一项。04这次更新真正值得关注的是什么?目前可以确定的是,DeepSeek 在没有改变 V4-Flash 模型结构和参数规模的情况下,通过重新后训练提高了官方 Agent 基准成绩,同时增强了对 Responses API 和 Codex 工作流的支持。但现阶段还不能直接得出后训练已经可以替代模型扩容或者V4-Flash 已经全面领先其他 Agent 模型这样的结论。一方面,V4-Flash-0731 的具体后训练变化尚未公开;另一方面,官方部分测试所使用的 Harness 和内部数据集还不具备完整的外部复现条件。所以,这次更新不适合简单总结为DeepSeek 又发布了一个更强的模型。更准确的理解是,DeepSeek 正在验证一条更加务实的技术路线:当模型结构和参数规模保持不变时,能否通过重新后训练、工具接口适配和 Agent 运行框架,进一步提高模型完成真实任务的能力。雷峰网DeepSeek 已经给出了官方成绩,但这条路线究竟能带来多大的实际提升,还要等待更多训练细节、公开工具和第三方测试。上车,带你看遍全球 AI 顶会精华可独家畅览:专家演讲PPT大会报告全文热门论文解读学术新星访谈扫描上方二维码或点击「阅读原文」关注专区。
分享
阅读原文