Daily Tech Briefing
AI 科技速览
每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。
雷锋网 · 2026/7/28 06:37:00
Kimi K3 发布 47 页技术报告,最有价值的创新点是这些
AI 中文解读
Kimi K3发布了一份长达47页的技术报告,但最吸引人的不是2.8万亿参数或100万token这些惊人数字,而是它从根本上解决了大模型在长文本和复杂任务中“撑不住”的问题——不是靠堆GPU,而是靠重构信息存储和计算调度方式。
简单来说,传统模型处理长文本时,就像把读过的每一页都摊在桌面上,页数一多就装不下了。Kimi K3采用了类似“压缩记忆”的方法,只保留一份不断更新的摘要,大大节省了空间。同时,它还允许模型在不同深度的网络层里“翻看”之前保存的中间状态,而不是只能看到最终结果。此外,模型引入了“限流装置”和“动态分班”机制,防止部分任务卡住整个系统。这些设计让模型在参数规模翻倍的情况下,依然跑得又快又稳。
对普通人来说,这意味着以后AI助手能更准确地处理超长文档、连续几个小时的对话,或者帮你一步步完成复杂的多步骤任务,比如规划旅行、整理几百页的研究报告。它不会因为信息太多而“失忆”,也不会因为某个任务卡顿就拖慢整体速度。Kimi K3的技术思路,也为未来更智能、更可靠的AI应用打下了基础。
它把架构、训练和 Agent infra连接成了一套完整系统。 作者丨郑佳美 编辑丨马晓宁 Kimi K3 发布开放权重,最抢眼的数字有三个:2.8T 总参数、104B 激活参数,以及 100 万 token 上下文。这些数字当然重要,但读完 47 页技术报告会发现,它们更多是技术改造后的结果,而不是这份报告真正值得关注的部分。Kimi K3 想解决的是一个更实际的问题:当模型继续变大、上下文继续变长,Agent 一次工作几个小时以后,原来的 Transformer 架构和训练系统还能不能撑住?上下文变长,KV Cache 会持续膨胀;网络变深,前面几层的信息会被不断混合;专家数量增加,路由、通信和设备负载容易失控;Agent 轨迹越来越长,强化学习又会被少数慢任务拖住。这些问题显然不能只靠增加 GPU 解决。Kimi K3 的技术主线,是把原本会随着规模不断膨胀的计算和状态,改造成可以压缩、可以调度、可以暂停和恢复的结构。它不是简单把 Kimi K2 放大了接近 3 倍,而是在重新设计大模型怎样保存信息、怎样调用计算资源,以及怎样持续完成长任务。01撑住 2.8T 的,不是更多 GPUKimi K3 最核心的三项架构变化,分别处理 Transformer 在序列、深度和宽度上的扩展问题。先看序列。传统注意力需要保存历史 token 的 Key 和 Value。上下文越长,KV Cache 越大。这相当于阅读材料时,把看过的每一页都摊在桌面上。材料不多时,查找很准确;材料达到几十万页后,存储、搬运和读取成本都会迅速增加。Kimi Delta Attention,也就是 KDA,采用固定大小的递归状态保存历史。模型不会完整保留每个 token,而是在阅读过程中不断更新一份压缩记忆。序列继续增长,这份状态不会按照相同比例膨胀。但压缩记忆一定会损失部分细节。全注意力保存的是原始档案,可以直接回看某个具体位置;KDA 保存的更像一份持续更新的摘要,信息在反复写入时可能被覆盖。所以,Kimi K3 没有完全使用 KDA,而是在每个模块中安排 3 层 KDA 和 1 层 Gated MLA,并在模型末尾保留全局注意力。两者的分工很明确:KDA 负责低成本地更新长期状态,MLA 定期重新检查完整上下文。一个负责压缩,一个负责查找,在效率和信息容量之间取平衡。Kimi K3 还调整了 KDA 的衰减参数范围。此前某些衰减值可能变得过小,累计计算后容易超出 BF16 的安全范围,迫使部分计算采用效率较低的特殊 kernel。Kimi K3 给衰减设置了下界,使相关计算可以统一转换成 Tensor Core 擅长的稠密矩阵乘法。这个改动没有提出新的注意力概念,却很能说明 Kimi K3 的技术思路:算法不能只在复杂度公式中更漂亮,还要真正适合 GPU。雷峰网100 万 token 也不能简单理解成“模型能够准确记住 100 万 token”。Kimi K3 使用了从 8K、64K、256K 到 1M 的渐进式训练,并专门构造关键信息分散在不同位置的长上下文数据。上下文窗口代表模型能够处理多长的输入,不代表窗口内的信息都能被无损利用。KDA 解决的是长上下文能否持续运行,而不是彻底消除长距离信息损失。序列变长以后,信息会被压进递归状态;网络变深以后,也存在类似的信息压缩问题。标准残差连接会把每一层的输出不断加到同一个隐藏状态中。这种方式训练稳定,但随着网络加深,前面不同层的信息会逐渐混在一起。到了后面的层,模型拿到的是几十次计算叠加后的结果,很难单独取回早期的词法信息、中间层的结构信息,或者某个阶段形成的局部特征。Attention Residuals,也就是 AttnRes,让当前层能够对前面不同深度的表示进行加权选择。普通残差连接像是把所有修改都覆盖到同一份文件里,只保留最终版本。AttnRes 则保留若干中间版本,后面的网络可以根据需要重新调用。这个思路与 Transformer 取代 RNN 有些相似。RNN 把所有历史 token 压进一个状态,Transformer 允许当前 token 直接读取不同历史位置;AttnRes 则把这种选择机制从序列维度带到了网络深度。为了控制显存和通信成本,Kimi K3 并没有保留全部 93 层的独立输出,而是按照约 12 层一个 Block 进行聚合,再对不同 Block 的表示进行选择。这是一种折中。模型可以重新调用不同深度的信息,但只能定位到某一组层,不能精确读取其中的任意一层。雷峰网AttnRes 使用的查询也主要是每层学习得到的伪查询,并不像标准注意力那样完全由当前 token 动态生成。它比固定残差连接灵活得多,但还不是毫无限制的跨层全注意力。即便如此,AttnRes 仍然可能是 Kimi K3 中最容易被其他模型采用的设计。它不依赖 2.8T 参数,也不必须搭配 KDA 或 MoE,解决的又是所有深层网络都可能遇到的问题。不过,目前还不能断言它会成为新的标准结构。Kimi K3 报告将整体效率提升归因于架构、数据和训练配方的共同变化,没有完整拆分 AttnRes 的独立贡献。它的实际价值,还需要更多外部模型验证。处理完序列和深度之后,还剩下模型宽度。Kimi K3 每层拥有 896 个路由专家,每个 token 选择其中 16 个。更大的专家池可以增加模型容量,但也会同时增加通信、显存读取、激活异常和负载不均衡的风险。普通 MoE 会把完整隐藏状态发送给被选中的专家。激活专家越多,需要传输的数据也越多。Kimi K3 使用 LatentMoE,先把 7168 维隐藏状态压缩到 3584 维,让路由专家在较窄的空间中计算,再映射回完整维度。这样一来,模型可以同时增加专家总数和每个 token 激活的专家数量,又不必让通信量按照完整隐藏维度增长。不过,连续的降维、专家计算和升维容易放大异常激活。Kimi K3 因此在专家聚合后加入 RMSNorm,并使用 SiTU-GLU 代替 SwiGLU。SiTU-GLU 可以理解成一个平滑的限幅装置。数值正常时,它尽量保留 SwiGLU 的特性;数值过大后,增长会逐渐受到限制,从而降低低精度训练中的溢出风险。数值稳定之后,还要解决设备负载。如果大量 token 同时选择少数热门专家,这些专家所在的 GPU 会排队,其他设备却在等待。MoE 的实际速度往往不由平均计算量决定,而由最慢的设备决定。传统方法一般根据专家当前是过载还是空闲,以固定步长调整路由偏置。专家数量接近 900 后,步长小了调整太慢,步长大了又可能在过载和空闲之间反复震荡。Kimi K3 提出的 Quantile Balancing,会根据整批路由分数的分位数,直接估计每个专家需要怎样的偏置,才能接近目标负载。它不是一点点试,而是根据当前分布直接重新计算“录取线”。不过,负载均衡解决的是计算效率,不是专家的能力质量。每个专家收到相近数量的 token,只能避免部分专家过热、部分专家几乎没有训练,不能证明 896 个专家都形成了清晰、有价值的专业分工。在训练系统中,MoonEP 还会为热门专家创建动态副本,使不同设备接收到相同数量的 token。Quantile Balancing 负责算法层面的路由,MoonEP 负责硬件层面的执行,两者一起解决极端稀疏 MoE 最现实的瓶颈。把这三项技术放在一起看,Kimi K3 的架构思路其实很统一:KDA 压缩序列状态,AttnRes 重新调用深度信息,Stable LatentMoE 压缩专家通信。它们分别处理模型变长、变深和变宽之后的信息流问题,目标都是用有限的运行成本,支撑更大的模型容量。02把一次回答拉成 24 小时的执行链架构决定模型能够容纳多少信息和能力,但要让 Agent 连续工作几个小时,真正困难的部分往往发生在强化学习系统里。真实 Agent 任务很少在几步内结束。编程 Agent 需要阅读代码、运行测试、修改文件、等待编译并继续排错;研究 Agent 可能要搜索网页、下载资料、制作表格,再不断核对结论。一条轨迹可能包含数百甚至数千次工具调用。传统同步强化学习会等待同一批任务全部完成。只要其中有几个任务特别慢,整批 GPU 就会被拖住。Kimi K3 使用 partial rollout。只要一部分轨迹完成,系统就先使用这些数据更新模型;尚未完成的轨迹暂停,之后再恢复执行。这让长任务不再阻塞整批训练,却也产生了数据陈旧问题。一条轨迹可能跨过数次模型更新,前半段和后半段不再来自完全相同的策略。Kimi K3 通过逐 token 正则限制每次策略变化,让训练能够容忍这种高度 off-policy 的数据。它接受长程 Agent 训练必然存在异步和延迟,而不是强行维持一个整齐的同步流程。更复杂的问题是保存外部环境。保存聊天记录并不能恢复 Agent 的工作现场。模型可能已经修改了文件、安装了软件、启动了进程,或者生成了大量中间结果。任务恢复时,文件系统和进程状态也需要一起恢复。Kimi K3 的 AgentENV 使用 Firecracker microVM,支持暂停、恢复、复制和快照。报告披露,训练和评估期间一共创建了超过 5100 万个 sandbox。真正重要的不是这个数量,而是 sandbox 可以在等待模型推理时暂停,避免持续占用 CP
分享
阅读原文 ↗