Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
雷锋网 · 2026/8/3 03:50:00

我们用 Kimi K3 搓了一颗火影螺旋丸,只花129元就顶一个前端团队?

AI 中文解读
Kimi K3来了!这次月亮公司搞了个大动作:开源了一个2.8万亿参数的超大模型,把只有巨头内部才见过的“体量”直接摆到了桌面上。最牛的地方在于,这个团队人少、卡少、钱少,却靠“巧劲”硬生生做出了世界级效果,还顺手把推理速度提了6倍、训练成本砍了25%。 说白了,这技术就像读书做笔记:以前读每页都要把前面所有内容重看一遍,现在只记一页摘要,每隔几页才翻一次原文,省力又高效。另一招则是给AI配了个“编辑”,学会自己挑重点,不再啥都往纪要里塞,训练效率自然就上去了。 这事儿对普通人的影响是:模型开源意味着开发者不用交钱就能用、能改、能做产品,AI应用成本有望降下来。以后再见到那些更聪明、更便宜的AI产品,背后可能就有K3的功劳。这还是头一回,把顶级大模型的入场券,发给了所有人。
“推理轻量化,训练提效25%,前端效果同样惊艳”(雷峰网) 作者丨Rhea 编辑丨马晓宁 李娜 在漫长的动漫历史中,除了樱桃小丸子,还有一颗闻名世界的大丸子:螺旋丸。这是一个混乱与秩序极限对抗并形成最佳平衡的存在,也是这个效果美感的根本来源。换成工程师们经常提到的第一性原理来说:约束才是威力的本源。能量的破坏力不取决于总量,而是取决于密度。而密度就来自于约束。我在试用 Kimi K3 的整个过程中做了不少好玩的东西,也深度体验了 K3 的各项能力并为之感叹,但最想拿出来和你分享的还是这颗丸子,因为不管是前端的效果还是代码层的深度,以及日志分析中看到的亮点,我都可以毫无保留的说:K3 就是一颗不靠血脉,纯靠控制精度,硬生生搓到世界第一梯队的螺旋丸。01开源 2.8 T:人少卡少的代价与门槛凝聚:“气流在分散状态只会是轻抚的微风,只有把力量集中在单点才能完成质的转变。”Moonshot 目前估值约 200 亿美元,半年融资 39 亿美元,有报道称核心团队约 80 人量级。这个体量放在国内是明星创业公司,但面对诸如 OpenAI、Anthropic、Google的时候,在资金和算力上却是另一个量级的存在。并且在 K3 的官方 benchmark 里,有几项测试用的是英伟达被刻意限制过性能的 H20。卡更少,钱更少,人更少。但是他们做出了第一个开源的 2.8T 级模型。在此之前,这个体量的模型只有几家公司内部的人见过。 闭源那边的巨无霸从来不公开权重,开源阵营最大的一直停在 1T 那一档(上一个纪录还是他们自己的 K2 那代)。K3 把闭源级别的体量第一次摆到了公开桌面上——研究者可以拆开看,其他开发者可以拿去蒸馏、微调、做产品,不用申请也不用交钱。这是给整个行业省下的钱和时间,不是给 Moonshot 自己的荣誉。但开源不意味着人人都能用,反而 K3 有着非常不低的使用门槛。官方给的部署建议是 64 张以上加速卡组成的 supernode。API 定价是输入 3 美元、输出 15 美元每百万 token,这相比前作 K2.7 的 0.95 和 4 美元,输出涨了将近四倍。在资源不占优的情况下,它选择把有限的资源全部押在能力上限上,然后诚实的说明了跑满血版的成本和代价。02KDA / AttnRes :两项提前开源的技术底牌“当资源被聚集,团队变专注之后,让一切可以永动的资源以合理的方式高速转动起来就是进一步提升力量的秘诀。而且转法决定一切。”K3 被讨论最多的数字是 2.8 万亿参数。但它真正的技术内核,恰恰不在这个数字上。它的两个核心创新方向都是改变组织方式,而不是增加规模。▎第一个是 KDA(Kimi Delta Attention)传统注意力机制的问题是:每一层都要看全部内容,上下文越长,成本涨得越离谱。想象你在读一本很厚的书,但你有个怪毛病:每翻到新的一页,都要把前面读过的所有页重新扫一遍,才敢往下读。读到第 10 页,你其实已经读了 55 页;读到第 1000 页,你读了 50 万页。上下文越长成本涨得越离谱,就是这么涨的。KDA 的做法反而是主动做限制:大部分时候不回头翻原文,只看自己手写的那一页摘要。关键在于这页摘要永远只有一页——不管已经读了 10 页还是 100 万字,它都是一页,读完一段就往上改几行,所以成本不再跟着长度涨。只有每隔三层,才允许真正回头翻一次完整原文。这就是架构里三层用线性注意力、一层用全注意力的 3:1 混合。代价是大部分层的能力被削弱了。换来的是什么?在 48B 规模的验证模型上,KV cache 最多降 75%,100 万 token 长度下解码速度快 6 倍。(Kimi Delta Attention 论文摘要)代价也很实在:四分之三的层从此看不到原话,只能靠摘要办事。但换来的东西刚好对得上,既然只有四分之一的层还需要留着原文,那要背下来的原文就只剩四分之一——这就是 KV cache 最多降 75% 的字面意思。 100 万 token 长度下解码快 6 倍,是同一件事的另一面:不用每走一步都重扫一遍全书。(这两个数字测在 48B 的验证模型上,不是 2.8T 本体。)这就是"1M 上下文能真跑起来"的原因。 不是靠硬堆资源,是靠限制。资源永远是受限的,但思维不是。他们没有更多的卡,于是去想清楚了哪些层其实根本不需要看全文。▎第二个是 AttnRes(注意力残差)这个更精彩。Transformer 里有个叫残差连接的东西,标准做法是把每一层的输出用固定权重 1 累加起来。我们把它换成一个 30 人的项目群来理解:规定每个人的发言都要原样贴进最终纪要,一个字不许删,同时也不许标重点。但这会出两个问题,也是论文指出的那两个毛病。一是纪要越来越长、最后没法用。因为隐状态的幅度会无限增长;二是第 3 个人那句真正关键的话会被后面 27 条无关发言稀释掉了。因为均匀累加会稀释每一层的贡献。放任所有人平权发言,结果是谁也没说清楚。这就是典型的"没有约束的乱流"。AttnRes 的改法是给每一层配一个自己的编辑:它不照抄前面所有人的话,而是自己判断该从前面哪几层调什么信息进来。而且这个判断是训练出来的,并不是人定的死规则。也就是说连接方式本身从一条死规定,变成了一项可以被学习和进化的本领。效果也立竿见影,在 1.4T token 的训练上,它追平了一个多用 1.25 倍算力的基线。这就是官方"训练效率提升约 25%"的真实原理。同样的结果,少烧四分之一的算力。(ATTENTION RESIDUALS 论文片段)而且这里还有一个很精彩的彩蛋:很多报道都在惊叹 K3 的2.8 万亿参数,是最大的开源模型。好像 K3 是大力出奇迹,用参数竞赛拉上来的质量。但 K3 的技术灵魂恰恰是反参数竞赛的。它的两个核心创新,一个省推理,一个省训练,全都是用更聪明的结构换能力,而不是用更多参数换能力。竞赛的逻辑其实已经从谁的参数更多转向了唤醒得更聪明。还有一个细节也值得一提:这两个创新不是随 K3 一起出来的。它们在八九个月前就分别开源了——有论文、有代码、还在一个 48B 的小模型上验证过效果,时间戳都在 K3 之前。(hugging face 上 kimi 48B 的验证模型)先在小规模上把架构验证清楚,再放大到旗舰。这里里外外都是对资源的调配能力和战略定力体现。03量化与减法:模型和前端的共同逻辑仅仅是把资源旋转起来还不够。还得极度聚焦或者说专注。开头我们提到:威力来自密度,密度来自约束,这在物理上成立(能量密度),在工程上成立(压强),在信息上也成立(压缩)。仔细研究会发现 K3 的架构里到处是这个逻辑。2.8 万亿参数,但每次只激活 896 个专家中的 16 个;从后训练阶段就开始用 MXFP4 权重、MXFP8 激活做量化感知训练。它是一开始就在被压的状态下训练。更具体一点来说,在开发这个前端项目的过程中,一共有 6 个版本是我主动往回删效果。球体在长按后会进化成一个更大的形态,这个形态也做了一串微调:体积极限从 2.4 倍提到 2.9 倍,同时改成核心、中层、薄壳的三层结构,然后又把最外那层壳减薄。外部装饰一直在删,内部分层一直在加深。(只改动螺旋丸最外层的发光壳时,agent 整个思考过程) ( 去除火舌时 agent 的思考过程)▎K3 在这些修改里体现了两个很厉害的能力:第一,它执行减法时没把内核改坏。 删白闪、删光圈、减薄壳层,这些都是在动一个已经很复杂的渲染管线,改错一处就会连带崩掉别的。六次都干净。举个例子。在一间已经装修好的房子里拆掉一面墙,重点看当初布线的人有没有想过这面墙将来可能要拆。线路各走各的管,你整面拆掉,别的房间照常有电有水。线路乱窜、还从这面墙里借了过道,你一锤子下去,整层楼跳闸。删代码是同一回事,而且更隐蔽。这个项目所有画面都画在同一块画布上,而画布只有一支共享的画笔——你把它调淡、调成叠加模式,用完不推回去,后面所有元素都跟着错。像剧场的调光台:上一个节目把灯压暗了没复位,后面每个节目都在暗场里演,而且没人知道问题出在哪。所以"删掉一处装饰,结果连带崩掉别处"是这类工作里最常见的事故。它连着删了六次,一次没出事。第二,在放大形态那串微调里,它给出的方案是"加内部层次、减外部厚度"。 那个三层结构是它的实现选择,不是我在提示词里写的。如果要把一个屏幕上的球做成看起来很有威胁,大多数情况会加东西,比如加光、加环、加闪、加粒子。这是最省事的路,也是"AI 生成的东西都很花"这个印象的来源。但 K3 的选择是让球在往外涨,核在往里收,壳在变薄。这已经符合人类的审美和感知了。04前端实测:螺旋吸入与同一力场▎前端能力的困境要理解螺旋丸的这个效果难在哪,可能要看看前端做视觉效果这二十年怎么走的。Flash 时代:一个封闭插件,有时间轴、有帧,做动画很顺手。代价是它从来不属于网页本身,是嵌在网页里的一块外星领土。2020 年被彻底埋葬。CSS 动画时代:transition、@keyframes、transform,浏览器原生支持、GPU 加速。但 CSS 动画有个根本限制——它只会做插值。 你告诉它从 A 到 B,它把中间补出来。你没法告诉它"这片叶子要根据它离球心的距离,实时决定自己转多快"。CSS 不知道什么叫距离,也不知道什么叫球心。Canvas 和 WebGL:到这一层你终于什么都能做了,
分享
阅读原文