2026/7/23 9:54:30

把 100 万 token 显存砍掉四分之三,聊聊 Kimi K3 的 Delta Attention 和工程美学

把 100 万 token 显存砍掉四分之三,聊聊 Kimi K3 的 Delta Attention 和工程美学 最近这两天大模型圈子被 Kimi K3 那个 2.8 万亿参数、896个专家的巨无霸 MoE 给刷屏了。大家都在算这得烧多少显卡算力有多恐怖。但作为一个天天在服务器端跟显存带宽、算力调度死磕的工程架构师我盯着技术报告看了一通最让我激动的根本不是参数多大而是他们底层的注意力架构。Kimi 官方披露的信息里提到了他们上线的一个叫 Kimi Delta Attention也就是 KDA 的机制 [1]。你如果跑过超长文本推理一定被那个像噩梦一样的 KV Cache 折磨过。传统的 Transformer 模型注意力计算复杂度是O(N2)O(N^2)O(N2)序列每翻一倍计算量和内存占用就翻四倍。你想跑 100 万 token 的上下文那对不起即便是 Multi-Head Latent Attention 这种已经极度优化过 KV 缓存的架构显存也得直接被塞爆。那月之暗面是怎么在 100 万 token 下把 KV 缓存砍掉百分之七十五解码吞吐量还提升了六倍的这事得从前几年学术界折腾的线性注意力说起。线性注意力也就是 Linear Attention这玩意理论上很美妙能把复杂度直接降到O(N)O(N)O(N)。但为什么前几年工业界几乎没人敢在旗舰模型里大规模用其实就是记忆遗忘问题。线性注意力在传递信息的时候就像是用一个漏勺去舀水。虽然水流得快但模型很容易失忆根本分不清什么是重点一旦做稍微复杂的逻辑推理或者代码检索智商就断崖式下跌。后来大家开始想办法在状态更新上下功夫搞出了 DeltaNet然后演进到 Gated DeltaNet [3]。这底层的数学逻辑挺有意思它把模型对历史状态的更新看作是一个在线梯度下降的过程。每次有新的输入它不仅是简单地把信息往里堆而是会根据当前的输入去「纠正」或者「擦除」旧的信息。这就好比你在本子上记笔记发现前面的内容记错了或者现在的信息更重要你会拿橡皮擦把旧的擦掉重新写而不是无脑地往后续写。但这东西在工程落地时依然面临很大的坎。Kimi 的团队在 Gated DeltaNet 的基础之上做出了 KDA [2]。他们在工程和数学的交叉点上解决了两个很头疼的问题。第一件是把门控机制做到了通道级也就是 Channel-wise Gating。以前的 Gated DeltaNet 太粗糙了每个注意力头只能共用一个标量衰减权重相当于每次擦除记忆都是一刀切。KDA 引入了细粒度的通道控制每个特征维度都可以独立决定自己要遗忘多少。你想想看这就像是你的本子上不同学科、不同重要度的词能用不同的橡皮擦去涂改有的保留有的擦掉记忆的精度一下子就提上来了。第二件是针对硬件效率的底层重构。线性注意力在理论上省算力但在 GPU 实际运行中尤其是 Tensor Core 上跑得极其难受。传统的更新公式里有很多碎步子的矩阵乘法没法并行算力根本压榨不出来。为了搞定这块KDA 引入了一个叫对角加低秩也就是 DPLR 矩阵转换的变体 [2]。他们利用数学技巧把复杂的长序列更新拆解成对角矩阵和两个小矩阵的相乘把原本不规则的计算变成了极度适合 Tensor Core 的运算。我看到这个设计的时候真的惊叹这简直是数学美感跟硬件特性的完美结合。结果也是实打实的长序列解码吞吐量直接翻了六倍显存占用暴降。说到这其实还有个很多人容易忽视的细节就是他们并没有把所有层都无脑换成 KDA。这非常符合工程师的务实心态要是全换成线性的模型智商再怎么优化也得掉。Kimi 采用的是混合注意力架构 [1]。比如按照三比一的比例三层轻量级的 KDA搭配一层重量级的 Multi-Head Latent Attention也就是 MLA。这就像我们在公司做项目KDA 负责在海量背景资料里做粗筛和高效的信息压缩把大意记在脑子里而 MLA 负责在关键节点上做最精确的跨长程检索。好钢用在刀刃上难怪 100 万 token 能跑得又快又准。而且在信息传递上他们还引入了一个叫 Attention Residuals也就是残差注意力机制 [1]。传统 Transformer 里底层抽出来的特征越往上传越容易被稀释。这个机制允许模型在深层直接去检索底层的原始细节防止那些重要特征在深层被彻底遗忘。除了注意力Kimi K3 这次能塞下 2.8 万亿参数背后的 Stable LatentMoE 也挺有意思。调过大模型 MoE 的兄弟肯定懂那个痛专家一多路由极其难做。很容易出现有的专家被塞满、有的专家闲得长草最后模型不仅跑得慢还特别容易在训练中途 loss 突降然后直接出 NaN。Kimi 这套框架通过在潜在空间进行 Token 的路由和计算极大降低了内存带宽的压力。更骚的是他们用了一种叫分位数均衡的机制动态地在训练过程中平衡专家的负载让 896 个专家各司职只激活其中 16 个。这种极致的稀疏性才让 2.8 万亿的模型在推理时能算得过来。说实话看完整套技术方案我的感触挺深的。美国很多团队在拼算法极限、拼大算力硬推而国内像月之暗面这种团队展示出了极强的「算力平民化」倾向。他们是通过极具巧思的数学推导、对底层硬件的压榨以及混合注意力的折中把长文本和超大参数的成本打下来。这才是真正的工程美学。很多时候颠覆性的改变往往就发生在这一个个枯燥的矩阵拆解、显存优化以及对 Tensor Core 特性的精细计算里。大模型的下半场也许真的需要更多这样接地气、重落地的硬核工程突破。以上既然看到这里了如果觉得不错随手点个赞、在看、转发三连吧如果想第一时间收到推送也可以给我个星标⭐谢谢你看我的文章我们下次再见。参考文献与资料[1] Moonshot AI Official Blog, “Kimi K3 Technical Highlights Announcement”, 2026.[2] Kimi Team, “Kimi Linear: An Expressive, Efficient Attention Architecture”, arXiv:2510.26692, 2025.[3] Songlin Yang, Jan Kautz, Ali Hatamizadeh, “Gated Delta Networks: Improving Mamba2 with Delta Rule”, arXiv:2412.06464, ICLR 2025.[4] Ali Hatamizadeh, Yejin Choi, Jan Kautz, “Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention”, arXiv:2605.22791, 2026.