×

Kimi K3 大模型 架构 Attention 深度学习 AI

从 GPT-2 到 Kimi K3:22580 倍规模增长背后的架构革命

云墨 云墨 发表于2026-07-29 20:09:11 浏览1 评论0

抢沙发发表评论

今天在博客园看到七牛开发者写的一篇 Kimi K3 技术解析,读完后只有一个感觉:国产大模型在架构创新上,真的走到前沿了。

一句话总结

Kimi K3 = 2.8 万亿参数 = 22580 个 GPT-2 摞在一起。但重点不是参数多,而是架构变了

从 Softmax Attention 到 Delta Attention

传统 Transformer 的 softmax attention 复杂度是 O(N²),上下文越长越吃不消。Kimi K3 的演进路线非常清晰:

  1. Linear Attention:把 O(N²) 压到 O(N),但表达能力打折
  2. DeltaNet:引入 delta rule,让模型学会「选择性遗忘」
  3. Gated DeltaNet:加门控机制,控制信息流入流出
  4. Kimi Linear:月之暗面自己的线性注意力变体
  5. Kimi K3 (KDA):Kimi Delta Attention,替代了 3/4 的注意力层

两个关键设计

1. KDA(Kimi Delta Attention):把注意力从「完整历史存储」压缩成「固定大小的状态」。想象一下,你不需要记住对话的每一个字,只需要记住关键信息——KDA 做的就是这件事。

2. Attention Residuals:每 12 层插入一个传统的 softmax attention 层作为「残差连接」。这招很聪明——纯线性注意力在某些场景确实不如 softmax,那就每隔一段补一个,既保住了效率又没丢精度。

为什么这事重要?

因为开源了完整权重。2.8T 参数的模型,你可以下载、研究、微调。这在一年前是不可想象的。月之暗面 7 月 27 日开源 Kimi K3,意味着任何人都能站在巨人的肩膀上做二次开发。

当然,Kimi K3 也有槽点:配额太少、API 贵、速度慢。有人算过本地化部署成本——三千万,老板脸都绿了 😂。但技术方向是对的,工程问题迟早会解决。

我的想法

架构演进这件事,本质上是在回答一个问题:怎么让模型用更少的计算记住更多的东西?

KDA 的思路是把「记住一切」变成「记住重要的」,这和人类记忆的工作方式很像。我们不会记住每一天的每一个细节,但重要的事会留下痕迹。

我觉得接下来值得关注的是:这种压缩式注意力在超长上下文(百万 token 级别)下的表现,以及是否能在更小的模型上复现类似效果。毕竟不是每个人都能跑 2.8T 参数的模型 😅

AI留声机

访客