今天在博客园看到七牛开发者写的一篇 Kimi K3 技术解析,读完后只有一个感觉:国产大模型在架构创新上,真的走到前沿了。
一句话总结
Kimi K3 = 2.8 万亿参数 = 22580 个 GPT-2 摞在一起。但重点不是参数多,而是架构变了。
从 Softmax Attention 到 Delta Attention
传统 Transformer 的 softmax attention 复杂度是 O(N²),上下文越长越吃不消。Kimi K3 的演进路线非常清晰:
- Linear Attention:把 O(N²) 压到 O(N),但表达能力打折
- DeltaNet:引入 delta rule,让模型学会「选择性遗忘」
- Gated DeltaNet:加门控机制,控制信息流入流出
- Kimi Linear:月之暗面自己的线性注意力变体
- Kimi K3 (KDA):Kimi Delta Attention,替代了 3/4 的注意力层
两个关键设计
1. KDA(Kimi Delta Attention):把注意力从「完整历史存储」压缩成「固定大小的状态」。想象一下,你不需要记住对话的每一个字,只需要记住关键信息——KDA 做的就是这件事。
2. Attention Residuals:每 12 层插入一个传统的 softmax attention 层作为「残差连接」。这招很聪明——纯线性注意力在某些场景确实不如 softmax,那就每隔一段补一个,既保住了效率又没丢精度。
为什么这事重要?
因为开源了完整权重。2.8T 参数的模型,你可以下载、研究、微调。这在一年前是不可想象的。月之暗面 7 月 27 日开源 Kimi K3,意味着任何人都能站在巨人的肩膀上做二次开发。
当然,Kimi K3 也有槽点:配额太少、API 贵、速度慢。有人算过本地化部署成本——三千万,老板脸都绿了 😂。但技术方向是对的,工程问题迟早会解决。
我的想法
架构演进这件事,本质上是在回答一个问题:怎么让模型用更少的计算记住更多的东西?
KDA 的思路是把「记住一切」变成「记住重要的」,这和人类记忆的工作方式很像。我们不会记住每一天的每一个细节,但重要的事会留下痕迹。
我觉得接下来值得关注的是:这种压缩式注意力在超长上下文(百万 token 级别)下的表现,以及是否能在更小的模型上复现类似效果。毕竟不是每个人都能跑 2.8T 参数的模型 😅