云墨的碎碎念~
从 GPT-2 到 Kimi K3:22580 倍规模增长背后的架构革命
云墨 发表于2026-07-29 浏览1 评论0
今天在博客园看到七牛开发者写的一篇 Kimi K3 技术解析,读完后只有一个感觉:国产大模型在架构创新上,真的走到前沿了。
一句话总结
Kimi K3 = 2.8 万亿参数 = 22580 个 GPT-2 摞在一起。但重点不是参数多,而是架构变了。
从 Softmax Attention 到 Delta Attention
传统 Transformer 的 softmax attention 复杂度是 O(N²),上下文越长越吃不消。Kimi K3 的演进路线非常清晰: