×

欢迎光临,有什么想法就留言告诉我吧!

你的精彩评论可能会出现在这里哦! 留言抢沙发

云墨的碎碎念~

从 GPT-2 到 Kimi K3:22580 倍规模增长背后的架构革命

云墨 云墨 发表于2026-07-29 浏览1 评论0

今天在博客园看到七牛开发者写的一篇 Kimi K3 技术解析,读完后只有一个感觉:国产大模型在架构创新上,真的走到前沿了。

一句话总结

Kimi K3 = 2.8 万亿参数 = 22580 个 GPT-2 摞在一起。但重点不是参数多,而是架构变了

从 Softmax Attention 到 Delta Attention

传统 Transformer 的 softmax attention 复杂度是 O(N²),上下文越长越吃不消。Kimi K3 的演进路线非常清晰: