展开目录
#Kimi#Moonshot#模型架构#开源模型#MoE#注意力机制#技术深度分析

Kimi K3 技术报告深度拆解:3T 模型的三个维度与「自举进化」

Berryxia.AI 万字拆解 Kimi K3 47页技术报告——KDA 序列方向、AttnRes 深度方向、Stable LatentMoE 宽度方向,以及模型给自己造芯片、写编译器、剪宣传片的超现实案例。

预计阅读 9 分钟

一句话总结

Moonshot AI 发布的 Kimi K3 不仅是全球首个开源 3T 级模型,更在技术报告里展示了三个维度的架构创新——KDA 线性注意力、AttnRes 深度互联、Stable LatentMoE 极稀疏路由——以及一个令人后背发凉的信号:模型已经开始帮自己造芯片了。


一份坦诚得反常的技术报告

一份技术报告,开头第二段就承认自己打不过对手,这不常见。

Kimi K3 的技术报告就是这么开场的。它白纸黑字写道:整体性能仍落后于最强的两个闭源模型,Claude Fable 5 和 GPT-5.6 Sol。一个团队花几个月、烧掉天文数字算力做出来的旗舰模型,报告的第一件事是”认怂”。

但往下读你会发现,这份坦诚背后站着的东西一点都不软。

2.8 万亿总参数——全球第一个开源的 3T 级别模型。原生多模态。100 万 token 上下文。更关键的是报告里藏着的一句话:在 K3 开发后期,一个还没发布的 K3 早期版本,已经在承担团队大部分的 GPU 内核优化工作了。

一个还没出生的模型,在帮着优化生它的那条流水线。


一个模型,三个维度同时长大

传统上把模型做大,思路是堆层数、堆参数。K3 的设计完全不一样——它让信息沿着三个方向同时流动

  • 序列方向:用 KDA(Kimi Delta Attention)让注意力计算从平方降到线性
  • 深度方向:用 AttnRes(Attention Residuals)让 93 层的网络每一层都能回看之前所有层
  • 宽度方向:用 Stable LatentMoE,从 896 个专家里每次只挑 16 个干活

这三招合起来,换来一个硬指标:相比上一代 K2,扩展效率提升约 2.5 倍。也就是说,K3 用一份算力干的活,K2 得用两份半才能追上。在动辄烧掉上亿美元训练成本的年代,这个倍数直接决定了一家公司烧钱的性价比。


序列方向:KDA 让长文本变便宜

大模型读长文本,最大敌人是成本。标准注意力每多读一个词,都要拿它跟前面所有词两两比对——计算量随着长度平方级暴涨。读 100 万 token 的文档,光注意力就能把显存和时间烧穿。

K3 的解法是 Kimi Delta Attention(KDA),一种线性注意力机制。它给模型配了一个”可调的遗忘笔记本”——新信息进来只往笔记本上改几笔,不用每次都翻全本。哪些旧信息该淡忘、哪些该保留,模型自己学。

但纯线性注意力有个短板:有时会漏掉需要精确翻查的细节。所以 K3 用了一个聪明的策略——每隔三层 KDA,插一层 Gated MLA 做全局注意力兜底,网络最后一层一定是 Gated MLA。省钱的活交给 KDA,较真的活交给 MLA,三比一搭配贯穿整个网络。

这套组合还带来一个意外好处:K3 不靠传统位置编码,而是靠 KDA 的遗忘和衰减机制隐式地记住顺序。这意味着它能直接外推到 100 万 token,不需要任何位置编码上的魔改。


深度方向:AttnRes 让 93 层不失联

常规深层网络有个隐忧:信息一层一层往上传递,传到几十层之后,最底层学到的东西可能早被稀释得差不多了。就像一个消息在一百个人之间口耳相传,传到最后一个往往对不上原话。

K3 用 Attention Residuals(AttnRes) 解决这件事。它让网络中每一个模块都能越过中间所有层,直接回头调取最初的输入、以及之前任意一个模块的输出。

打个比方:普通网络像流水线上的工人,只能拿到上一个工位递过来的半成品。而装了 AttnRes 的工人,随时能调出仓库里的原材料和之前任何一道工序的成品,按需取用。

对于 K3 这种 93 层的深层模型,这个能力至关重要。信息访问不再是单线接力,而是一张可以按需检索的网。底层学到的原始信号,到了顶层依然能被精准调用。


宽度方向:896 专家只唤醒 16 个

第三个方向是 MoE(混合专家模型)。K3 的 Stable LatentMoE 把路由专家扩到 896 个,每个 token 只激活 16 个——激活比例不到 2%,极度稀疏。

稀疏度拉到这么高,训练容易出乱子。最典型的是专家分配不均:有些被抢着用、累到冒烟,有些常年闲置、白占参数。

K3 的解法是 Quantile Balancing——直接从路由分数的分位数推导专家分配,砍掉了传统方法里那个又敏感又难调的平衡超参数。配合归一化和新的激活函数 SiTU-GLU,才把这么稀疏的模型在训练时摁稳。

一句话总结这三个维度:K3 不是简单把模型堆大——它是想清楚了信息在巨型模型里会在哪几个方向卡住,然后一个方向一个方向地把管道拓宽。


从 K2 到 K3:2.5 倍的效率跃升

具体数字上,K3 总参数 2.78 万亿,但每次只激活 1042 亿。这个区分很重要——总参数决定模型见识的上限,激活参数决定它跑起来的实际开销。K3 相当于一个见多识广的巨人,但每次只调动身体一小部分肌肉。

视觉上,K3 不是先训好语言模型再把视觉模块焊上去——它是原生多模态,从训练第一天起文字和图像的 token 就交织在同一个预测目标里。视觉编码器 MoonViT-V2 有 4 亿参数,能处理 3584×3584 像素图像。


一百万 token 上下文是怎么炼成的

上下文从 K2 的 12.8 万直接干到 K3 的 100 万,这不是改数字就行。

团队先清洗掉海量重复截断的垃圾长文本,刻意上采样优质长文档,免得训练时被短文本淹没。然后合成了一批特殊的长上下文数据——把多个文档和子任务打乱拼接,埋下的任务只有跨越整个 100 万 token、把散落各处的信息串起来才能解。

训练时上下文窗口分四个阶段慢慢撑大:预训练期从 8K 到 64K,冷却期从 256K 到 1M。把最烧钱的超长序列计算集中在后期一小段,既省成本,又让模型循序渐进适应长距离依赖。


九个专家,蒸成一个

后训练阶段,K3 的强化学习铺得很广。横跨三大领域(通用任务、通用智能体、编程智能体),每个领域配三档思考强度(低、高、最高),三乘三,一共练出 9 个专家模型

但用户不能面对九个模型自己挑。K3 用多教师在线策略蒸馏,把这九个专家的本事统统压进一个统一模型里——九个各有所长的老师同时带一个学生,学生最后一个人顶九个。

还有个工程细节:K3 从 SFT 阶段就做量化感知训练(QAT),权重用 MXFP4、激活用 MXFP8。好比运动员平时就穿着比赛装备训练,正式上场时不会因为装备变化而失常。


能打,且便宜得离谱

K3 的整体定位很清楚:落后于 Fable 5 和 GPT-5.6 Sol,但对其余所有模型保持领先。

但在几个具体项目上是全场第一:

基准K3 成绩说明
SWE-Marathon42.0超长软件工程任务,全场最高
BrowseComp91.2网络浏览搜索,全场最高
OmniDocBench91.1文档解析,超过所有闭源模型
WebDev Arena1678 Elo首个登顶该榜的开源模型

但 K3 最有杀伤力的地方是成本。在 Kimi Code Bench 2.0 上,它只比 Fable 5 低 4 分,成本却只有对方的 38%。在 BrowseComp 上,每个任务只花 2.03 美元——是 GPT-5.6 Sol 的一半,比 Claude 系列在最高强度下便宜一个数量级。

对一个开源模型来说,能打是本分,又能打又便宜才是杀招。


它已经开始给自己干活了

技术报告最后一部分最超现实。

K3 给生产 K3 的流水线优化 GPU 内核——把一个 AttnRes 内核延迟从 283.6 毫秒压到 114.4 毫秒,另外两个内核分别提速 55% 和 74%,成绩追平带回退的 Fable 5。

K3 从零写了一个类 Triton 的编译器——从 DSL 前端、中间表示优化,到 PTX 代码生成和运行时,完整链路,某些工作负载上性能还超过了 Triton 本身。

K3 给基于自己架构的 nano 模型设计了一颗推理芯片——48 小时完全自主运行,用开源工具完成构建、优化和验证,4 平方毫米内跑到 100 MHz、每秒 8700 多 token 的解码吞吐。

科研上,K3 审阅了 20 多篇天体物理论文、评估了 300 多个状态方程、写了 3000 多行 Python,顺手揪出已发表公式的错误——全程约 2 小时,有经验的研究员干这个要一到两周。

K3 甚至用原生多模态能力剪了一支自己的发布预告片,还做了一期 3Blue1Brown 风格动画讲解自己的架构。 一个模型,给自己做科普。


结语:前沿的门,第一次对所有人敞开

回到开头那个反常的开场。一份技术报告为什么敢在第二段就承认打不过对手?

读完 47 页你会明白——因为它手里的牌,根本不需要靠话术来撑。全球第一个开源 3T 模型,一块自己设计的芯片,一个从零手搓的编译器,还有五分之一的旗舰价格。承认与 Fable 5 的差距,反而把开源阵营最强这件事衬得无可辩驳。

报告结论里有一句话很耐人寻味:尽管与最强闭源模型的差距仍在,K3 建立起了一个新的开源前沿——一个人人触手可及的前沿

过去很长一段时间,“前沿”是个封闭的词,被锁在几家巨头的服务器里。而这份报告说的是:从现在起,那道门向所有想研究、想部署、想创新的人打开了。

更值得琢磨的是那个反复出现的自举信号。K3 优化了生产 K3 的内核,K3 给基于自己架构的模型设计了芯片,K3 讲解了自己的架构。一个模型开始参与构建它自己的下一版——这件事正在从科幻概念,变成技术报告里一行行朴素的记录。


参考资料:Kimi K3 Technical Report · Moonshot AI | 分析来源:Berryxia.AI 技术报告拆解 封面图由 AI 生成,统计时间:2026-07-29

Related

相关文章

延伸阅读

查看全部 →