清华博士解读Kimi K3:大模型更多是改良性演进

本期访谈请到清华计算机系博士在读、专注大模型架构与预训练的孙宇涛,带领解读 Kimi K3 的技术报告。他以自己在线性注意力、混合注意力和循环增强模型方面的研究为线索,串联了多项相关工作,勾勒出一条从早期设计到 K3 的技术演进脉络。

在注意力机制上,K3 的一个核心是混合注意力设计——在保持一定比例的全注意力的同时,大量采用线性注意力以提升长上下文处理效率。孙宇涛指出,在大约 3:1(线性:全注意力)的混合下,模型既能保持甚至改善长上下文表现,又能显著提升推理效率。具体实现上,Kimi Delta Attention 将原先的标量衰减细化为 channel-wise 的衰减以提升能力上限,并通过 lower-bound 的设计兼顾 BF16 数值精度与高效的 kernel 实现;Gated MLA 则引入门控以增强训练稳定性;Attention Residuals 与 Hyper-Connections 则为残差连接带来了新的设计维度。

about image

在模型规模与架构方面,K3 采用了 2.8T 参数的 MoE 方案。孙宇涛认为参数量仍是提升模型智力的根本因素,K3 在总体参数、激活参数和百万级上下文容量上同步扩展,体现了有效的 scaling。预训练环节涉及到 Scaling Law 指导、WSD 调度与 RNoPE 的长上下文扩展策略;Stable LatentMoE 用于降低跨设备通信开销,Quantile Balancing 用以实现专家负载均衡。优化器层面,Muon 优化器与对 outlier 的控制被强调——他认为任何优化器都会出现 outlier,严格控制往往需要从模型架构入手。 qy球友会官网

后训练与部署相关的工作同样是重点:K3 采用多教师的 on-policy 蒸馏,基于学生生成样本并结合 partial rollout、reasoning-effort budget control 等类似 RL 的策略来提高蒸馏效率并控制推理成本;同时还做了面向部署的后训练和 Draft Model 微调。基础设施方面涉及到 KDA kernel、DualPipe 的通信隐藏、动态专家分配、多模态编码器优化以及推理端的缓存管理等工程细节。

在节目结尾,孙宇涛借“忒修斯之船”来讨论架构创新的边界,并给出一个颇为直白的判断:他认为大模型领域或许不会再出现极具颠覆性的单一发明,未来更多是对已有思路的集成与改良式进步。换言之,前沿模型的推进更像是行业集体贡献的积累,而商业化落地则需要对具体任务有清晰的定义。

搜索

球友会-球友会体育-球友会(QYH)官方网站

qy球友会官网始创于2010年,总部位于中国上海市,是一家专注于运动医学和康复设备研发、生产与销售的高科技企业。公司致力于为运动员、患者和普通消费者提供专业的运动康复产品,助力运动恢复、损伤预防和健康管理。

公司与多家知名的运动医学机构合作,研发出一系列符合运动员及普通消费者需求的康复设备,产品包括运动恢复仪、按摩设备、拉伸辅助器材等。qy球友会官网的产品不仅适用于运动员的日常训练恢复,也广泛应用于各类康复中心、医院和健身房,帮助用户恢复运动能力、减少伤害风险。

qy球友会官网在研发过程中注重结合最新的运动医学理论和技术,力求每一款产品都能提供高效、便捷的康复效果。公司通过与国内外的运动医学专家合作,不断优化产品设计和技术,确保其在功能性、安全性和舒适性方面达到国际水平。

作为一家具有社会责任感的公司,qy球友会官网倡导运动康复和健康管理,积极推动全球范围内的健康理念。未来,qy球友会官网将继续致力于技术创新,推动运动医学和康复产品的普及,为全球用户提供更多专业的康复解决方案。