智算多多
官方邮箱:sw@zsdodo.com

公司地址:北京市丰台区南四环西路188号总部基地三区国联股份数字经济总部(邮 编:100070)


京公网安备11010602202532号 上周,月之暗面 CEO 杨植麟在 GTC 2026 现场发表了精彩主题分享。可以说是过去 Kimi 在开源模型方面的深刻经验总结。
杨植麟在开场引用了黄仁勋在 CES 的一张图:开源模型与闭源模型的性能差距正快速收敛。这一趋势让“智能民主化”从口号变成现实路径。
而这构成了整场分享的核心逻辑:开源模型要赢,就必须在能力上变得足够强。
围绕“构建更强的开源模型”这个主旋律,单点突破显然不可行。Kimi 给出了“三位一体”的“多维 scaling”方法:
在新模型 Kimi K2.5 中,他们做了一个更激进的尝试:从训练一开始,就将视觉和文本统一建模(early fusion)。这带来两个反直觉结果:
杨植麟表示,甚至在几乎没有视觉监督数据的情况下,模型依然具备强视觉能力。
这背后的核心不在数据量,而在:是否对齐到统一的表示空间。
杨植麟也在分享中确认:上周刷屏的 Kimi 新论文“attention residual”正是下一代模型架构的预告。
在 Transformer 架构中,传统残差连接只连接“上一层”;而 Kimi 的 attention residual,要求当前层可以“关注所有历史层”。相当于把 attention 从“时间维度”,扩展到“深度维度”。
初步结果显示:
这释放出一个强烈信号:今天很多被视为“基础设施”的结构——attention、optimizer、residual 等——依旧有很大的空间等待被重写。
杨植麟最后提到一个更宏观的范式转变判断:AI 研究正在从“提出想法”,转向“系统验证”。
原因也很现实:scaling law 提供了可验证路径,算力允许大规模实验,让结果更可比较。这无疑也为新时代的研究者们提供了更多创新的机会和能力。
当模型扩展到 7 万亿参数时,训练开始变得不稳定:logits 最大值迅速爆炸(超过 7000),而正常训练通常在 50–100 之间;loss 虽然初期下降,但随后发散。
为解决此问题,Kimi 引入了 QK Clip 技术:在每个 attention head 中,基于当前最大 logit 计算缩放因子,作用于 key 和 query projection,避免数值爆炸。
左图:使用 QK Clip 前后训练 loss 几乎重合;右图:最大 logit 被稳定控制在合理范围
团队重点投入的另一个方向是 Muon Optimizer:一种二阶优化器,通过对梯度更新进行正交变换,实现约 2 倍的 token efficiency 提升。
Transformer 相比 LSTM 的关键优势在于:随着上下文变长,其 loss 持续下降,而 LSTM 很快饱和。这对 Agent 时代至关重要——复杂任务需要超长上下文支持。
Kimi 提出新架构 Kimi Linear,包含:
关键改进:将传统线性注意力中的标量衰减因子升级为对角矩阵(alpha),使每个通道拥有独立衰减速率——部分保留长期信息,部分快速刷新。
实验表明:Kimi Linear 在短上下文(MMLU)和长上下文(RULER)任务上均优于 MLA 和 GPA,且计算效率更高。当上下文达百万 token 时,优势更显著。
这是首个在所有场景下超越 full attention 的架构。
Agent Swarm 范式引入调度器(Orchestrator),负责生成子 Agent、分配任务、聚合结果,从而完成单一 Agent 无法处理的复杂任务。
相比单一 Agent,Swarm 可显著降低高复杂度任务的执行时间,并支持并行读取上千信息源。
为训练 Agent Swarm,团队设计了新的强化学习目标函数,包含三项奖励:
K2.5 是首个原生支持“视觉 + 文本联合建模”的开源模型,采用 Early Fusion(早期融合)策略——从训练初始即混合视觉与文本 token,而非后期追加。
关键发现:
核心前提是:将两种模态对齐到统一的 embedding 表示空间。
K2.5 训练共使用超过 30 万亿 token,在 NVIDIA H800 GPU 集群上完成(每节点约 2TB 内存,高速互联)。
平滑稳定的训练曲线,无 loss spike
杨植麟强调,AI 研究正进入“系统验证”时代。Scaling Law 与充足算力使得架构、优化器等“基础设施”仍有巨大创新空间。开源社区将成为推动智能边界的关键力量。
