首页
产品服务
模型广场
Token工厂
算力市场算力商情行业资讯
注册

杨植麟GTC演讲实录:Kimi构建更强开源模型的三个Scaling策略……

发布日期:2026-03-24 来源:百家号作者:百家号

Kimi K2.5 技术解析:开源模型的“三位一体”Scaling 路径

上周,月之暗面 CEO 杨植麟在 GTC 2026 现场发表了精彩主题分享。可以说是过去 Kimi 在开源模型方面的深刻经验总结。

杨植麟在开场引用了黄仁勋在 CES 的一张图:开源模型与闭源模型的性能差距正快速收敛。这一趋势让“智能民主化”从口号变成现实路径。

而这构成了整场分享的核心逻辑:开源模型要赢,就必须在能力上变得足够强。

“三位一体”的多维 Scaling 方法

围绕“构建更强的开源模型”这个主旋律,单点突破显然不可行。Kimi 给出了“三位一体”的“多维 scaling”方法:

  1. Token Efficiency(Token 利用效率):决定“模型有多聪明”;
  2. 长上下文(Long Context):重构任务边界,决定“模型能做多复杂的事”;
  3. Agent Swarm(智能体群):让模型变成“组织”,具备“系统能力”。

视觉与文本统一建模:Early Fusion 的反直觉成果

在新模型 Kimi K2.5 中,他们做了一个更激进的尝试:从训练一开始,就将视觉和文本统一建模(early fusion)。这带来两个反直觉结果:

  • 视觉训练可以提升文本推理能力;
  • 强文本模型可以反向提升视觉能力。

杨植麟表示,甚至在几乎没有视觉监督数据的情况下,模型依然具备强视觉能力。

这背后的核心不在数据量,而在:是否对齐到统一的表示空间。

Attention Residual:下一代架构预告

杨植麟也在分享中确认:上周刷屏的 Kimi 新论文“attention residual”正是下一代模型架构的预告。

在 Transformer 架构中,传统残差连接只连接“上一层”;而 Kimi 的 attention residual,要求当前层可以“关注所有历史层”。相当于把 attention 从“时间维度”,扩展到“深度维度”。

初步结果显示:

  • token efficiency 提升约 24%;
  • 在代码、数学等任务上明显提升。

这释放出一个强烈信号:今天很多被视为“基础设施”的结构——attention、optimizer、residual 等——依旧有很大的空间等待被重写。

AI 研究范式的转变:从“提出想法”到“系统验证”

杨植麟最后提到一个更宏观的范式转变判断:AI 研究正在从“提出想法”,转向“系统验证”。

原因也很现实:scaling law 提供了可验证路径,算力允许大规模实验,让结果更可比较。这无疑也为新时代的研究者们提供了更多创新的机会和能力。

三个核心维度的技术突破

1. Token Efficiency:Muon Optimizer

当模型扩展到 7 万亿参数时,训练开始变得不稳定:logits 最大值迅速爆炸(超过 7000),而正常训练通常在 50–100 之间;loss 虽然初期下降,但随后发散。

为解决此问题,Kimi 引入了 QK Clip 技术:在每个 attention head 中,基于当前最大 logit 计算缩放因子,作用于 key 和 query projection,避免数值爆炸。

QK Clip 实验结果

左图:使用 QK Clip 前后训练 loss 几乎重合;右图:最大 logit 被稳定控制在合理范围

团队重点投入的另一个方向是 Muon Optimizer:一种二阶优化器,通过对梯度更新进行正交变换,实现约 2 倍的 token efficiency 提升。

Muon Optimizer 示意图

2. 长上下文:Kimi Linear 架构

Transformer 相比 LSTM 的关键优势在于:随着上下文变长,其 loss 持续下降,而 LSTM 很快饱和。这对 Agent 时代至关重要——复杂任务需要超长上下文支持。

Kimi 提出新架构 Kimi Linear,包含:

  • Kimi Delta Attention:增强递归记忆能力的线性注意力变体;
  • 采用 1:3 比例混合线性注意力层与全注意力层,平衡效率与能力。

关键改进:将传统线性注意力中的标量衰减因子升级为对角矩阵(alpha),使每个通道拥有独立衰减速率——部分保留长期信息,部分快速刷新。

细粒度衰减因子示意图

实验表明:Kimi Linear 在短上下文(MMLU)和长上下文(RULER)任务上均优于 MLA 和 GPA,且计算效率更高。当上下文达百万 token 时,优势更显著。

这是首个在所有场景下超越 full attention 的架构。

Kimi Linear 架构图

论文地址:arxiv.org/abs/2001.08361

3. Agent Swarm:多智能体协同系统

Agent Swarm 范式引入调度器(Orchestrator),负责生成子 Agent、分配任务、聚合结果,从而完成单一 Agent 无法处理的复杂任务。

相比单一 Agent,Swarm 可显著降低高复杂度任务的执行时间,并支持并行读取上千信息源。

Agent Swarm 示意图

为训练 Agent Swarm,团队设计了新的强化学习目标函数,包含三项奖励:

  1. Instantiation Reward:鼓励生成子 Agent,避免退化为单 Agent 执行;
  2. Finish Reward:确保子任务真实完成,防止“伪任务”;
  3. Aggregation Reward:有效聚合子任务结果(原文未详述,但逻辑推导存在)。

Kimi K2.5:视觉与文本的原生融合

K2.5 是首个原生支持“视觉 + 文本联合建模”的开源模型,采用 Early Fusion(早期融合)策略——从训练初始即混合视觉与文本 token,而非后期追加。

Early Fusion 示意图

关键发现:

  • 视觉与文本可相互增强;
  • 无视觉监督微调数据(zero vision SFT)条件下,仅通过联合强化学习,视觉任务表现接近 SOTA;
  • 涌现出“视觉直接生成代码”(vision-to-code)等新能力。

核心前提是:将两种模态对齐到统一的 embedding 表示空间

训练稳定性与基础设施

K2.5 训练共使用超过 30 万亿 token,在 NVIDIA H800 GPU 集群上完成(每节点约 2TB 内存,高速互联)。

K2.5 训练曲线

平滑稳定的训练曲线,无 loss spike

结语:开源模型的未来已来

杨植麟强调,AI 研究正进入“系统验证”时代。Scaling Law 与充足算力使得架构、优化器等“基础设施”仍有巨大创新空间。开源社区将成为推动智能边界的关键力量。

本文转载自百家号, 作者:百家号, 原文标题:《 杨植麟GTC演讲实录:Kimi构建更强开源模型的三个Scaling策略…… 》, 原文链接: https://baijiahao.baidu.com/s?id=1860509775205551090&wfr=spider&for=pc。 本平台仅做分享和推荐,不涉及任何商业用途。文章版权归原作者所有。如涉及作品内容、版权和其它问题,请与我们联系,我们将在第一时间删除内容!
本文相关推荐
暂无相关推荐
点击立即订阅