加密知识一站通
行情·工具·策略

Kimi K3凭什么追近Fable 5?月之暗面同时重写注意力、残差和MoE

动察 Beating 监测,月之暗面公布 Kimi K3 技术报告。K3 拥有 2.8 万亿总参数,每个 Token 激活 1040 亿参数,底座架构较 K2 全面换代。

参数变大只是其中一部分。月之暗面称,新架构、数据和训练方法让 K3 的整体扩展效率比 K2 提高约 2.5 倍。按其 Scaling Law 曲线,达到相同验证损失所需的训练计算量,约为 K2 的 40%。

K3 首先重写了注意力。它用 KDA 处理长序列,每三层再加入一层全局 MLA。KDA 把此前内容压进固定大小的状态,降低百万 Token 上下文的计算和缓存压力;MLA 负责保留全局信息交换。

它还加入 Attention Residuals。传统模型只能把此前所有层的信息不断叠加,K3 则允许每一层直接从更早的网络块中挑选需要的内容。模型更深以后,早期信息不容易被冲淡。

MoE 也被重新设计。K3 拥有 896 个路由专家,每个 Token 激活 16 个,是 K2 的两倍。路由专家会先在压缩空间中计算,再返回模型主干。新的激活函数和负载均衡算法,则用来防止超大模型训练失控。

真正拉高 Agent 能力的还有后训练。月之暗面分别训练通用、Agent 和代码模型,再为每个方向训练三种思考强度,最后把九个专家合并。训练任务最长可包含数千次工具调用,并持续保留文件、应用和虚拟机状态。

K3 已在多项代码、搜索和工具调用测试中接近或领先 Fable 5 和 GPT-5.6 Sol 等顶级闭源模型。它的跃升并非只靠堆参数,而是把更大的底座、新架构和百万 Token Agent 强化学习一起推到了极限。

赞(0)
未经允许不得转载:币须知道 » Kimi K3凭什么追近Fable 5?月之暗面同时重写注意力、残差和MoE

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址