返回文章列表
模型发布

Kimi K3 发布:2.8T MoE、原生视觉与百万 Token 上下文

阅读约 2 分钟

导语

Kimi 团队在 Hugging Face Daily Papers 上介绍了新一代开放权重模型 Kimi K3。按照论文摘要,Kimi K3 是一个 2.8T 参数规模的 Mixture-of-Experts(MoE)模型,每个 token 激活 1040 亿参数,具备原生视觉能力,并将上下文窗口扩展到 100 万 token。这意味着它不仅面向常规聊天和知识问答,也明显瞄准长文档处理、长程编码和智能体任务。

核心要点

  • 更大的 MoE 架构:Kimi K3 总参数达到 2.8T,但通过专家路由机制控制每次计算量。论文提到 Stable LatentMoE 可在 896 个路由专家中为每个 token 有效激活 16 个专家,从而兼顾容量与效率。
  • 百万 token 上下文:模型内置 100 万 token 上下文窗口,配合 Kimi Delta Attention 与 Attention Residuals,意在改善超长序列和深层网络中的信息流动。
  • 原生视觉能力:Kimi K3 不是单纯文本模型,而是从设计上支持视觉任务,使其覆盖知识、推理、编码和视觉等更广泛场景。
  • 训练与后训练强化:论文强调在通用、智能体和代码领域进行强化学习,并支持多种推理努力等级,以提升组合泛化和长周期执行稳定性。
  • 系统工程同步升级:在 2.8T 规模下,团队提到围绕 KDA 的算法系统协同设计、专家并行训练的均衡、内存管理、百万 token 智能体 RL 的持久 rollout 与沙箱状态,以及部署侧优化。

意义与影响

Kimi K3 的重点不只是“参数更大”,而是把开放权重模型推向更复杂的工程边界:超长上下文、多模态输入、长程智能体执行和代码任务被放在同一套模型能力中。论文称,相比 Kimi K2,Kimi K3 的整体扩展效率约提升 2.5 倍,这对于大模型继续扩展具有现实意义。

评测方面,作者称 Kimi K3 在长程编码、智能体、知识、推理和视觉任务上达到前沿水平;同时也承认其整体表现仍落后于最强的专有模型 Claude Fable 5 和 GPT-5.6 Sol。更值得关注的是,论文表示 Kimi K3 在其评测套件中持续超过其他开放和专有模型,并释放完整模型权重。若这些结果能被社区复现,Kimi K3 将成为开放模型研究、长上下文系统和智能体训练的重要基线。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章