Kimi K3正式开源:2.8万亿参数模型首日获阿里、华为等数十家厂商适配

🤖 由 文心大模型 生成的文章摘要

7月27日晚,月之暗面正式发布Kimi K3技术报告,并同步开放完整模型权重。作为总参数达2.8万亿、激活参数约1040亿的大模型,Kimi K3凭借核心架构创新,在多项评测中展现出逼近全球顶尖闭源模型的性能。次日(7月28日),该模型即获海内外数十家AI基础设施厂商的首日适配,引发开发者社区强烈反响。

训练效率跃升,架构创新显著

Kimi K3的技术底座与上一代Kimi K2相比有显著变化。技术报告显示,该模型采用三项核心架构设计:Kimi Delta Attention(KDA,一种线性注意力机制)、Attention Residuals(AttnRes,改善信息在深度网络中的流动效率)以及Stable LatentMoE框架(将路由专家扩展到896个)。月之暗面企业业务负责人黄震昕介绍,团队自研的Moon Clip新型二阶优化器全球首次落地于大模型训练,使原本需40T数据才能达到的训练效果,现在仅用20T数据即可实现,实现训练成本减半。上述改进共同带来约2.5倍于Kimi K2的整体缩放效率提升。

评测表现亮眼,性价比突出

在研究生级科学问答GPQA Diamond上,Kimi K3得分93.5%,略高于Claude Fable 5的92.6%,落后于GPT-5.6 Sol的94.1%。在编程能力方面,Kimi K3在ProgramBench上以77.8%得分位居第一。值得关注的是其成本效率:在Kimi Code Bench 2.0上,Kimi K3得分比Claude Fable 5低约4个百分点,但推理成本仅为后者的38%。在BrowseComp上,Kimi K3以每任务约2.03美元成本获得最高分。在WebDev Arena中,Kimi K3以1678 Elo排名第一,是该榜单首个登顶的开源模型。

多家厂商Day0适配,生态反响热烈

Kimi K3开源后迅速引爆开发者社区。Hugging Face CEO发文称模型在30分钟内获超4000个赞,登顶趋势榜。开源当天,阿里云真武M890超节点实例完成首日全面适配,成为国内首个跑通近3万亿参数模型的超节点,优化后首token时延降低约35%,单卡解码吞吐提升1.8倍。华为昇腾同步实现Day0全链路适配,覆盖训练复现与推理部署。海外方面,Nebius、Baseten、Fireworks等厂商以及vLLM和SGLang两大开源推理框架均宣布首日支持。

许可证设商业化门槛,兼顾开放与商业

Kimi K3采用专门许可证,允许免费使用、修改和分发,但设置了明确商业化门槛:若使用方模型服务连续12个月总收入超2000万美元,需与月之暗面签署额外商业协议;若基于Kimi K3的产品月活超1亿或月收入超2000万美元,需显著标识模型名称。内部使用和通过官方产品访问不受此限。业内人士分析,这一设计旨在平衡开源生态建设与商业化回报,为开源模型的可持续发展探索新路径。