人工智能 频道

深夜重磅!Kimi K3全面开源,中国大模型叩开全球顶尖AI之门

  7月27日深夜,月之暗面发布Kimi K3的模型权重、技术报告,并开源支撑Kimi K3模型训练的关键Infra技术MoonEP、FlashKDA和AgentEnv。允许全球开发者免费下载、微调并部署该模型,以此加速前沿智能的部署与普及,促进AGI研究,同时进一步扩大AI用户基础。

  Kimi K3是一个拥有2.8万亿参数的混合专家(MoE)模型,支持100万token的上下文窗口,是目前全球规模最大的开放权重模型,同时也是Artificial Analysis智能指数排名第 一的开源模型,获得了57分高分,仅次于Anthropic和OpenAI的前沿闭源模型。

接近全球顶尖水平的中国开源模型

  根据官方披露的资料,Kimi K3在编程、代理Agent等方面表现优异。尤其在长周期工程任务方面,能在极少监督下持续完成多步骤任务、处理大型代码库,并协调终端工具。此前还展示了将编程与视觉推理相结合的优异表现,可以利用截图和视觉反馈来迭代游戏开发、前端开发或CAD任务。

  在基准测试中,虽然Kimi K3的整体表现仍落后于最强的闭源模型Claude Fable 5和GPT-5.6 Sol,但却展现出了前沿水平能力,并稳定超过了其他所有模型。

  Kimi K3在编程基准测试的几乎所有项目中都表现强劲,尤其是在Program Bench和SWE Marathon测试中占据领先地位,拔得头筹。在Terminal-Bench 2.1测试中与GPT-5.6 Sol的差距仅半分,并在大多数单项测试中击败了Opus 4.8。不过,Kimi K3明显落后的领域是DeepSWE和FrontierSWE,在这两项测试中,Fable 5和GPT-5.6 Sol占据了领先地位。

  Kimi K3在代理Agent基准测试中同样表现强劲,尤其是Automation、BrowseComp和Spreadsheet测试中占据领先地位,摘得桂冠。在大多数单项测试中击败了Opus 4.8,甚至在多项测试中超越了GPT-5.6 Sol。但是Kimi K3在GDPval-AA v2 Elo测试中明显落后于Fable 5和GPT-5.6 Sol。

  此外,Kimi K3还推动了端到端知识工作的进展。除了公开基准外,Kimi K3(max)在其内部评测(基于真实的智能体协作工作流而非公开基准测试)中也展现出稳定提升。

  与国际顶尖模型相比,Fable 5是Anthropic性能最强的模型,整体智能方面明显领先,但K3的卖点并非与Fable 5一样好,而是“以极低的价格,已达到Fable 5的大部分水平”。

  一周前,月之暗面发布了Kimi K3,因其优异的能力受到用户“远超预期”的广泛支持,服务上线48h远超算力容量,从而暂停了C端新用户订阅。

  如今,这样强大的中国模型正式开源,引发广泛关注。Hugging Face CEO Clem Delangue发文表示,Kimi K3 30分钟内以超过4000个赞登顶平台Trending榜首,创下平台迄今最快的发布增长速度。北美AI基础设施创企OsmanticAI的创始人兼CEO Ahmad更是将Kimi K3称为“本地版Fable 5”。

  与此同时,Kimi K3的亮眼表现也触动了海外敏感神经。有海外媒体指出:“发展趋势已足够清晰,一款开放式中国模型如今已足够接近顶尖水平,无法再将其视为研究玩具而置之不理。”

Kimi K3何以如此强大?

  Kimi K3因其性能媲美西方顶尖闭源模型而备受科技圈瞩目,但是推出不到一周便卷入了美国政客引发的“蒸馏”风波之中。

  美国白宫科技政策办公室主任迈克尔·克拉齐奥斯7月22日突然在社交媒体上宣称月之暗面通过蒸馏美国Anthropic公司的Fable开发Kimi K3大模型。

  海外不少有识之士站出来为Kimi K3发声。有科技博主在X发文指出,如果Kimi K3仅是Fable 5的蒸馏产物,其性能理应只是接近后者。但评测结果显示,Kimi K3在部分领域优于Fable 5,这种超越表现难以单凭蒸馏技术实现。也有专家指出,Fable 5上线仅72小时便被迫全球下架,到7月1日才重新开放,而Kimi K3在7月中旬发布,短短两周时间根本没法提取这么多数据进行整合,认为“蒸馏”一说站不住脚。

  针对网传Kimi K3是“蒸馏”其他模型的猜测,月之暗面企业业务负责人黄震昕明确予以否认,黄震昕表示,Kimi K3性能实现跨越式提升,核心依托底层原创架构创新,并非对任何现有模型进行蒸馏复刻。

  随着此次开源,Kimi K3也上线了技术报告,披露了更多技术细节,可以看到,架构创新,再加上训练方法和数据配方的优化,这些结构性改进让Kimi K3相比K2的整体扩展效率提升约2.5倍,能更有效地把算力转化为能力,带来性能跃升。

  ·KDA + AttnRes:以3:1比例混合KDA与Gated MLA,实现高效长上下文建模,并通过块级注意力残差增强跨层信息流动。

  ·Stable LatentMoE:每个token从896个路由专家中激活16个,并通过SiTU-GLU与Quantile Balancing保持极高稀疏度下的训练稳定。

  ·MoonViT-V2:视觉编码器从零开始使用next-token prediction训练,无需对比预训练,在达到SigLIP初始化基线效果的同时获得更稳定的优化过程。

  ·后训练与评估:在通用推理、通用Agent和编程Agent三大领域进行大规模任务合成,百万token上下文的强化学习基建,近20个内部评测集的完整评估结果。

  强大的模型能力需要Infra基础设施层的稳定支撑,MoonEP、FlashKDA 和 AgentEnv是支撑Kimi K3训练的三项Infra技术,覆盖从高性能通信、高性能算子到分布式 RL 环境的关键链路,具体如下:

  ·MoonEP:MoonEP是为超大的细粒度MoE打造的高性能通信库,让专家并行(expert-parallel)的通信在不均衡的情况下仍然实现极致效率。

  ·FlashKDA:FlashKDA是实现的Kimi Delta Attention高性能算子(kernel)。在英伟达H20上,相比flash-linear-attention基线,其prefill速度提升1.72-2.22倍,可以直接作为flash-linear-attention的替换后端。

  ·AgentEnv:AgentENV是Agent沙箱系统,用于大规模运行Agent环境,它为Kimi K3的后训练提供高保真、强隔离沙箱,灵活支持快速快照、恢复和分叉(fork)等,可以应对大规模并行的Agent工作流与训练任务。

  这三项技术是支撑Kimi K3训练效率与稳定性的关键,其中FlashKDA此前已开源,MoonEP和AgentEnv则随本次发布正式开源。月之暗面没有藏着这些关键技术,全部开源出来,显示了其开源开放的诚意。

小结:开源与闭源之外不要忽略AI安全治理问题

  当Kimi K3的模型权重向全球开发者敞开下载,一条清晰的技术路线分野已然浮现:大洋彼岸的顶尖模型依然紧锁于少数巨头的服务器之后,而以月之暗面为代表的中国AI力量,正将最前沿的成果以开源开放之姿推向世界。

  正如研究中国AI治理的MATS Research研究员洛克所言:“开源一直是中国AI战略的重中之重。这不仅是国内的技术扩散路径,更是核心的赶超战略。”

  “我们坚信开放权重模型的价值。它们能降低获取智能的门槛,推动创新,并赋予用户对数据更大的控制权、隐私保护和所有权。”月之暗面在Kimi K3开源公告中指出,“我们相信,对于AGI这样具有深远影响的技术,一个广泛、开放的生态系统是最适合承载它的土壤。为此,我们将继续贡献自己的力量。”这份信念正获得更广泛的行业共鸣,英伟达黄仁勋近日牵头拥护开源模型的发展,也印证了开源已是全球AI发展的主流趋势。

  当然,开源与闭源从来不是非此即彼的优劣之争,更多是不同商业逻辑与生态愿景下的策略选择。但当模型能力日益逼近人类智能的边界,一个更紧迫的命题摆在所有参与者面前:无论是开放的社区还是封闭的实验室,前沿AI在核武器、生物工程等敏感领域的安全治理,都不应被任何叙事所遮蔽。技术可以有不同的开放尺度,但对安全的敬畏、对责任的担当,必须成为全球AI共同体不可退让的共识。这条路,才刚刚开始,但方向,已然清晰。

0
相关文章