中国初创公司Moonshot AI正式发布了Kimi K3——迄今为止最大的开源语言模型。凭借宣称的2.8万亿参数、原生视觉能力和100万token的上下文窗口,K3自称是最强大的开源解决方案。据团队内部评估,在综合排名中,这款新品仅次于Anthropic的Claude Fable 5和OpenAI的GPT-5.6 Sol等闭源系统。

架构创新与效率

Kimi K3的核心在于全新的Kimi Delta Attention(KDA)架构和Attention Residuals(AttnRes)机制。KDA优化了长序列数据的处理,而AttnRes使模型能够从网络的不同层中选择性提取关键信息,而非一视同仁地处理所有内容。这确保了即使在处理复杂且混乱的文本时,也能实现更深入的上下文理解和意义保留。

扩展的关键要素是稀疏架构Stable LatentMoE。在896个可用专家中,每次推理仅激活16个。这种选择性,结合新数据和优化的训练方法,使模型效率相比前代K2提升了2.5倍。值得注意的是,在过去十二个月中的九个月里,Kimi系列模型在开源模型中一直保持着尺寸记录。

与竞争对手对比:K3的强项与弱项

在多项基准测试中,K3展现出优势,甚至超越了知名竞争对手。在解决长期工程问题的SWE Marathon测试中,该模型获得42分,而Fable 5为35分,Sol为39分。在网络研究任务BrowseComp中,其结果为91.2分,对比对手分别为88分和90.4分。K3还在Program Bench测试中领先(77.8分对比76.8分和77.6分),并在Terminal Bench 2.1中取得近乎满分的88.3分,仅落后Sol 0.5分。

然而,在FrontierSWE和HLE-Full(复杂的多学科考试)测试中,K3落后于Fable 5。值得注意的是,测试方法存在差异:部分模型通过Claude Code运行,其他则通过Codex或KimiCode自有工具集。这使得直接比较并非总是准确,但总体趋势已清晰:K3是处理代理任务的极其强大的工具。

编程、工程与自主性

K3能够以最少的人工干预进行长时间的工程会话。在GPU内核优化测试中,该模型自主运行长达24小时,表现与Fable 5相当,并显著领先于Opus 4.8、GPT-5.6 Sol和GPT-5.5。特别值得一提的是,K3能够从零开始编写MiniTriton——一个在MLIR之上拥有自有IR层的紧凑型GPU内核编译器。

芯片设计演示同样令人印象深刻:K3自主设计了一款基于自有架构的神经网络芯片。在48小时的自主工作中,使用开源工具,该模型创建了一款面积为4平方毫米、频率为100 MHz、模拟性能超过每秒8700个token的芯片设计。

知识处理与多模态能力

K3展现出对科学数据的深刻理解。在一个案例中,该模型在两小时内复现了计算天体物理学中的复杂公式,而经验丰富的研究人员可能需要数周时间。在另一个例子中,K3处理了超过11000页文档,准备了一份关于ASIC行业42年历史的交互式报告。

凭借原生视频处理能力,该模型能够剪辑视频、将其与音乐同步并处理音频。这为创意流程的自动化开辟了新视野。

局限性与可用性

Moonshot AI团队坦诚承认,K3在切换代理环境时对推理历史丢失较为敏感,并可能在模棱两可的情况下表现出过度主动性。在易用性方面,它目前仍落后于旗舰产品Fable 5和GPT-5.6 Sol。

该模型现已可通过Kimi网站、Kimi Work和Code服务以及API使用。默认激活最大推理模式。完整权重和技术报告将于7月27日发布。

专家观点: Kimi K3的发布不仅仅是参数数量的又一次纪录。它证明了开源模型能够在最高水平上与闭源巨头竞争,尤其是在代理和工程任务中。然而,易用性上的差距以及对上下文切换的敏感性提醒我们,“原始”算力只是方程式的一部分。AI领导地位的竞赛才刚刚开始,我们正看到开源阵营正在加速追赶。