中国人工智能初创公司Moonshot AI取得重大突破,发布了迄今为止最大的开源3T级模型——Kimi K3。该模型拥有2.8万亿参数、原生视觉能力以及100万token的上下文窗口,凭借这些特性,它已跻身全球人工智能精英行列。据开发者称,其性能仅次于专有领域的巨头Claude Fable 5和GPT 5.6 Sol。
K3的架构基础是创新的Kimi Delta Attention(KDA)机制和注意力残差(AttnRes)机制。KDA优化了长序列数据的处理,而AttnRes使模型能够有选择性地提取关键信息,无需对所有层进行同等处理。其结果是,即使在处理最复杂的文本时,也能实现更深入的上下文理解和语义保持。计算稀疏性由Stable LatentMoE框架实现:在896个专家中,每次仅有16个被激活,结合新的数据和训练方法,其效率相比前代Kimi K2提升了2.5倍。
基准测试:K3的亮点与短板
K3的测试结果喜忧参半。该模型在需要长时间工程会话和复杂智能体行为的任务中表现出色。在SWE Marathon测试中,它获得42分,领先于Fable 5(35分)和GPT-5.6 Sol(39分)。在BrowseComp(91.2分)和Program Bench(77.8分)测试中,它也处于领先地位。在Terminal Bench 2.1测试中,88.3分的成绩仅比Sol(88.8分)低0.5分,并显著优于Fable 5(84.6分)。
然而,在评估深度科学知识的基准测试中,K3表现落后。在FrontierSWE测试中,它获得81.2分,而Fable 5为86.6分;在HLE-Full测试中,它获得43.5分,而Fable 5为53.3分。值得注意的是,测试方法存在差异,这可能影响了最终数据。
编程、芯片与创意:实际应用案例
K3能够自主进行长时间的工程会话,在庞大的代码库中导航,并管理终端工具。在一项测试中,该模型在24小时内持续优化GPU核心,表现与Fable 5相当。此外,早期版本的K3还自主编写了MiniTriton——一个用于GPU核心的紧凑型编译器。
演示案例令人印象深刻:K3在48小时内,利用开源工具,基于自身架构设计了一款用于神经网络的芯片。最终得到的芯片面积为4平方毫米,每秒可输出超过8700个token。该模型还能够创建游戏原型、剪辑视频以及进行复杂的科学分析,例如,在两个小时而非研究人员通常需要的两周时间内,复现计算天体物理学中的通用关系。
Cryptalist分析评论:Kimi K3无疑是开源模型向前迈出的一步。然而,在需要深度知识和完美可用性的任务上,与专有领域领导者之间的差距仍然明显。值得注意的是,Moonshot AI押注于工程任务的自主性,这或许能成为他们在软件开发细分领域的一张王牌。但对于大众用户而言,K3目前仍是一个虽强大但定位小众的工具。