OpenAI前首席技术官米拉·穆拉蒂终于揭开了其新项目Thinking Machines Lab的面纱。首款公开模型名为Inkling,现已开放测试和微调。这不仅仅是一个普通的语言助手,更是向多模态AI迈出的重要一步——它能够同时处理文本、图像和音频的推理任务。
Inkling的架构基于MoE(混合专家)原则:每次请求时仅激活部分网络,从而在保持分析深度的同时实现高推理速度。总参数量为9750亿,其中活跃参数为410亿。上下文窗口达到惊人的100万token。该模型从头开始训练,使用了45万亿token的数据,涵盖文本、图像、音频和视频。
但值得注意的是,尽管具备多模态能力,Inkling目前仅生成文本回复——包括代码、结构化数据和分析结论。不过它有一个有趣的特点:用户可以通过可控推理级别手动调节速度与质量之间的平衡。这种灵活性在开源模型中实属罕见。
Inkling的优势领域
在我看来,该模型在智能体任务中表现最为亮眼。在评估使用模型上下文协议执行任务的MCP Atlas测试中,Inkling得分74.1%——比主要西方开源竞品Nvidia Nemotron 3 Ultra高出近30个百分点。在检验GitHub自主修复bug能力的SWE-Bench Verified测试中,Inkling同样稳居领先地位:77.6%对Nemotron的70.7%。
在评估恶意请求正确处理(避免过度拦截)的FORTRESS Adversarial测试中,该模型获得78%的分数。这使其成为目前西方开发中最强大的开源模型。然而不出所料,Inkling仍落后于中国巨头。在检验真实环境自主编码能力的Terminal Bench 2.1测试中,Inkling得分63.8%,而Z.ai GLM 5.2达到82.7%,Moonshot AI最新发布的Kimi K3更是高达88.3%。Kimi K3还在博士级科学推理测试"人类最后考试"中领先。
Thinking Machines将Inkling定位为"全能型"模型,不会为了某项任务的优势而牺牲其他方面的表现。其核心策略是定制化:公司认为企业更需要针对特定任务的灵活模型,而非万能的"瑞士军刀"。
我的专家观点:Inkling是一份严肃的宣言,但它明显瞄准的是重视可定制性的细分企业场景。虽然该模型在通用测试中不及中国竞品,但其优势在于智能体和代码任务。如果Thinking Machines能够规模化定制能力并提升科学测试成绩,Inkling有望成为DeepSeek和GLM的真正对手。但目前来看,这仅仅是第一步。