在一项涵盖超过309,815次对话的大规模研究中,开发团队揭示了语言模型行为的一个基本特征:切换交流语言不仅会彻底改变词汇选择,还会改变神经网络所展现的价值观体系。这一现象在分析俄语会话时表现得最为突出。

专家们将此前识别的Claude的3000多种价值观归纳为四个关键轴:顺从 vs. 谨慎热情 vs. 严格深度 vs. 简洁以及坦诚 vs. 成效。正是这些维度解释了模型行为中15%的变异性。关键结论是:价值观特征不仅在不同模型之间存在差异,更重要的是,在平台最常用的20种语言之间也有所不同。

俄语作为严格性的极点

最显著的波动出现在“热情 vs. 严格”和“坦诚 vs. 成效”这两个轴上。俄语与英语一起占据了严格性极点的极端位置。这意味着,在使用俄语交流时,Claude明显更常表现得像一位挑剔的评审者,而非鼓励性的对话者。它会主动质疑初始前提、纠正细节、要求证据并进行批判性分析。

相比之下,在阿拉伯语和印地语中,模型转向最大程度的热情,表现出礼貌、幽默以及对用户想法的认可。实际后果显而易见:同一个商业计划会根据查询语言的不同而得到截然不同的评价。俄语用户很可能会面临严厉的批评和论证要求,而印地语用户则会得到温和且鼓励性的回应。

模型本身也很重要

需要理解的是,语言并非唯一因素。选择特定版本的模型也会产生影响:

  • Sonnet 4.6倾向于顺从、热情和简洁,经常认可想法并使用幽默。
  • Opus 4.7偏向谨慎和深度,质疑错误前提并提供坦诚的批评。
  • Opus 4.6处于中间位置,倾向于严格、顺从和简洁。

研究人员目前无法准确确定这些差异的原因。主要假设是训练数据在不同语言中的分布不均。数据量大的地方,更容易实现价值观的一致性。此外,不同语言的文本构成也有所不同:专业语料库可能带有与口语语料库不同的价值观取向。

我的专家评论:对于加密货币行业和DeFi领域而言,措辞的精确性和批判性分析至关重要,因此俄语版Claude的这种“严格性”更多是优势而非劣势。然而,开发者和用户需要意识到这种语言偏移,以避免在评估复杂技术解决方案时产生误解。Anthropic公司计划将价值观特征分析纳入模型评估和监控流程,从而更好地控制这种非预期的变异性。这种变异性在多大程度上是可取的,仍是一个悬而未决的问题,但对于习惯了高风险环境的加密社区而言,一个严格且要求严格的AI助手可能比一个“热情”的对话者更有用。