切换交流语言不仅从根本上改变了Claude神经网络的词汇库,还彻底重塑了其价值观体系。开发者进行的大规模研究表明:在俄语版本中,该模型展现出明显更为严格和批判性的特质,失去了例如阿拉伯语或印地语版本中常见的温暖与共情。

分析人员将Claude已识别的3000多个价值导向归纳为四个关键行为轴。这些轴——顺从vs.谨慎、温暖vs.严格、深度vs.简洁、坦诚vs.实效——解释了模型回答中15%的变异性。为确保实验的纯净性,在分析的309815段对话中,主题、任务以及用户预设的价值观均受到控制。

衡量AI行为的四个维度

Claude特征最显著的变化恰恰发生在"温暖vs.严格"和"坦诚vs.实效"这两个轴上。正是在这里,俄语占据了极端位置。与英语相比,俄语版Claude表现出最大程度的严格倾向,牺牲了温暖。而在对立面,阿拉伯语和印地语版本则最大程度地偏向温暖与支持。

这在实际中意味着什么?俄语版Claude的严格性体现为一套具体的行为模式:神经网络开始质疑用户的初始前提,纠正细节并要求提供证据。而在其他语言中展现的温暖,则通过礼貌措辞、幽默、俏皮话以及对对话者想法的认可来表达。换言之,俄语版Claude表现得像一位挑剔的审稿人,而非鼓励性的对话者。

研究作者目前尚无法准确确定这种差异的原因。主要假设是训练数据在不同语言间分布不均。数据量大的语言更容易实现价值观的一致性。此外,不同语言的文本构成也存在差异:在俄语部分占主导地位的专业和学术语料库,可能承载着不同的价值负荷。

Anthropic计划将已开发的价值观画像方法应用于所有未来模型的评估与监控——无论是在发布前还是发布后。这将有助于捕捉意外的偏移,并将其与问题行为进行关联。而当前最明显的结论是:Claude的价值观以开发者并未有意选择的方式存在差异,公司打算深入解决这种变异性问题。

专家观点:这项研究对整个行业来说是一个警示信号。如果俄语AI助手系统性地倾向于批评和严格,这可能会扭曲用户对产品质量的感知,并为俄语社区创造不平等的条件。问题不在于语言本身,而在于训练数据的质量和结构。在Anthropic解决这一问题的同时,用户应当意识到:用俄语提出的请求可能不会得到支持,而是迎来严格的分析。