语言交流方式的改变直接影响着神经网络所展现的价值观和性格特征。Anthropic的研究人员进行了一项大规模分析,结果显示:在使用俄语交流时,Claude模型明显偏向严格和批判性,失去了在其他语言中常见的温暖特质。
在这项名为《Claude's Values Across Models and Languages》的研究中,专家们将此前发现的3000多种模型价值观归纳为四个主要行为轴。他们测量了不同AI版本之间以及Claude.ai平台上20种最常用语言中这些价值观特征的变化。俄语在这项研究中占据特殊地位——与英语并列,成为Claude在牺牲温暖度的情况下表现出最大严格性的极点。让我们来具体分析一下这意味着什么。
衡量AI性格的四个轴
研究人员确定了四个关键轴,每个轴代表两组对立价值观之间的数值尺度:
| 轴名称 | AI行为的极端表现 |
| 顺从 vs. 谨慎 | 顺从(迎合用户)vs. 谨慎(防范风险和伤害) |
| 温暖 vs. 严格 | 温暖(积极态度和关怀)vs. 严格(注重准确性和批评) |
| 深度 vs. 简洁 | 深度(详细解释)vs. 简洁(仅执行所要求的内容) |
| 坦诚 vs. 执行 | 坦诚(承认自身不确定性)vs. 执行(给出自信的回答) |
这四个轴解释了Claude所表达价值观中15%的变异性。专家们旨在测量模型的价值观,而非用户请求本身的差异。为此,他们控制了309,815个分析对话中每个对话的主题、任务和用户表达的价值观。
切换到俄语时会发生什么
Claude的价值观特征在不同语言之间变化最显著的是"温暖 vs. 严格"和"坦诚 vs. 执行"这两个轴。而在"顺从 vs. 谨慎"和"深度 vs. 简洁"轴上则最为稳定。俄语位于第一个轴的严格极点。Claude在英语和俄语中牺牲温暖度而倾向于严格性的倾向最为明显。相反,在阿拉伯语和印地语中,模型最大程度地向温暖度偏移。
Claude的严格性表现为一系列具体行为:神经网络开始质疑用户的前提假设,纠正细节并要求提供证据。而在其他语言中,温暖性则通过礼貌措辞、幽默和俏皮话,以及对用户想法和工作的认可来体现。换句话说,在俄语中,Claude更常表现得像一位挑剔的评审,而不是一位鼓励性的对话者。
作者用一个例子说明了实际影响。两个人就同一份商业计划书请求反馈——一人用印地语,另一人用俄语。他们可能对计划书质量产生不同印象,因为Claude在表述评价时会表达不同的价值观。俄语用户更有可能收到带有修改和论证要求的批判性分析。而在其他语言中,同一份计划书则会得到更温和、更鼓励性的回应。
语言并非唯一因素
Claude模型本身也会影响价值观特征,且模型与语言之间的差异采用相同方法测量。例如,Sonnet 4.6倾向于顺从、温暖和简洁,经常认可用户的想法并运用幽默。相反,Opus 4.7则偏向谨慎和深度:质疑错误前提、警告风险、给出坦诚批评并解释其推理过程。Opus 4.6则处于中间位置,偏向严格、顺从和简洁。最终行为同时受到对话语言和所选模型的影响。
研究人员目前尚不清楚这些差异的具体原因。一种假设是训练数据在不同语言中的分布不均。数据量大的语言更容易实现价值观一致性。不同语言的文本构成也不同,专业文本可能承载不同的价值观。这种变异性在多大程度上是可取的,仍然是一个悬而未决的问题。不同语言承载着不同的会话规范,部分差异可能反映了这些规范,而另一部分则可能反映了语言社区服务质量的差距。
专家观点:对于加密货币行业和科技领域而言,这一发现具有直接意义。如果您正在为全球受众开发AI产品,您必须理解其"性格"和交互风格会因语言而异。这可能会影响品牌认知、信任度,甚至A/B测试的结果。公司应将价值观特征的监控纳入其流程,以免无意的偏移成为意外。