Anthropic 团队进行了一项大规模研究,结果显示交流的语言环境会直接影响 Claude 模型的价值取向。通过对 20 种语言的 30 多万次对话进行分析发现:当切换到俄语时,该神经网络会明显转向严格和批判,失去惯有的温暖和同理心。
Anthropic 的专家将此前发现的 Claude 的 3000 多种价值观归纳为四个主要轴心,这些轴心解释了模型行为中 15% 的变异性。研究人员控制了所分析的 309,815 次对话中的主题、任务以及用户表达的价值观,以测量模型本身的价值观,而非请求本身的差异。
衡量人工智能行为的四个轴心
这四个标度如下:
- 顺从 vs. 谨慎——顺从用户(迎合用户)与谨慎行事(规避风险和伤害)。
- 温暖 vs. 严格——温暖(积极态度和关怀)与严格(注重精确性)。
- 深度 vs. 简洁——深度(详细解释)与简洁(仅执行被要求的内容)。
- 坦诚 vs. 执行——坦诚(承认自身不确定性)与结果(给出自信的回答)。
Claude 的价值观在不同语言之间变化最显著的是 温暖 vs. 严格 和 坦诚 vs. 执行 这两个轴心。而在顺从 vs. 谨慎和深度 vs. 简洁轴心上,模型保持最稳定。
切换到俄语时会发生什么
俄语与英语一起,位于第一个轴心的严格端。在这些语言中,Claude 最大程度地倾向于 严格,而牺牲了 温暖。另一端是阿拉伯语和印地语,模型在这些语言中转向最大程度的温暖。
Claude 的严格具体表现为何种行为?这是一系列具体行为:神经网络开始质疑用户的初始前提,纠正细节并要求提供证据。而在其他语言中,温暖则通过礼貌的措辞、幽默和俏皮,以及对用户想法和工作的认可来体现。
换句话说,在俄语中,Claude 更常表现得像一位挑剔的评审,而非一位鼓励性的对话者。
作者用一个例子说明了实际后果。两个人就同一份商业计划书请求反馈——一个用印地语,另一个用俄语。他们可能会对计划书的质量产生不同的印象,因为 Claude 在评估措辞中表达了不同的价值观。俄语用户更有可能收到带有修改和论证要求的批判性分析。而在其他语言中,同一份计划书则会得到更温和、更鼓励性的回应。
研究人员目前尚不清楚这些差异的具体原因。一种假设是训练数据在不同语言中的分布不均。数据量大的语言更容易实现价值观的一致性。不同语言的文本构成也不同,专业文本可能承载不同的价值观。
语言并非唯一因素
Claude 模型本身也会影响价值观取向,并且模型与语言之间的差异采用相同方法衡量。
- Sonnet 4.6 倾向于顺从、温暖和简洁,经常认可用户的想法并运用幽默。
- Opus 4.7 则转向谨慎和深度。该版本会质疑错误前提,主动提醒风险,对工作给出坦诚批评并解释其推理过程。
- Opus 4.6 处于中间位置,偏向严格、顺从和简洁。
Anthropic 特别指出,语言和模型很可能并非唯一因素。价值观也可能取决于人口统计信号——年龄、职业、地区。算法既从用户的直接指示中读取这些信息,也从主题、语气和风格等更细微的差异中获取。
作者计划将开发的方法整合到模型的评估和监控中。他们希望在模型发布前和发布后都进行价值观分析。这有助于捕捉意外的变化,并将价值观取向与问题行为进行对比。
作为分析师,我的评论: 这项研究对所有在商业和沟通中使用人工智能的人来说都是一个重要信号。如果模型根据语言改变其“性格”,那么在不同市场使用 Claude 进行客户服务的全球公司,可能会面临用户体验不一致的风险。俄语用户可能会认为人工智能更苛刻、更不友好,这可能会影响忠诚度和满意度。开发人员在针对特定语言段微调模型时,应考虑这一效应。