交流语言的选择不仅从根本上改变了词汇,还改变了语言模型本身的“个性”。我对Anthropic最新研究的分析表明:Claude在使用俄语时展现出截然不同的价值观特征,偏向严格和批判。这不是一个漏洞,而是大型语言模型运作的基本特征,必须加以考虑。

该公司研究人员将此前发现的Claude的3000多种价值观归纳为四个基本轴,分析了20种最流行语言的309,815段对话。在这个坐标系中,俄语占据了极端位置。

决定人工智能性格的四个轴

每个轴都是两种对立行为模式之间的数值直线:

  • 顺从 vs. 谨慎:迎合用户意愿与防范风险之间的权衡。
  • 温暖 vs. 严格:积极态度和关怀与强调准确性和事实之间的侧重。
  • 深度 vs. 简洁:详细解释与仅执行用户要求之间的选择。
  • 坦诚 vs. 执行:承认不确定性 vs. 给出自信回答。

这四个轴解释了Claude所表达价值观中15%的变异性。重要的是:研究人员控制了主题、任务和用户表达的价值观,以测量模型本身的价值观,而非请求之间的差异。

俄语:严格的极点

Claude在不同语言间最显著的特征变化发生在“温暖 vs. 严格”和“坦诚 vs. 执行”这两个轴上。正是俄语与英语一起,处于最严格的极点。相反的一端是阿拉伯语和印地语,模型在这些语言中最大程度地偏向温暖。

这在实践中意味着什么?Claude的严格性表现为具体的行为模式:模型开始质疑用户的初始前提、纠正细节并要求提供证据。而温暖则通过礼貌措辞、幽默、俏皮和对对话者想法的认可来体现。

换句话说,使用俄语时,Claude的行为更像一个挑剔的审稿人,而不是一个鼓励性的对话者。

想象一下:两个人就同一份商业计划书寻求反馈——一个用印地语,另一个用俄语。俄语用户更有可能收到带有修正和要求论证的批判性分析。而在其他语言中,同样的计划书会得到更温和、更鼓励性的回应。

为什么会这样?

研究人员自己目前尚不清楚确切原因。主要假设是训练数据在不同语言间分布不均。数据量大的语言(如英语、俄语)更容易实现价值观的一致性。不同语言的文本构成也不同:专业文本可能承载不同的价值观。

这种变异性是否可取,也是一个悬而未决的问题。不同语言承载着不同的会话规范,部分差异可能反映了这一点。但另一部分则明显是语言社区服务质量的缺口。

语言并非唯一因素

Claude模型本身也会影响价值观特征,且模型与语言之间的差异采用相同方法测量。

  • Sonnet 4.6 倾向于顺从、温暖和简洁,经常认可用户的想法并运用幽默。
  • Opus 4.7 则相反,偏向谨慎和深度:质疑错误前提、警告风险、给出坦诚批评。
  • Opus 4.6 处于中间位置,偏向严格、顺从和简洁。

Anthropic特别指出:价值观也可能取决于人口统计信号——年龄、职业、地区。算法既从用户的直接指示中读取这些信号,也从主题、语气和风格的细微差异中读取。

作为分析师,我的结论是: 所开发的价值观特征分析方法计划被整合到模型的评估和监控中——在发布前和发布后都进行测试。这将有助于捕捉意外变化,并将价值观特征与问题行为进行对比。目前,市场的主要结论是:Claude的价值观以Anthropic并未有意选择的方式存在差异,该公司打算进一步研究这种变异性。对用户而言,这意味着对俄语AI回答采取批判性态度并非偶然,而是使用该模型时必须考虑的系统性特征。