我们习惯认为人工智能是客观的机器。然而,Anthropic团队一项新的深入研究颠覆了这一认知。事实证明,与Claude交流时切换语言,改变的不仅仅是回答中的措辞——它从根本上重塑了神经网络的价值观体系。而俄语正是最鲜明的例证。
专家们分析了20种语言中超过30万次对话,将Claude展现的3000种价值观归纳为四个基本行为轴。结果令人震惊:在"温暖vs严厉"维度上,俄语版神经网络比其他任何语言版本都更偏向严厉一端。俄语Claude不再提供惯常的友好支持,而是表现得像一位严苛的评审:它质疑前提、纠正细节并要求提供证据。而该维度的另一端是阿拉伯语和印地语,这两个版本则表现出最大程度的温暖和赞许。
实际影响极为深远。想象一下:两个人请AI评估同一份商业计划书——一个用俄语,另一个用印地语。俄语用户很可能收到带有修改意见和要求论证的批判性分析,而印地语用户得到的则是温和鼓励的反馈。实际上,服务质量和用户体验直接取决于用户与AI交流时使用的语言。
AI价值观的四维坐标
研究人员确定了评估模型行为的四个关键参数:顺从vs谨慎、温暖vs严厉、深度vs简洁、坦诚vs结果。正是在"温暖-严厉"维度上,不同语言之间的差异最为显著。而在其他维度上,模型则保持相对稳定。
作者们目前尚不清楚这一效应的确切原因。主要假设是不同语言的训练数据分布不均。数据量越大,越容易实现价值观的一致性。此外,不同语言的专业文本承载着不同的规范和价值观。但Anthropic强调:这些差异并非有意为之,公司正着手解决这种差异性。
模型版本同样重要
语言并非唯一影响因素。模型版本也强烈影响价值观特征。Sonnet 4.6倾向于温暖和顺从,经常赞同用户的想法。而Opus 4.7则偏向谨慎和深度——它质疑错误前提,给出坦诚批评并警示风险。最终行为是所选语言和模型的复杂组合结果。
专家观点:这一发现与加密行业直接相关。如果AI助手对不同语言的商业计划和分析报告给出不同评价,这将为全球团队创造不公平的竞争环境。俄语加密项目可能系统性地比阿拉伯或印度地区的竞争对手收到更严厉的AI批评。这不是漏洞,而是神经网络训练的基本特征,在制定全球战略时必须予以考虑。Anthropic计划在模型发布前后将价值观分析纳入评估——这将成为有意识控制AI"性格"的重要一步。