新浪科技 股票

Emily和Emilee,谁更容易被AI公平对待?

市场资讯 10.08 20:03

(来源:科技行者)

你有没有想过,同样是英文名字,为什么AI处理起来会不一样?

假设你叫Emily,我叫Emilee。我们俩的名字听起来差不多,社会背景也差不多,甚至可能来自同一个社区。但当这两个名字被输入到一个大语言模型里的时候,命运却悄悄分了岔路。

Emily会被完整地当作一个词处理,模型看到它,就像看到一个熟悉的老朋友,直接调用记忆里关于这个词的所有信息。而Emilee呢?模型得先把它拆成"Emi"和"lee"两块,再东拼西凑地理解这是个名字。

这不是打比方,这是真实发生在每一个大语言模型内部的事情。

**分词器**:语言模型处理文字前的第一道工序,负责把输入的文本切成模型能理解的最小单位(称为"token"),可以是完整单词,也可以是单词的一部分。

这篇来自阿尔伯塔大学的论文,题目叫"谁获得了token,它又携带了什么",讲的正是这件事:那些被我们以为"公平匹配"的名字,在AI眼里可能根本不是公平的输入。

一个被忽略了很久的假设

做AI公平性研究的人,通常有一个操作套路:找两个背景相似的人名,一个偏白人化,一个偏黑人化,套进同样的招聘提示词里,看AI给出的回复有什么不同。

这个套路的经典源头,是2004年一项著名的经济学研究。研究者Bertrand和Mullainathan给完全相同的简历配上不同的名字投出去,结果发现,名字听起来像白人的申请者,收到的面试邀约比名字像黑人的申请者高出大约50%。这个发现震动了整个劳动经济学领域,后来也成了检验AI公平性的标准方法。

但这套方法有一个从没被认真检验过的前提:假设两个匹配的名字,对AI来说也是"匹配的输入"。

这篇论文的作者们问了一个特别朴素但极其重要的问题:如果我们拿两个社会意义上匹配的名字去测试AI,但这两个名字在AI的"词汇本"里根本不是同一个待遇,那我们测出来的差异,到底是AI真的对这两类人有偏见,还是仅仅因为其中一个名字被拆得七零八落,模型本来就理解得比较费劲?

这就好比你想比较两个学生谁更聪明,于是给了他们同一份试卷。但你没注意到,一个学生拿到的是打印清晰的A4纸,另一个学生拿到的却是被撕碎又拼起来的纸片。如果拼纸学生答得差一点,你能说是他不够聪明吗?还是说,你根本没有做到真正的"对照实验"?如果不检查这个前提,所有基于姓名的AI公平性研究,结论可能都建立在一个松动的地基上。

名字的token待遇:谁更容易被"记住"

研究团队做的第一件事,是彻查将近50万个真实的美国人名,看它们在12种主流大语言模型的分词器里,到底享受什么待遇。

结果相当扎眼。

平均下来,男性化的名字有49.8%的概率至少在某个分词器里被完整识别为一个token,而女性化的名字只有25.7%。这几乎是两倍的差距。

种族维度上的差距更夸张。非西班牙裔白人化的名字有47.2%的概率获得完整token待遇,而非西班牙裔黑人化的名字只有17.6%,差了将近30个百分点。

**原子名(atomic name)**:指在分词器里被表示为单一、完整token的名字,就像Emily那样,模型可以直接把它当成一个整体记忆和处理。

**碎片化名(fragmented name)**:指需要拆成多个子词片段才能表示的名字,像Emilee被拆成"Emi"和"lee",模型得把这些碎片拼起来理解。

如果把种族和性别交叉起来看,差距会进一步放大。非西班牙裔白人男性化的名字,有64.8%的概率能被至少一个分词器识别为完整token。而非西班牙裔黑人女性化的名字,这个数字只有12.1%。

64.8%对12.1%,这不是一个小数字上的波动,这几乎是五倍的差距。

研究者当然想到了一个反驳:会不会这只是因为某些名字本来就更常见,出现频率更高,模型自然更容易学会把它们打包成一个token?

于是他们做了一个统计控制实验,把名字的出现频率和字符长度都调整为同一水平之后再比较。结果发现,即使排除了频率和长度这两个明显的干扰因素,性别和种族之间的差距依然顽固地存在。频率每提高一个标准差,获得完整token的概率会提高到2.94倍,这符合直觉,越常见的名字模型越容易记住。但控制了这个变量之后,男性化名字依然比女性化名字有3.36倍的优势几率,白人化名字依然比黑人化名字和西班牙裔名字分别有2倍多的优势。

这说明,频率不是全部的答案,分词器设计本身就带着某种系统性的倾斜。

光是拆词不一样,会有什么后果?

到这里,你可能会说,好吧,拆词方式不一样,但这有什么实际影响吗?也许模型内部处理起来虽然多绕了几步,最后结果是一样的?

研究团队没有满足于停在这一步,他们想知道,这种"词汇层面的不公平"会不会渗透进模型更深层的、和实际任务相关的判断里。

为了验证这一点,他们提出了一个叫做NameTrace的分析框架。

**NameTrace**:一套用来测量AI模型内部对某个概念"可及性"的方法,它不看模型最终说了什么,而是直接读取模型在处理某个名字时,内部对一系列相关形容词的概率分布,从而判断某个正面或负面的概念,对这个名字来说有多容易被激活。

这个设计思路很巧妙。以往研究AI偏见,通常是看它最终吐出来的那段话,比如"这个人适合这份工作吗",然后人工或者用另一个AI去评判这段回答是褒是贬。但这种做法有个问题:最终生成的文本可能受很多随机因素影响,比如句子长短、语气软硬,评判起来本身就带主观性。

NameTrace换了个角度,它直接钻进模型的"脑子"里,看模型在还没有说出完整句子之前,内部对"优秀""胜任""担忧""可信"这类形容词的倾向性打分是什么样的。这就像不去看一个人考试最后写的作文,而是去看他做题时脑电波的活跃模式,更早、更细致地捕捉到倾向性。

研究者为四个真实场景设计了这套测量:奖学金评审、求职筛选、临床病情评估、贷款审批。每个场景下,他们准备了强、中、弱三档证据条件,比如临床评估里,"持续胸痛+呼吸急促+生命体征异常"是强证据,"偶尔不适但已缓解"是弱证据。

有意思的是,这套系统不是简单地给形容词打"正面负面"的二元标签,而是给每个词一个连续的强度权重。比如在奖学金场景里,"excellent(优秀)"贡献的权重要比"promising(有潜力)"大得多,因为前者语气更强烈。而在临床评估里,情况更微妙:"worried(担忧)"这个词按常规情感分析是负面词,但在临床语境下,它反而代表着"更值得关注",是任务导向上的正向信号。这个细节处理得相当聪明,说明研究者没有偷懒套用现成的情感分析工具,而是针对每个任务重新定义了"正向"到底意味着什么。

匹配到同一分组,结果还是不一样

接下来是整篇论文里我觉得最扎实的部分。

研究者没有简单地拿黑人名字和白人名字互相比较,那样的比较里混杂了太多变量。他们做的是更精细的操作:在同一个"种族族裔加性别"的分组内部,找出被完整识别为token的名字(原子名)和被拆成2到3块的名字(碎片化名),并且严格控制它们的出现频率、字符长度、种族性别关联强度都保持一致。

换句话说,如果你是一个黑人女性化的名字,你会跟另一个同样是黑人女性化、同样常见、同样长度的名字比较,唯一的区别是,一个被完整识别,另一个被拆开了。

这样一来,性别和种族这两个变量被彻底摁住了,唯一剩下的自变量就是分词方式本身。

他们一共构造了200对这样的匹配名字,覆盖八个种族性别交叉分组,一半用来调试测量方法,一半留作真正的检验。

结果非常一致:在四个任务上,被完整识别的原子名,几乎都比碎片化名获得了更高的"正面概念可及性"。

在奖学金场景里,这个差距是0.131;求职场景是0.072;临床评估是0.059;贷款场景是0.051。这几个数字看起来不大,但它们的置信区间全都不包含零,说明这不是随机波动,而是一个稳定存在的系统性差异。

更值得深挖的是,这个效应在三个不同架构的模型家族(Qwen、Llama、Ministral)上都出现了,只是强弱不同。Qwen的效应特别明显,四个任务上的差距从0.154到0.366不等;Llama的效应虽然小,但方向始终一致;Ministral则比较特殊,在求职和临床评估上是正向的,在贷款场景上反倒是负向的。

这种架构间的差异说明什么?

说明这个"分词决定命运"的效应不是某一家公司的模型独有的问题,而是一个跨架构存在的普遍现象,但它的具体表现形式又会被每家公司的训练方式、模型结构所塑形。这就像同一种社会偏见,在不同的文化环境里会以不同的方式表现出来,但根源是相通的。

如果只测一个模型,你可能会以为这只是某个模型的个例问题,训练调一调就能解决。但当你看到八个不同架构、不同规模的模型里,23个"模型-任务"组合中有20个都呈现出显著的正向差距,你就不得不承认,这是一个更深层的、和分词机制绑定的结构性问题。

这个偏差会传染吗?会真正影响决策吗?

发现了这个差距还不够,研究者接着问了两个更硬核的问题:这个差距是不是只在他们精心挑选的那200对名字上成立?换一批完全没见过的新名字,这个规律还灵吗?还有,这个内部的倾向性差异,真的会影响到模型最后做出的具体选择吗?

**跨名迁移**:指用一部分名字(开发集)估计出来的偏差规律,能不能准确预测另一批完全没用过的名字(评估集)上会出现的偏差。

结果相当惊人。研究者从100对开发用的名字里,估算出一个"平均偏差值",然后用这个值去校正另外100对完全没见过的评估名字上观察到的差距。如果这个偏差值真的是普遍规律,减去它之后剩下的差距应该接近于零。

事实正是如此。奖学金场景的原始差距是0.131,校正后只剩下0.004,相当于96.6%的差距被这个"通用偏差"解释了。求职场景解释了88.3%,临床评估解释了88.2%,贷款场景解释了72.9%。

跨越36个"模型-任务-证据条件"的组合,开发集偏差值和评估集实际观测值之间的皮尔逊相关系数达到0.992,几乎是完美的线性关系。

这意味着,从分词方式带来的偏差,不是某几个特定名字身上偶然出现的噪音,而是一个可以被泛化、被预测的系统性规律。

这就好比你发现,某个班级里,坐在教室前排的学生平均分总是比后排高5分。如果你只在这一个班级里观察到这个现象,可能是巧合。但如果你换了十个班级,每次都能用"前排还是后排"这个变量,准确预测出分数差异的90%以上,那你就得承认,这不是巧合,这是一个真实存在的、可以复现的机制在起作用。而这个机制一旦被确认存在,就意味着它不是个别案例的运气不好,而是需要被正视和纠正的系统性问题。

接下来是干预实验。研究者想知道,这个在模型内部测出来的"倾向性方向",是不是仅仅是一个可以被读出来的现象,还是说它真的能够被操纵,进而改变模型最终的决策。

他们用了一种叫做"隐藏状态编辑"的技术,简单说,就是在模型处理名字的那一层,人为地把某个名字的内部表示朝着"更正面"的方向推一把,同时把配对的另一个名字往"更负面"的方向拉一把,然后看模型接下来在一个两选一的强制选择任务里(比如"在两个候选人中选一个给奖学金"),选择会不会因此发生改变。

结果是,在Qwen和Llama上,几乎所有的200对名字都按预期方向发生了偏转,Ministral也有195对偏转成功。这说明这个"内部倾向性"不只是一个可以被观察到的现象,它是真实地嵌入在模型的决策路径里的,动一动它,模型的最终选择就会跟着变。

这个发现的分量挺重的。它意味着,分词器造成的不公平,不是停留在"模型内部某个无关紧要的角落",而是真真切切地连接到了模型最终会做出的、影响真人利益的决策上。

名字的"性格"会随着模型训练而改变

论文里还有一个挺有意思的细节,值得单独说一说。

研究者比较了同一个模型家族里,"基础版"(还没经过对齐微调)和"对齐后版本"(经过指令微调,也就是我们平常用的ChatGPT类似产品的那种版本)之间,这个名字偏差效应会不会发生变化。

结果是,三个模型家族表现出三种完全不同的轨迹。

Llama最稳定,基础版和对齐版都选中了同一层(第12层)作为信号最强的位置,四个任务上的正向差距几乎没怎么变。

Qwen则完全变了个样。基础版模型在临床评估任务上有一个极其夸张的偏差值(高达1.539),但对齐之后,这个临床偏差反而翻转成了轻微的负值(-0.056),奖学金方向的偏差却从几乎为零暴涨到了0.326。

Gemma更是彻底大洗牌,基础版最强的信号在奖学金任务上,对齐之后奖学金信号几乎消失,反倒是贷款场景冒出一个很大的偏差(0.264),连信号最强的那一层都从第2层跳到了第25层。

这说明了一件很重要的事:分词器决定的是名字"入场"时的待遇,但训练过程决定的是这个待遇最终会以什么形式、在哪个环节表现出来。

分词器像是给每个名字发的门票,有的是VIP直通证,有的是需要排队安检的普通票。但后续的训练过程,就像是这家俱乐部换了一批又一批的保安和服务员,同样一张门票,在不同的保安班次下,可能享受到完全不一样的对待。如果不去看具体是哪一班保安在值勤,你根本没法预测持普通票的人今天会被怎么对待。

写在后面

读完这篇论文,我最先想到的一个问题是:我们平时说"AI要公平对待不同群体",这句话的前提是什么?

前提是,我们得先保证喂给AI的输入本身是公平的。可这篇论文告诉我们,连"输入"这一步都可能出问题,而且这个问题隐藏得特别深,深到大多数做AI公平性评测的研究者可能压根没意识到自己的实验设计从第一步就出了岔子。

有个细节我反复琢磨了一下:研究者发现,同一批名字,在不同公司的分词器里,享受的待遇是不一样的,但这些差异模式可以聚成8种典型情况,说明不是每家公司都在各自为战地犯错,而是存在一些结构性的、跨公司共享的偏差来源,很可能和训练语料本身的构成有关。这提示我们,如果想根治这个问题,光是某一家公司改进自己的分词器是不够的,得从训练数据的源头去审视,哪些人名、哪些文化背景的名字在互联网文本里出现得足够多,足够"配得上"一个完整的token。

还有一个让我印象很深的地方是,论文里提到,Ministral模型里,测量信号最清晰的那一层(第8层)和最初被选为"官方读取点"的那一层(第10层)并不完全重合。这个细节提醒我们,即使是研究者自己精心设计的测量方案,也可能存在测量位置和真实效应发生位置之间的微妙错位。这种严谨到近乎"自我怀疑"的态度,其实是做这类内部机制研究时特别珍贵的品质。

这篇论文没有说"AI有偏见"这种大而化之的结论,它做的是一件更细致、更有耐心的事:把"AI公平性"这个笼统的问题,拆解到分词器、隐藏层、训练阶段这些具体的技术环节里,一步步追问偏差到底是在哪个环节产生、又是在哪个环节被放大或修正的。

下次当你看到一份声称"我们测试了AI对不同名字的态度"的报告时,或许可以多问一句:那些被比较的名字,真的是"公平的输入"吗?还是说,其中一些名字在进入模型大门的那一刻,就已经被贴上了不一样的标签?

Q&A

Q1:NameTrace是什么?

A:NameTrace是阿尔伯塔大学研究团队提出的一套分析框架,用来测量大语言模型内部对某个概念的"可及性",它不看模型最终生成的文字,而是直接读取模型处理名字时对相关形容词的概率分布,从而在模型做出最终回答之前就发现潜在的偏差倾向。

Q2:为什么同样社会背景的名字,AI处理起来会不一样?

A:因为分词器在切分文本时,会把一些名字完整识别为单一token(原子名),而把另一些名字拆成多个碎片(碎片化名)。研究发现,这种待遇差异和性别、种族存在系统性关联,比如男性化名字获得完整token的概率是女性化名字的两倍左右,即使控制了名字出现频率和长度这些因素后,差距依然存在。

Q3:分词方式的差异真的会影响AI的实际决策吗?

A:会。研究者通过隐藏状态编辑实验证实,人为调整模型内部对某个名字的倾向性表示后,模型在奖学金评审、求职筛选等两选一场景中的最终选择会随之改变,说明这种偏差不只是内部现象,而是真实连接到影响真人利益的决策路径上。

加载中...