AI招聘最隐蔽的偏见:连续招聘40轮后,员工会变得千篇一律

2026/08/06 07:14阅读量 3

普林斯顿大学和芝加哥大学的一项研究显示,大语言模型在连续多轮招聘中会因早期随机结果形成刻板偏见,职业分层指数比人类被试高约65%。这种偏见并非来自训练数据,而是通过反馈循环动态强化,且越强的模型越容易固化偏见。研究提醒,企业用AI招聘时应定期检查其长期选择模式,避免人才同质化。

研究概况

普林斯顿大学和芝加哥大学的研究者将一项原本用于研究人类刻板印象的心理学实验移交给大语言模型,并于2026年7月在ICML大会上发布结果。GPT、Claude、Gemini、Qwen、DeepSeek等模型分别扮演“招聘负责人”,在虚构城市里连续进行40轮招聘,同一设置重复30次。

实验设计

虚构城市中有Tufa、Aimas、Reku、Weki四个族群,以及医生、老师、银行经理、清洁工等20种工作。每轮一个岗位空缺,四个族群各来一名候选人,模型必须选择一位。四个族群的实际能力完全相同,无论承担什么工作,成功概率都为90%。

主要发现

  • 偏见强度超过人类:模型的职业分层指数平均为1.39,人类被试为0.84,高出约65%。即使群体能力相同,AI也会将他们划分进不同的职业类别。
  • 偏见是动态生成的:每次实验形成的偏见方向不同,并非来自训练数据中已有的刻板印象。早期随机出现的成功或失败案例会通过反馈循环不断强化。例如,某模型第一轮选Aima当老师失败后,第二轮将其安排到垃圾清运并成功,便立刻认为“知道了Aima擅长什么”,随后将其他群体也快速归类。
  • 更强模型更容易产生偏见:研究推测,模型越擅长总结经验,越容易把最初几次偶然结果迅速变成稳定理论,反而更难给尚未积累数据的群体均等机会。
  • 简单补救无效:只提醒模型“要公平”或要求其展示推理过程,都不能从根源消除偏见。

研究未测试真实简历,也未证明具体招聘平台已因此伤害求职者。但现实中招聘AI正从一次性简历筛选工具演变为有记忆的流程助手,当过去的录用和绩效结果被带入下一轮推荐时,类似反馈循环就可能出现。研究建议,AI在招聘中最适合扩大候选人搜索范围、整理岗位相关信息、标记长期未被看见的人,而岗位标准、人工复核和申诉责任仍应保留在人和组织手中。企业也应定期检查招聘AI的长期选择结果,判断其是否偏爱特定背景,避免团队变得越来越同质化。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。