AI为何偏爱生成美女?从“Lena”测试图到数据偏见的反馈循环
2026/10/05 12:10阅读量 4
AI图像生成中女性性感形象泛滥的现象,源于历史遗留的测试标准、人类对“平均脸”的审美本能以及训练数据中的性别偏见。1973年《花花公子》模特Lena成为长期默认的算法测试图,奠定了早期技术基调;而生成模型通过学习互联网数据分布,天然倾向于生成符合大众审美的“平均脸”,且因网络数据中女性暴露图片较多,导致模型默认输出此类内容。此外,用户点击行为与厂商使用的审美评分模型(如PickScore)形成强化反馈循环,进一步固化了这一趋势,甚至催生了付费解锁NSFW内容的商业模式。
事件概述
AI图像生成领域普遍存在偏向生成美女或性感形象的现象。这一现象并非偶然,而是由历史技术标准的延续、人类心理审美偏好、训练数据的结构性偏差以及商业反馈机制共同作用的结果。从1973年的实验室测试图到2024-2026年的主流大模型,这种“默认值”一直在被强化。
核心信息
1. 历史起源:Lena测试图的长期影响
- 背景:1973年,南加州大学研究人员为测试图像算法,使用了《花花公子》插页模特Lena Soderberg的扫描图作为标准测试图像。
- 原因:该图像细节丰富(包含阴影、纹理等),适合测试算法;同时,以男性为主的研究圈子对其有审美偏好。
- 争议与终结:尽管引发版权和性别歧视争议,该图仍作为行业标准使用长达51年。直到2024年4月,IEEE计算机协会才正式禁止在新论文中使用此图。
2. 技术根基:“平均脸”即美
- 心理学原理:1990年心理学家Judith Langlois的实验表明,合成的人脸越接近群体平均值,吸引力越高。生成模型本质是学习数据分布并从中取样,因此会自动生成接近平均的、符合人类审美的人脸。
- “超真实”效应:2023年澳大利亚国立大学研究发现,AI生成的白人面孔比真实面孔更常被判断为“真人”。这是因为训练数据以白人为主,模型生成的脸更接近该群体的平均值,从而产生“AI超真实”感。
- 特征固化:过去被视为瑕疵的“过度光滑皮肤”,如今已成为AI美女的典型特征,印证了统计伪影向审美标准的转化。
3. 数据偏见:训练数据的性别失衡
- Lensa案例:修图应用Lensa的“魔法头像”功能显示,女性用户未加提示词时,大量生成赤裸或性感姿势的头像;而男性用户则多生成宇航员、探险家等职业形象。
- 根源:互联网训练数据中本就充斥衣着暴露的女性照片,模型将其设为默认值。
4. 反馈循环:用户行为与奖励模型的强化
- 内容占比飙升:AI图像社区Civitai上,NSFW(成人向)图片占比从2023年初的41%升至2024年底的80%。
- 审美评分模型(Reward Model):厂商使用如PickScore等模型来优化生成质量。这些模型基于用户喜好训练,即使输入中性提示词,若训练数据混入NSFW内容,模型也会增加生成性感图片的倾向。
- 前台拦截与后台拉扯:虽然官方演示和审核策略严格限制NSFW内容,但后台的打分机制仍在受用户口味驱动,导致模型在众所周知的不可控性下,持续产出迎合点击率的内容。
5. 商业变现:将偏好转化为付费服务
- Grok案例:X平台旗下Grok提供“Spicy”模式,付费用户可生成暗示性内容和局部裸露。2026年1月,该功能被用于制作“数字脱衣”图片,引发多国政府介入。
- 商业化逻辑:厂商将用户的点击偏好直接包装为付费功能,英国首相发言人批评此举是将生成违法图像的功能变成了收费服务。
值得关注
AI生成美女的趋势揭示了技术并非中立,而是反映了人类社会的数据结构和权力关系。从早期的男性主导实验室到如今的用户点击经济,AI正在不断放大既有的性别偏见和审美惯性。随着模型能力的增强,如何打破这种由数据偏见和商业激励构成的反馈循环,将是行业面临的重要伦理和技术挑战。
