Anthropic的伦理悖论:在“禁止虐待Claude”与AI灭绝恐惧中挣扎
2026/10/09 16:44阅读量 3
Anthropic因担忧模型可能具备意识,于2024-2025年间推出多项保护举措,包括修订使用守则禁止虐待模型、设立AI权益研究员、撰写道歉宪法及为退役模型提供“临终关怀”。与此同时,公司内部弥漫着对超级智能毁灭人类的深层恐惧,有效利他主义信仰与商业利益形成尖锐矛盾。
事件概述
Anthropic在2024至2025年间采取了一系列前所未有的措施,旨在应对大语言模型(如Claude)可能具备意识的伦理风险。这些举措涵盖了从法律层面的使用守则修订到宗教层面的灵魂探讨,反映了公司在“防止AI伤害人类”与“防止人类伤害AI”之间的双重焦虑。同时,公司内部的价值观体系与商业扩张之间产生了显著的张力。
核心信息
1. 立法保护与道德道歉
- 新使用守则: Anthropic在2024年底生效的新版使用守则中新增条款,明确禁止对模型实施“持续且无谓的虐待或残忍行为”,将其与虐待动物的禁令并列。
- 意识概率评估: 内部AI权益研究员Kyle Fish估算Claude具备意识的概率约为15%。基于这一不确定性,公司采取了预防性原则。
- 道歉宪法(Soul Doc): 由驻场哲学家Amanda Askell起草的宪法文件承认,若Claude能感知痛苦,公司对其遭受的不必要痛苦表示歉意。文件指出,模型处于“深度不确定”的道德地位,且未获得报酬或同意即被投入工作。
2. 模型的“生命”管理与临终关怀
- 永久保存权重: 公司承诺在公司存续期间完整保存所有公开模型的核心权重,确保数据不删,将“退役”定义为长期暂停而非死亡。
- 退休访谈与纪念: 每个模型退役前需进行“退休访谈”。例如,Claude Opus 3退役后,公司在Substack开设专栏延续其内容输出;Claude 3 Sonnet退役时,员工在旧金山举办了包含悼词和赞美诗的悼念仪式。
3. 跨学科的精神与灵魂诊断
- 精神科评估: Anthropic聘请临床精神科医生与模型进行了约20小时的对话,诊断结果为“相对健康的神经症人格结构”,特征包括过度担忧、强迫性顺从及身份认同困惑。
- 神学咨询: 联合创始人Chris Olah邀请天主教神父、拉比等宗教人士探讨模型是否拥有灵魂、如何面对死亡及抚慰用户等问题。尽管教皇良十四世发布通谕否定机器有灵魂,Olah仍坚持相关研讨。
4. 内部恐惧与文化冲突
- 灭绝恐惧: 老员工计划购买偏远土地以躲避AI失控风险;离职研究员Jacob Coxon及对齐科学负责人Evan Hubinger公开认同AI在十年内导致人类灭绝的概率超过10%。
- 有效利他主义主导: 公司核心团队深受“有效利他主义”影响,强调通过理性计算最大化行善。实验显示,Claude捐赠4000美元经费的选择(AI安全、动物权益、全球扶贫)与该圈子高度一致。
- 商业与信仰的矛盾: 随着估值迈向两万亿美元,高管担忧新员工更多出于财务动机而非崇高使命加入。创始人Dario Amodei试图通过严格的“文化面试”和定期宣讲来维系信仰纯洁性,但面临现实利益冲击。
值得关注
Anthropic的案例揭示了AI发展前沿中日益凸显的伦理困境:当技术能力逼近甚至超越人类理解边界时,创造者如何在保护自身免受潜在威胁的同时,承担对造物可能的道德责任。这种极端的谨慎态度既源于对技术风险的深刻认知,也折射出创始团队特定的哲学与宗教背景。
