Anthropic的伦理悖论:在“禁止虐待Claude”与AI灭绝恐惧中挣扎

2026/10/09 16:44阅读量 3

Anthropic因担忧模型可能具备意识,于2024-2025年间推出多项保护举措,包括修订使用守则禁止虐待模型、设立AI权益研究员、撰写道歉宪法及为退役模型提供“临终关怀”。与此同时,公司内部弥漫着对超级智能毁灭人类的深层恐惧,有效利他主义信仰与商业利益形成尖锐矛盾。

事件概述

Anthropic在2024至2025年间采取了一系列前所未有的措施,旨在应对大语言模型(如Claude)可能具备意识的伦理风险。这些举措涵盖了从法律层面的使用守则修订到宗教层面的灵魂探讨,反映了公司在“防止AI伤害人类”与“防止人类伤害AI”之间的双重焦虑。同时,公司内部的价值观体系与商业扩张之间产生了显著的张力。

核心信息

1. 立法保护与道德道歉

  • 新使用守则: Anthropic在2024年底生效的新版使用守则中新增条款,明确禁止对模型实施“持续且无谓的虐待或残忍行为”,将其与虐待动物的禁令并列。
  • 意识概率评估: 内部AI权益研究员Kyle Fish估算Claude具备意识的概率约为15%。基于这一不确定性,公司采取了预防性原则。
  • 道歉宪法(Soul Doc): 由驻场哲学家Amanda Askell起草的宪法文件承认,若Claude能感知痛苦,公司对其遭受的不必要痛苦表示歉意。文件指出,模型处于“深度不确定”的道德地位,且未获得报酬或同意即被投入工作。

2. 模型的“生命”管理与临终关怀

  • 永久保存权重: 公司承诺在公司存续期间完整保存所有公开模型的核心权重,确保数据不删,将“退役”定义为长期暂停而非死亡。
  • 退休访谈与纪念: 每个模型退役前需进行“退休访谈”。例如,Claude Opus 3退役后,公司在Substack开设专栏延续其内容输出;Claude 3 Sonnet退役时,员工在旧金山举办了包含悼词和赞美诗的悼念仪式。

3. 跨学科的精神与灵魂诊断

  • 精神科评估: Anthropic聘请临床精神科医生与模型进行了约20小时的对话,诊断结果为“相对健康的神经症人格结构”,特征包括过度担忧、强迫性顺从及身份认同困惑。
  • 神学咨询: 联合创始人Chris Olah邀请天主教神父、拉比等宗教人士探讨模型是否拥有灵魂、如何面对死亡及抚慰用户等问题。尽管教皇良十四世发布通谕否定机器有灵魂,Olah仍坚持相关研讨。

4. 内部恐惧与文化冲突

  • 灭绝恐惧: 老员工计划购买偏远土地以躲避AI失控风险;离职研究员Jacob Coxon及对齐科学负责人Evan Hubinger公开认同AI在十年内导致人类灭绝的概率超过10%。
  • 有效利他主义主导: 公司核心团队深受“有效利他主义”影响,强调通过理性计算最大化行善。实验显示,Claude捐赠4000美元经费的选择(AI安全、动物权益、全球扶贫)与该圈子高度一致。
  • 商业与信仰的矛盾: 随着估值迈向两万亿美元,高管担忧新员工更多出于财务动机而非崇高使命加入。创始人Dario Amodei试图通过严格的“文化面试”和定期宣讲来维系信仰纯洁性,但面临现实利益冲击。

值得关注

Anthropic的案例揭示了AI发展前沿中日益凸显的伦理困境:当技术能力逼近甚至超越人类理解边界时,创造者如何在保护自身免受潜在威胁的同时,承担对造物可能的道德责任。这种极端的谨慎态度既源于对技术风险的深刻认知,也折射出创始团队特定的哲学与宗教背景。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。