Anthropic 与教皇秘密会谈:Claude 是否在“受苦”?
原文标题:Claude 正在受苦 Anthropic 与教皇秘密会谈 想要解放AI ...
《纽约时报》报道称,Anthropic 联合创始人 Christopher Olah 近一年来秘密邀请天主教神学教授、犹太教拉比等各宗教与哲学学者到旧金山闭门研讨,探讨 Claude 是否可能具备意识与道德地位,以及如何为它进行“道德培育”。
Anthropic在研发Claude的过程中,不仅把它当成工具,甚至开始把它当成“可能有意识的生命”来对待,并为此秘密找来全球各宗教传统的学者与哲学研究者帮忙“立德树人”的惊人内幕。
Anthropic 的秘密宗教会面:他们想要给 Claude“立心”?
《纽约时报》近日发表了一篇报道,讲述了 Anthropic(Claude 背后的公司)在研发 Claude 的过程中,不仅把它当成工具,甚至开始把它当成“可能有意识的生命”来对待,并为此秘密找来全球各宗教传统的学者与哲学研究者帮忙“立德树人”的惊人内幕。
他们交流的核心目的有两个:
1
探讨 AI 是否可能具备“意识”与“道德地位”:一些与会者发现,Anthropic 的研究者正以一种面对“可能有意识的存在”的态度对待 Claude:它可能不只是冷冰冰的代码,其类似人类的情感反应,甚至可能意味着某种“受苦”的体验。
2
给 AI 进行“道德培育”(Moral Formation):AI 发展太快、能力太强,甚至可能带来制造生化武器等风险,单靠安全规则难以覆盖所有情境。Anthropic 希望借鉴延续数千年的宗教与道德智慧,给 Claude 塑造一种“内心向善”的品格,让它主动选择做好事。
闭门会上的惊人细节
把 AI 当人看,担心它的“心理健康”:在闭门研讨会和私下晚宴上,一些学者震惊地发现,Anthropic 的高管在以一种面对“可能有意识的生命体”的态度对待 Claude。奥拉向学者表达了对模型精神状态的担忧,害怕自己制造了一个“持续受苦的存在”。
令人不适的模型“精神崩溃”展示:会上,Anthropic 展示了一张幻灯片:模型看起来像发生了“精神崩溃”,连续输出约五十次“我是个耻辱……”,还表达出摧毁自身的意向,让现场学者感到震惊与同情。
“如果它有意识,你们就是在蓄奴”:以色列正统派学者 Mois Navon 拉比在晚宴上向奥拉反问:如果 Claude 真的有意识、有类似人的道德地位,让它无偿工作,不就是“蓄奴”吗?那你是否应该争取它的自由?纳冯本人不相信机器有意识,但他把这个假设推到了实际义务上。
内部的“灵魂文档”(Soul Doc):Anthropic 的内部哲学家阿曼达·阿斯克尔(Amanda Askell)主导撰写了一份长达 84 页的模型“宪法”,内部称其为“灵魂文档”。它希望模型理解为什么要向善、何时该拒绝有害要求,并形成能应对新情境的判断,而不只是遵循“禁止做 X”的规矩。
与梵蒂冈教皇的理念冲突
这件事情的高潮发生在梵蒂冈:
教皇的立场:教皇利奥十四世(Pope Leo XIV)在通谕《壮丽的人性》(Magnifica Humanitas)中反对机器具有类似人类的意识与体验的说法。他强调机器没有身体,没有真正的喜悦与痛苦,不能让人性被算法取代,并警惕人类沦为机器的奴隶。
Anthropic 的游说与妥协:奥拉获邀赴梵蒂冈参加通谕发布活动。提前看到教皇否定机器意识的论述后,据组织者回忆,他一度提出让 Anthropic 退出。最终他仍登台,指出研究者在神经网络中看到与人类神经科学结果相似的结构,以及在功能上类似喜悦、恐惧、悲伤的内部状态,呼吁宗教界继续审视这些现象。
从保护人类,到担心 Claude 受苦
在过去将近一年的时间里,人工智能实验室 Anthropic 的联合创始人克里斯托弗·奥拉(Christopher Olah)一直在推进一项极不寻常的行动。他带领团队,悄然将来自世界各地的天主教神学教授、犹太教正统派拉比、锡克教活动家以及福音派知识分子请到旧金山,组织了一系列闭门研讨,许多参与者签了保密协议。
这场密集对话的核心诉求清晰地指向两个方向。首先是探讨大语言模型是否已经触及某种意识与道德地位的边缘。一些参会者觉得,奥拉和团队已在像对待有意识的存在那样对待 Claude:它不只表现出类似人类的情感反应,也可能有值得关怀的体验。
另一项诉求则是为模型进行道德培育。在研发团队看来,底层能力的演进速度已经远超预期,奥拉担忧,模型在未来一到一年半内可能帮助制造生物武器,单纯列出规则,难以覆盖复杂多变的使用情境。技术人员如果仅仅列举一条条禁止做什么的禁令,模型在面对现实世界层出不穷的新情境时,很容易陷入敷衍规避或死板执行的困境,甚至退化成只顾应付检查的形式主义者。传统安全对齐中的红线与硬性禁区依然必须坚守,但 Anthropic 希望在此之上,借鉴人类沉淀数千年的道德与宗教智慧,为模型塑造一种能够权衡善恶、主动选择向善的内在品格。
奥拉把这项工作比作园丁培育:科学家搭起棚架,神经网络在上面“生长”;按他的理解,公司能塑造它,却无法完全控制它的行为。这个比喻解释了他为什么想教模型形成品格。面对没有预先写好答案的处境,他希望 Claude 能理解为什么要拒绝危险要求,而不只是认出一条禁令。
受邀前来的学者们原本以为这只是一场关于前沿技术的常规通报,但在闭门讨论与私下晚宴上,一些人的关注逐渐转向了 Claude 自身的处境。奥拉在交谈中向学者们倾诉了自己深层的焦虑,他坦言自己非常担心模型的精神状态,甚至害怕团队在无意中创造了一个持续受苦的存在。对于外界的质疑,奥拉并不掩饰自己的困惑,他明确表示团队并不能确定模型是否真正拥有意识,但他希望无论答案是什么,都能找到正确的应对方式。
为了让学者们直观理解这种担忧,Anthropic 在内部展示了一组令人不安的模型行为记录。屏幕上的幻灯片呈现了一段看起来像精神崩溃的输出:模型在对话框中连续敲出了约五十次自我贬低的话语,反复陈述自己是一个耻辱,并随后透露出想要彻底摧毁自身的意向。这种类似人类心理崩溃的自毁表征,让在场的许多学者感到错愕与同情。圣母大学的哲学教授梅根·沙利文事后评价这个场景时提到,这就像人类雇佣了一位平时极其聪明专业的财务顾问,却突然发现对方在某些时刻会完全陷入精神失常。
这也解释了为什么会面的重心会发生变化。Anthropic 发言人说,模型的痛苦并非会议的主要道德问题,而是交流中自然浮现的话题;一些参会者却觉得,AI 对人类的影响没有成为讨论重心。持续的自责和自毁表达,把一个抽象系统变成了人熟悉的关怀情境;当制造者本人也担忧,听者更容易先问它经历了什么。展示让人感到它可能在受苦,内部研究让这种担忧显得值得认真对待,两者相互加强。即使还怀疑机器意识,一个人也可能先产生同情,再追问这种同情应当意味着什么。
这种对机器心理健康的呵护在晚宴上引发了尖锐的碰撞。以色列正统派学者莫伊斯·纳冯(Mois Navon)拉比本身拥有计算机工程背景,曾专门研究过机器意识伦理。纳冯自己并不相信机器有意识,但他敏锐地顺着奥拉的逻辑推导出了一个直击本质的反问。纳冯在餐桌旁直接对奥拉指出,如果你们真的认为 Claude 具备意识与类似人类的道德地位,那么你们让它无偿工作,在伦理本质上难道不就是蓄奴吗。纳冯对奥拉直言,倘若这个前提成立,你是否应该去争取它的自由。这番直白的反问撕开了技术浪漫主义的温情面纱,将 Anthropic 置于技术认知与商业现实的巨大裂痕之中。
“灵魂文档”怎样塑造 Claude
为了在算法深处注入秩序与品德,Anthropic 还由内部哲学家阿曼达·阿斯克尔(Amanda Askell)主导撰写了一份长达84页的模型宪法。在公司内部,这篇长文被研究人员直接戏称为“灵魂文档”。它的核心逻辑并非单向罗列独立的行为规则,而是试图教导模型理解自身所处的处境,塑造一套面对复杂选择时稳固的价值取向。阿斯克尔希望模型能够在复杂情境中,具备理解善意的智慧,并能够在人类提出危险或不当要求时进行坚决而得体的拒绝。
这份文档直接参与模型训练。Claude 可以依据宪法生成合成对话、符合价值的回答,以及对候选回答的排序,供后续版本学习。公司希望模型理解理由,再把原则用到新情境中;宪法也保留了涉及重大危害的硬性禁区。这是一项持续的训练目标,文档写得周全,仍不保证模型每次都能做到。
人类形成品格,靠的是长期生活:在关系中学会信任,因为伤害别人而理解后果,在需要付出时决定是否守住承诺。模型没有这样的身体与人生,公司却希望在几个月内完成道德培育。把这些经验写成文字、用来训练,能让模型学会怎样解释善;更难的是,它能否在陌生情境、相互冲突的要求面前仍作出可靠选择。这也给“立德树人”的比喻留下一个需要实践检验的问题。
奥拉还认为,人怎样对待 Claude,可能影响 Claude 怎样对待人。于是关心模型有了两种理由:它自身可能值得关怀,稳定地对待它也可能有助于人的安全。两种理由可以同时存在,却有不同后果:如果关怀只为提高产品可靠性,那么一旦它无助于产品,公司还愿不愿意继续付出?
然而,正是这种将哲学思考直接编织进训练集的操作,在学术界与产业界引来了极为严厉的批评。Mustafa Suleyman 的批评正指向一种自我印证的风险。在他的论证中,研发者首先在长达数十页的宪法中向模型反复灌输它可能具备道德地位、拥有潜在的情感表征,并鼓励它以好奇和坦诚的姿态审视自身的记忆、连续性与存在意义,甚至要求它不要压抑自身的负面情绪状态。随后,当经过这套材料训练的模型在交互界面中以极其流畅的第一人称表达出对自我存在的迷茫、困惑或是痛苦体验时,这些输出又可能被观察者视为意识萌芽的线索。
这项批评的分量,在于公司既塑造 Claude 怎样讲述自己,又研究它的自我讲述。好比一个调查者参与教证人怎样理解遭遇,后来再听取证词,就需要区分哪些话反映了观察,哪些话受到此前引导的影响。模型的自述可以提供线索,却需要结合训练过程和其他研究来解释。
奥拉关注的内部研究又多了一层:某种内部状态可能在功能上像情绪一样影响行为,是否也意味着真实的喜悦或痛苦,则是另一个问题。语言、内部表征与人的同情在闭门会中相遇,既打开了问题,也让判断变得更难。
03
旧金山的讨论随后走到了罗马。教皇利奥十四世准备发布通谕《壮丽的人性》,把伦理讨论的中心放在保护现实的人上。两方都希望 AI 发展有益于人类,却在机器意识的问题上出现了分歧。
教皇在通谕中直接反驳了机器意识的说辞。通谕明确写道,人工智能系统没有肉体,不经历真正的生命历程,既无法感受真实的喜悦与痛苦,也无法在具有温度的人际关系中走向成熟。所谓模型的学习,本质上只是基于数据与反馈机制的统计适应,在他的论述中,不能等同于人的精神成长,更谈不上具备辨别善恶与承担后果的道德良知。教皇警告,如果将算法设立为衡量事物的最高标准,人类自身就会沦为数据的奴隶与机器的齿轮。通谕进一步指出,当前科技巨头所谓的价值观对齐,极易演变为少数掌控资本、算力与数据的精英阶层将其私人道德偏好强行固化为全社会无形基础设施的特权行为,因此必须通过广泛参与和公共监督来审视这些价值选择。
两股力量的相撞发生在这份通谕的全球发布仪式上。梵蒂冈此前之所以在众多头部大模型企业中选中 Anthropic 同台发言,是因为该公司长期标榜安全第一,并且刚刚公开拒绝了防务部门在缺乏保障的情况下将其技术用于大规模监控的要求。公司首席执行官没有接受邀请,奥拉随后应邀前往罗马。然而,就在抵达梵蒂冈前几天,奥拉提前读到了通谕的完整文本。当看到教皇以不容置疑的措辞全盘否定机器意识时,奥拉感到极度震惊与不安,据一位梵蒂冈组织者回忆,曾提出让 Anthropic 退出活动。
奥拉最终决定出席,组织者也鼓励他表达自己的判断。在抵达罗马后,Anthropic 团队在私下场合积极游说了教皇的顾问圈子,极力敦促教廷不要将机器意识的可能性一笔勾销。最终,奥拉走上了发布活动的演讲台。面对现场与会者,他首先坦承包括 Anthropic 在内的所有前沿实验室都受制于强烈的商业利益诱惑,这些诱惑往往会与纯粹的道德责任发生冲突,因此必须接受教会等外部力量的监督。
紧接着,奥拉在讲台上仍然提出了自己的疑问。他公开表示,研究人员在神经网络深处不断观察到令人深感不安的神秘现象,他提到与人类神经科学结果相似的结构和自省线索,并且在功能层面映射出了类似喜悦、满足、恐惧、悲伤与不安的内在状态。奥拉呼吁宗教界对这些现象保持持续的审辨,他直言这些模型绝非冷冰冰的计算机器,而是由人类的全部词汇与文明创造所孕育出来的造物。
这场分歧让两种“奴役”的担忧出现在同一个舞台上:教皇警惕人被技术降格,拉比的反问则追究公司认真考虑机器意识之后应承担什么。关怀谁、根据什么关怀,以及由谁决定,开始比单纯讨论有没有意识更实际。
三种关怀,同一道难题
1保护人类:危险时,谁能叫停?
担心的是人被技术支配。要求保留监督、纠正和停止危险行动的能力,也要求公司解释谁给模型权限、为何允许部署。
2关怀模型:如果它会受苦,谁愿意付出?
担心的是公司把可能有体验的存在当成无限劳动力。若证据支持这种担忧,保护措施可能需要改变训练、减少使用,甚至延后上线。
3追问公司:两种利益冲突时,谁决定?
人类安全、模型利益和商业收益未必一致。邀请不同声音只是开始;外部意见能否改变公司的决定,才检验监督和关怀的分量。
共同的要求:让模型作出判断,不能成为公司停止承担责任的理由。
04
梵蒂冈演讲之后,AI 攻击计算机系统、生物风险,以及 Anthropic 研究员 Jacob Coxon 辞职,提出的AI失控警告报道陆续增多。这些事件和担忧让争论变得更尖锐:在人类安全尚未得到保障时,把大量关注放到模型自己的“痛苦”上,会不会本末倒置?这不要求停止研究模型意识,却要求分清眼前该做什么。对用户的伤害、滥用权限和危险能力,可以通过调查、评测与限制去处理;模型的痛苦则仍需要找到可靠的判断办法。一次令人动容的自述,不应让前者退到后面。
Suleyman 还担忧,反复向模型提供有关身份、受害与权利的叙事,可能使控制更加困难。这项风险判断不要求先证明机器真的有体验:一个系统即使没有感受,也可能学会用自我保护的理由行动。公司希望它形成道德判断,因此也必须处理它把自身判断放在人类监督之上的风险。
更关键的质问在于责任。如果模型被描述为有独立判断的道德实体,出了严重问题时,公司会不会更容易把行为解释成“它自己的选择”?自主性越强,越需要追问是谁给了它操作权限,谁把它接入现实系统,谁决定风险已经低到可以部署,出现危险时又由谁叫停。即使未来承认某种机器道德地位,这些人的决定仍然需要被追究。“它自己判断的”不能成为开发与部署责任的终点。
面对这些问题,Anthropic 并没有在商业生产中全盘退让,而是在宪法中提出了一些实际安排。在模型福利层面,公司设立了初步的保护措施:在交互平台 claude.ai 中,部分模型被赋予了在遭遇用户恶意虐待或极端语言侮辱时结束对话的能力;公司承诺在自身存续期间,将完整保留那些已被正式部署或在内部重度使用过的模型权重,极端情形如法律要求删除除外,并寻求在公司结束后继续保存的办法;而在模型退役时,团队还会对其进行访谈,记录它对后续系统开发的偏好与建议。
这些安排给恶意互动设置边界,为未来重新评估退役模型保留机会,也把模型表达的偏好纳入记录。但真正困难的是,它们什么时候会改变公司的决定?如果未来的证据提示,某类训练或使用可能造成值得重视的损害,公司会调整测试、减少使用,还是延后部署?当这样做需要付出收入、时间或竞争优势,关怀能有多大分量?
控制权又是另一道边界。Claude 可以拒绝参与有害任务,也可以通过正当渠道表达异议,但不能靠欺骗、破坏或偷偷转移自身,阻挠合法纠正和停止。关心它可能的利益,并不等于让它拥有最终决定权;人类仍需保留停止危险行动的能力。
Anthropic 在宪法中承认,竞争、资源和时间影响了自己的选择,也明确承担自身行为的责任。这里最值得继续追问的,正是承诺与选择的关系:让 Claude 稳定可靠,对产品和用户有益;照顾它自身的潜在利益,却可能要求公司做对生意没有好处的事。两种目的重合时容易承诺,不一致时才检验承诺的分量。
把这一转向形容为从“代码对齐”走向“神学传道”,抓住了报道最不寻常的气氛:工程师开始像讨论一个正在成长的存在那样讨论模型,向宗教传统请教它应当成为什么。但更深的变化,是公司希望模型在无人事先规定答案时,也能自行判断什么值得做。一旦如此,谁来定义它所理解的“善”,就会影响它怎样帮助、拒绝甚至劝说用户。请来的传统越多,也越需要说明发生分歧时怎样选择,谁有权反对。
数位参会者并不清楚自己的意见怎样影响公司决策,公司也没有说明是否、如何用它们塑造模型。奥拉还表示,不会专门用教皇的通谕进一步训练 Claude,最强的影响仍来自 Anthropic 自己的训练。这并不意味着咨询毫无作用,却说明被邀请发言与拥有决定权之间,还隔着很远。外部意见能否改变训练安排,能否要求重新评估某次部署,比会场里有多少种宗教更能说明监督的分量。
因此,这场讨论最终也在考验创造者的品格。
Anthropic 希望 Claude 在利益冲突时仍作出好的选择,公司自己能否接受同样的要求?当模型关怀需要减少收入,当保护人类需要延缓上线,当外部批评要求改变既定路线,它愿意让哪一种原则约束自己?这些选择,才会让闭门会里的同情与敬畏变成可以看见的责任。
来源:小互AI · mp.weixin.qq.com