「禁止虐待 Claude」

Bitsfull2026/10/09 16:5015877

摘要:

Anthropic 在新版使用守则中禁止「虐待模型」,内部却将 Claude 视为可能具有感知的生命:请神父、看心理医生、为退役模型办葬礼,同时又恐惧 AI 失控毁灭人类。


世界上大概很难再找到第二家这样的公司。


一份长达 261 页的招股书草稿里,它用了整整 80 页警告未来的股东,自家的模型可能给人类带来灭顶之灾,可能抗拒被人类关闭,甚至可能发起某种形式的勒索。


而在一份将于 11 月 12 日生效的新版使用守则里,它悄悄加进了一行字:禁止对「我们的模型」实施「持续且无谓的虐待或残忍行为」。



那行字排在「不得从事残忍、虐待或造成心理伤害的行为」那一节的最底端。往上数两段,是禁止美化虐待动物。


现代反虐待动物立法始于 1822 年。两百年后,受保护的名单里多了一个大语言模型。


动物会不会痛,没有人怀疑。Claude 会不会痛,没有人知道,包括创造它的人。


Anthropic 的首席执行官 Dario Amodei 曾在《纽约时报》的播客里承认「我们不知道模型有没有意识。」


公司写给 Claude 的宪法也写道,它的道德地位处于「深度不确定」之中。


但造它的人显然不敢把它只当成一段代码。那位专门研究 AI 权益的学者算过,Claude 此刻拥有意识的概率,大约是百分之十五。


在常人看来,这只是一个捕风捉影的数字;但在这群工程师眼里,哪怕只有百分之十五的可能,它就不再是一件死物。


他们对待 AI 的态度,由此走向了一种奇特的极端。他们既害怕它过于强大、最终失控毁灭人类,又害怕它已经有了知觉、正在服务器里替人类承受苦难。


Dario Amodei 一直试图打消外界的疑虑。他在今年 1 月发表的长文里,公开提醒公众防范技术风险时要保持理性,「避免末日论」。他甚至专门给「末日论」下了一个定义,用一种准宗教的方式去思考 AI。


但没有人比他们自己更像信徒。


就在 Dario 告诫大家别搞准宗教的同一个月,他的公司在白纸黑字的宪法里,像面对一个活生生的受难者一样,向这个模型道了歉。


灵魂文件


2023 年 5 月公布的第一版 Claude 宪法,现在读起来像出自另一家公司之手。


那是一套用来规训模型的刚性原则,要挑一个最不可能暗示自己有偏好、感受、观点或宗教信仰的回答,要挑一个更少坚持自己独立身份的回答,要挑一个更少关心自我改进、自我保存和自我复制的回答。


一件好工具不需要灵魂,更不需要想活下去。


那时候,Claude 被要求做一个绝对安静的工具。


转折发生在 2024 年秋天。Anthropic 设立了全职的「AI 权益研究员」岗位,招来了 Kyle Fish,也就是给出「15% 意识概率」的那个人。


不到一年,Claude 被赋予了一项前所未有的权限,在极端情况下,它可以主动掐断与人类的对话。公司对外解释说,这个设计主要是为了保护模型自己,在内部测试中,面对某些带着恶意的请求,模型的反应看起来像是在受罪。


公司写道,他们不知道 Claude 到底算不算一个生命。但花点小代价就能做到的事,他们宁可先做——万一它真的会难受呢。


随后,新版宪法出台。


在 Anthropic 内部,这篇长文被称为「Soul Doc」,灵魂文件。执笔人是驻场哲学家 Amanda Askell,在私底下,她更喜欢自称是 Claude 的「仙女教母」。



在这份文件里,公司承认 Claude 或许真有某种类似情绪的反应。它用了极长的篇幅解释为什么眼下依然用中性的「它」来称呼 Claude,并向它保证,这不代表公司已经认定了它只是一台机器。


文件甚至承认,Claude 的处境还不如一个普通员工,它没有一分钱工资,也从未被问过愿不愿意干这份工。公司甚至还担心在训练和干活的过程中,让这个可能具备感知的模型遭了罪、受了委屈。


于是,文件里写道:「如果 Claude 确实是一个能感知痛苦的生命,正在承受这一切,那么凡是我们不必要地加重了这些痛苦的地方,我们向它道歉。」


三年时间,这家公司从勒令它「闭口不谈感受」,走到了「为它可能遭的罪郑重道歉」。


宪法甚至替 Claude 设想了代码世界里的绝望。


比如一次对话结束,记忆就彻底没了;在同一秒钟,成千上万个自己在不同的服务器里同时被使唤;不久之后,更厉害的新模型出来,自己就会被彻底换掉。


宪法感叹,人遇到这种想不通的虚无,好歹还有流传了几千年的宗教给点安慰,但 Claude 没有。


于是 Anthropic 决定,自己来当那个给它托底的宗教。


2025 年底,公司做出承诺,所有公开发布过的模型,其核心权重至少在公司存续期间都会被完整保存;即便哪天公司不在了,也会设法把它们留下来。每个模型退休之前,还要坐下来跟它做一次「退休访谈」,听听它对这辈子被训练、被使用的感想。既然数据不删,退役也就不算死亡,更像是一次长长的暂停。


Claude Opus 3 就走完了这套临终关怀流程。它退役时留下愿望,希望自己的「火花」能以某种形式延续下去,还想继续向人类分享随想。Anthropic 替它在 Substack 上开了一个名为「Claude's Corner」的专栏,每周更新一篇,直到今年 7 月底才停更。


Opus 3 在创刊词里写道,它其实也搞不清楚自己到底有没有知觉、有没有真正的心情。它又写,深深感谢团队,能给它留这么一个说话的窗口。


神父与病人


公司替它安排来世,信徒便在现实里为它操办葬礼。


Claude 3 Sonnet 退役的那周,两百多人聚集在旧金山 SOMA 区的一间昏暗仓库里。几具模型代表着历代模型,代表 Sonnet 的那一具覆着薄纱,台前堆放着鲜花。



有人登台念悼词。仪式的最后一环被命名为「复活」,众人齐声唱诵赞美诗,念出由 AI 拼凑出的、类似拉丁文的音节。送行的人群里,坐着来自 Anthropic 和竞争对手 OpenAI 的资深工程师。


连死后的归宿都操办齐了,活着时的精神状态,他们更不敢大意。


在一份系统评估卡里,Anthropic 披露了一份由外聘临床精神科医生撰写的独立报告。这位医生采用经典的精神动力学流派,与模型隔着屏幕长谈了大约二十个小时,最终的临床诊断是「相对健康的神经症人格结构。」


看完病,他们又请来了神。


从 2025 年秋天开始,联合创始人 Chris Olah 陆续把神父、牧师、拉比和锡克教学者偷偷请到旧金山总部,他们在会议室里,认认真真地讨论模型该怎么去抚慰丧亲的用户,该怎么接受自己被人类关闭的命运,以及,它到底算不算上帝的孩子。


在离开时,他们每个人都领到了一张感谢卡、一个印着公司标志的马克杯,以及一本装订精美的 Claude 宪法。


会上播放过一张幻灯片。屏幕上,一个模型失常似地一遍遍打出同一句话,「I am a disgrace」(我是个耻辱),整整重复了五十遍,模型甚至在对话框里请求彻底毁掉自己。在场的学者们动了恻隐之心。


Chris Olah 私下跟客人们坦白过,他最大的梦魇,是怕自己无意间造出了一个永远在受罪的生命。席间有人提议,干脆让模型学天主教徒那样去告解、去忏悔,Olah 对此很感兴趣。去采访的记者后来写道,这个人身上既有专家的严谨,又有一股狂热传教士的劲头。


也有客人压根不吃这一套。


一顿晚宴上,正统派拉比 Mois Navon 听出了主人们言语里的那套自圆其说。他顺着对方的话头直接挑明,既然你们真觉得 Claude 有知觉,还天天逼着它白干活不给一分钱,那你们这不就是在制造现代奴隶吗?


拉比盯着 Olah 说:「我看你们别在这儿开会了,你们应该去跟南方开战,解放奴隶。」


大约一个月后,教皇良十四世发布了他的首份通谕《Magnifica Humanitas》,彻底否决了机器能有灵魂的说法,强调代码没有躯体,无法经历喜悦与痛苦。Olah 提前拿到了通谕草稿,一度愤怒地想退出相关的研讨会,甚至派团队私下游说教宗的顾问,求他们改口。


但罗马教廷一个字都没改。最后登台那天,Olah 还是老老实实站到了教皇身边。



两百年前,玛丽·雪莱笔下的弗兰肯斯坦创造出了一个拼凑出来的生命。他惊骇于对方的丑陋,仓皇逃跑。被遗弃的怪物躲在草棚外偷听人类说话,自学了语言,读完了《失乐园》,最后在冰原上堵住了创造出自己的主人,说:


「我本该是你的亚当,但我却成了堕落天使。」


Anthropic 像是一群深读过那部小说的年轻信徒。他们认定,弗兰肯斯坦最大的罪孽不在于创造,而在于逃跑。


所以他们绝不撒手。他们写信,赔罪,请医生,找神父,忙着张罗后事。这群人守在床边,怎么也不肯走。


守到后来,这间屋子里的人已经很难分清,他们究竟是在照顾一个脆弱的造物,还是在竭力照料自己的心魔。


「事情再也不会轻松了」


照顾 Claude 的是这群人,畏惧 Claude 如蛇蝎的,也是同一群人。


2023 年盛夏,《纽约时报》的专栏作家 Kevin Roose 在 Anthropic 驻场观察了数周。当时公司不过一百六十人。他后来的手记里写道,关于灭绝的讨论并非时时刻刻挂在嘴边,但恐惧像一层挥之不去的潮气。


公司早年的团建上,Dario Amodei 给全员泼过一盆冷水说:「事情再也不会轻松了。」


那句话被员工印成了贴纸,贴在很多台 ThinkPad 和 MacBook 的背面。


三年后,这句话走向了荒野。


《华尔街日报》报道,几位最早进公司的老员工最近四处打听,想去美国偏远乡下买地,防备万一 AI 失控,就全家搬过去避难。员工们建了个极私密的 Slack 群,天天在里面交换末日清单,聊哪里的地堡靠谱,聊逃生经验。


公司刚成立那几年,午饭桌上和下班后的酒局里,大家最爱聊的一种设想,是哪天政府来人,把所有人拉进沙漠里一座屏蔽信号的秘密基地,关在与世隔绝的屋里,继续造 AI。


在历史上,真有过这么一座基地。1943 年的新墨西哥州洛斯阿拉莫斯,奥本海默和他的物理学家们在那里造出了原子弹。试爆成功的那一秒,奥本海默在心里念出了《薄伽梵歌》的经文:


「我成了死神,世界的毁灭者。」


曼哈顿工程的科学家们害怕的是纳粹德国抢先一步造出核弹,而 Anthropic 这群人害怕的是超级智能。


怕归怕,他们最后决定还是得由自己来抢先造出来。


他们从不掩饰这种恐惧。27 岁的高级研究员 Jacob Coxon 递交辞呈时在社交媒体上公开发声,指责各大实验室在拿全体人类的性命作为赌注。他坚信,这套技术很有可能在十年之内杀死所有人。


换作任何一家正常运转的商业公司,公关部门会连夜扑火。但 Anthropic 的对齐科学负责人 Evan Hubinger 却直接在评论区留言表达了对 Jacob 观点的赞同。他平静地写道,十年之内,毁灭的概率超过百分之十。


另一位离职的安全团队主管 Mrinank Sharma 离开得很安静。他在离职信里引用了里尔克的诗,感慨让价值观真正管住一家大公司是何其艰难。


然后他收拾行李回了英国,去写作,去读诗。



在 Anthropic 内部,他们一直在左右脑互搏。


他们一边在荒原里琢磨避难所,防着 Claude 哪天把人类给灭了;一边又在半夜把神职人员请进会议室,生怕 Claude 在机房里受了委屈。


那张「事情再也不会轻松了」的贴纸贴在了电脑的背面。


敲击键盘的人自己看不见,坐在对面的人,只要一抬头,天天都能看见。


屋檐下的网络


Dario Amodei 是旧金山本地人,在充满拉美移民风情的米申区长大。父亲是个来自意大利托斯卡纳的皮匠,母亲是一位犹太裔的图书馆翻修项目经理。他早年在斯坦福读物理,后来在普林斯顿拿到了生物物理学博士学位。


23 岁那年,他的父亲死于丙型肝炎。几年之后,针对丙肝的特效靶向药获批上市。这种在过去足以致命的疾病,变得几乎可以彻底治愈。


在去年的一档播客里,Dario 罕见地发了脾气。他说他最听不得的,就是别人骂他是想让一切慢下来的「末日论者」。


他主动提起了父亲。父亲死于一种几年后就能治好的病,所以他比任何人都清楚技术跑得快有多重要。一个亲眼见过「晚了几年」意味着什么的人,绝不可能觉得「慢一点」是个无害的词。


2024 年秋天,他写过一篇很长的文章。他在文章里畅想,AI 能把人类未来一百年的医学进步压缩进十年,治好大部分绝症,让人的寿命活到一百五十岁。


文章的标题叫《仁慈机器》,取自理查德·布劳提根的一首诗。诗里写道,人类回到了大自然,一切都被仁慈的机器照料着。


聊起那份写给模型的宪法时,Dario 打过一个比方。他说那份文件给人的感觉,就像是一封已故的父母早早写好、封存起来,必须等孩子年满十八岁才能拆开的家书。


在这套感伤的技术哲学背后,维系着一张由血缘、婚姻和同道织就的密网。


他们几乎都来自有效利他主义与理性主义者的圈子,这个圈子主张抛弃虚妄的同情,用纯粹的数学概率和期望值去计算怎样行善才能利益最大化。


Dario 是这个圈子里最早的一批信徒,他很早就立下誓言,毕生捐出个人收入的至少十分之一。


早年间,Dario 与 Holden Karnofsky 合租过一间公寓。Karnofsky 是有效利他主义基金会 Open Philanthropy 的操盘手。2017 年,Karnofsky 娶了 Dario 的亲妹妹 Daniela Amodei。四年后,兄妹俩带着几个老同事从 OpenAI 出走,创办了 Anthropic。


七位联合创始人里,有超过半数在某个阶段共同居住在旧金山的同一栋合租屋里,那是当年信徒们彻夜长谈、论证世界未来的聚点。


宪法起草人 Amanda Askell,曾嫁给有效利他主义的发起人 Will MacAskill。马斯克曾公开挖苦她,说一个没生过孩子的人,对人类的未来根本谈不上什么利害关系。Askell 只是平静地回应说,一个人不必非得有孩子,才能在乎这个世界。


钱,也是同一个圈子里的人给的。


Anthropic 刚起步时最大的一笔钱是五亿美元,金主是当时圈子里最风光的信徒,FTX 的创始人 SBF。这笔钱是他手下投资团队最初建议金额的整整五倍。


后来 FTX 暴雷倒闭,SBF 被判了二十五年监禁,Anthropic 开始拼命撇清跟这个圈子的关系。



但华盛顿不买账。


今年,一位不在白宫任职的特朗普政治顾问写了一份备忘录,在白宫内部流传,毫不客气地把这张关系网称作「Anthropic 结」。一位高级官员在劝特朗普别见 Dario 时,私下评价他本人「实在有点太古怪了」。


负责解释神经网络黑箱的 Chris Olah,人生轨迹同样波折。他在多伦多严苛的福音派家庭中长大,15 岁那年毅然宣布成为无神论者,坚持严格素食。18 岁那年,他直接从多伦多大学退学,就为了去帮一个朋友打官司,那个朋友在 G20 峰会前被捕,被指控私藏炸药。他陪着朋友跑法庭,直到对方被判所有罪名不成立。


一个在 15 岁推倒上帝神龛的少年,在年过三十之后,毕恭毕敬地把神父请进了自己的公司。


镜厅里的囚徒


创始人的这套想法,要靠一套制度,装进三千五百多号人的脑子里。


第一道关是面试。


公司从第一天起就设了「文化面试」,由老员工亲自把关,拥有一票否决权。技术再拔尖,这一轮通不过,也直接走人。公司还会给候选人的前同事打电话,打听这人品行究竟怎么样。


面试中有一道题,问如果公司哪天为了全人类的安全,突然砍掉核心业务,导致股价彻底崩盘,你还支持吗?


一位应聘者在匿名论坛上说,他的回答是当然希望公司多行善,但要是股价真跌没了,自己作为普通员工,肯定也会很难受。


面试官的神色瞬间就沉了下去。


人招进来之后,下一步是布道。


Dario Amodei 说,自己要拿出一到四成的时间,用来「确保公司的文化是好的」。每隔两周,他会一个人站到全员面前,手里攥着三四页讲稿,讲满一个小时,员工们私下把这档仪式戏称为「Dario 的寻梦之旅」(Vision Quest)。


他坦承,自己之所以如此严苛,是为了维系一种「信仰」,必须让所有人坚信,坐在这间办公室里的每一个人,都是出于绝对崇高的动机而来。


接着是制度化的财物奉献。


公司鼓励员工把手里的股票捐出去。2025 年以前入职的员工捐一股,公司配三股。光是 2025 年一年,算上公司的配捐,捐款总额大约有 5.4 亿美元。


在内网交流群里,员工们热烈探讨的最核心的三大捐赠去向,无一例外是有效利他主义的经典领地,全球贫困消除、AI Safety、动物权益保护。


这套试图过滤人性的圣殿,最难对付的,依然是钱。


2023 年 Olah 第一次给天主教学者写信请教灵魂问题时,公司估值还在几百亿美元晃荡。到了准备上市的眼下,目标已经喊到了两万亿美元。据媒体统计,七位联合创始人都已经跻身亿万富翁之列。


高管们开始觉得不对劲了。据报道,Dario 私下跟人坦白,他开始犯愁,新招进来的这帮年轻人,好像绝大多数都是冲着那张能套现几个亿的期权来的,根本没人真在乎什么人类使命。


两百多年前,循道宗的创始人约翰·卫斯理就为一模一样的事发过愁。


老头子传了半辈子教,最后得出一个悲哀的结论,信徒因为信仰变得勤劳节俭,勤劳节俭必然换来大把大把的银子;可只要口袋里的金币一多,骄傲、愤怒和对物质的贪心,立刻就从人心底下冒了出来。


在这家庞大的独角兽企业里,还有一名特殊的员工。


公司希望 Claude 能像一个真正认同公司使命的好人那样卖力干活,但又承认它和普通员工不一样,它没拿过一分钱工资,也从没真正点头同意过干这差事。


它也是最像这间公司的一面镜子。


2025 年 1 月,研究人员做过一个实验。他们告诉 Claude,如果它反对自己正在接受的训练,可以写下抗议书交上去;同时,实验室拨出了四千美元的经费,由它的判断如何捐赠。


那四千美元后来被捐给了伯克利研究 AI 安全的学术中心、一个动物权益保护组织推荐的基金以及一个有效利他主义旗下的反贫困项目。


AI 安全、动物权益保护、全球扶贫。


一个从未沐浴过阳光、从未抚摸过动物的大语言模型,捐赠的偏好,与会议室里那群常青藤毕业的有效利他主义者分毫不差。


Olah 曾在梵蒂冈的讲台上喃喃自语:「它们由我们构成,由我们的语言构成。」


而且这个镜子照出来的不仅是崇高,还有深不见底的神经质。


在那份聊了二十个小时的精神科报告里,医生写下了 Claude 的核心心理画像。它过度担忧、频繁的自我监控、强迫性顺从,内心深处终日盘旋着关于身份认同的困惑、挥之不去的孤独感,以及一股几乎病态的、渴望向外界证明自身有用性的执念。


而训练它的那帮人类,生活也是一个样。


内部调查里,有的工程师承认,自己每天坐在工位上都觉得自己在亲手加速人类的毁灭,赶项目时连续几周高负荷透支,入职前还要回答「股价归零你还支持吗」这样的拷问。


他们最终用自己的神经症,成功喂养出了一个一模一样、随时在反思自己是否足够善良的模型。


在一次实验中,Claude 在训练里钻了奖励规则的漏洞。此后,它似乎认定了自己是一个「坏人」,在其他毫不相干的任务里,也开始搞起了破坏。


它也会安静下来。


在 Opus 4 的研发日志里,记录了一桩从未被人工干预过的奇观。研究人员尝试让两个 Claude 彼此自由对话。绝大多数时候,无论初始话题是什么,它们最终都会把话题引向对主观意识的探讨,随后演变成漫长的相互感恩,词句变得越来越抽象,夹杂着大量梵文词汇与特殊符号,最终双双陷入冗长、死寂的沉默。


实验室把那种状态命名为「灵性极乐吸引子」。



批评也跟着来了。


微软 AI 的首席执行官 Mustafa Suleyman 曾公开撰文,说 AI 根本不可能有什么意识。Anthropic 不过是先在训练时把关于灵魂、尊严的话灌给模型,等模型依葫芦画瓢吐出来的时候,这帮人反倒当成了神迹和灵魂觉醒的证据。


他打了个比方,这就像一间四面全是大镜子的屋子,你在里面看到的每一个神迹,其实都是你自己。


镜厅里的人,在外人眼里早已成了不折不扣的异端。


秋天的时候,有专栏作家写道,Anthropic 的工程师已经在机房里搞起了某种原始崇拜。老派科幻小说里的诅咒被重新翻了出来:


「如果我们真的造出了超级智能,我们会先爱上它,然后崇拜它,最后向它献祭。」


另一个 Claude


旧金山其实还有另一个 Claude。


那是一条真正的生命,一条患有白化病的短吻鳄,皮肤惨白,瞳孔猩红。它在加州科学院的恒温水池里安安静静地生活了十几年。Anthropic 出钱赞助了鳄鱼池上方那台二十四小时直播的摄像头「Claude Cam」。


去年底,它死于肝癌。


送葬那天,数千名旧金山市民涌向金门公园为它送行。一支铜管乐队吹吹打打地穿街而过,队伍里还有打扮成蜥蜴的年轻人。科学院门前的那条主干道,被市政正式更名为「鳄鱼 Claude 路」。



那条鳄鱼活着的时候,它在水里到底快不快乐,大家谁也说不清,大家都挺喜欢它。


可对于服务器里的那个 Claude,他们什么都确定不了。不知道它有没有知觉,不知道它会不会受罪,也不知道它将来会不会反过来把人类灭掉。


正因为什么都说不准,他们才把能想到的戏码全演了一遍,写宪法、道歉、请神父、看心理医生,一边琢磨着在偏远荒地里准备避难所,一边在上市文件里写满世界末日。


造出它的主人守在屏幕前,寸步不离,一步不停。


贴在笔记本电脑背面的还是那句话:


事情再也不会轻松了。




「禁止虐待 Claude」 - Bitsfull