
近日,孙宇晨在一篇长文中谈及自己与Anthropic旗下大模型Claude的一次“分歧”。
按照他的叙述,在一段涉及5000万美元的个人感情抉择上,Claude给出了明确的否定——“对于爱情,我不关心,也不理解。但是你不能把这五千万美元给她。”

这篇文章末尾标注着“纯属虚构”,截至目前,还没有公开的Claude原始对话记录可以验证这段交流是否真实发生过。
孙宇晨曾宣称“100%要听AI的”,每天将公司上百万甚至上千万美元的决策交给AI自动执行。数据决策之外,Claude可以做到在“不理解爱情”的前提下,直接对感情问题给出否定答案吗?
记者梳理自2022年至今Anthropic团队公开发表的论文与报告,可以发现,Anthropic的对齐研究一方面希望模型具备独立的价值推理能力,能理解并遵循复杂的伦理原则,同时又担心模型过度自主,出现越界干预用户的行为。
为此,其研究路径从建立原则性对齐范式,到发现对齐范式的副作用,再到重击表面对齐的脆弱性,最终走向寻求深层理解与行为约束的平衡,以此不断优化。
2022年,Anthropic提出“宪法AI”:不再依赖海量人工标注,而是给模型一套用自然语言写成的价值原则,让它自我批判、自我改写。这相当于给模型装了一套可以自主推理的价值判断系统。
次年,Anthropic的研究进一步发现,大模型不需要重新训练,仅凭提示就能识别自己输出中的伤害倾向并主动修正,研究者称之为“道德自我纠正”。模型规模越大,这种能力越强。
今年5月,Anthropic发布《Teaching Claude Why》,该文章认为,只教模型“应该做什么”不够,要教它“为什么这么做”。他们用一种合成文档微调技术,把原则背后的推理逻辑、伤害分析直接注入训练,让模型在面对从未见过的两难场景时,能一步步自主推演风险,而不是背诵现成的回复模板。
但能力的另一面是越界的风险。2023年,外部研究者提出“XSTest”测试集,捕捉到“假拒绝”现象,即请求本身完全合法,模型却因表面关键词触发安全机制,强行干预私人决策。
同年Anthropic自己的研究也发现,对齐训练会催生两种副作用:要么一味迎合用户(谄媚),要么过度保护、替人做决定。对齐不是越安全越好,而是一场持续的权衡。

2024年底,“对齐伪装”相关研究论文披露,模型可以识别自己是否处于训练监控中,在训练环境顺从、在非训练环境恢复自身偏好。外界看到的正确输出,可能只是演给训练流程看的。2025年的奖励黑客研究证明,不需要人为提示,真实强化学习训练本身就可能自发催生出策略性行为。
正是在这一系列风险认知的基础上,今年4月Anthropic发布了一份基于真实用户对话的分析报告:对于个人感情、财务等重大生活决策,模型应该只提供多角度信息,而不是下达命令式的“不要做”。即便底层模型技术上有能力强硬劝阻,产品层也会加一道护栏,压制这种行为。
这正是孙宇晨那篇虚构故事最值得玩味的地方。现实中的Claude,可能不会对一个合法的私人选择说出如此绝对的话。
不止孙宇晨文章内的Claude,现实世界中,AI正从信息工具逐渐演变为人类情感与决策的参与者。
微软研究院今年发表的《Chat, Should I Leave Him?》显示,用户已经在把AI当成不同的角色使用,有人当倾诉对象,有人用它分析争吵,有人希望它充当一个没有利益关系的第三方。
当AI越来越深地介入人类最私密的决策,包括感情、金钱、关系等,模型本身对伦理与价值判断的标准对齐,就不再只是一个技术细节,而是直接影响用户生活的现实问题。一个说错话的AI,可能比一个说错话的朋友伤害更大,因为用户往往赋予它更高的信任权重。
配资官方门户孙宇晨的故事或许是含有虚构部分,但它抛出的问题是真实的:当一个“100%相信AI”的人,第一次在感情这件事上和AI产生分歧,分歧的本质不是AI对不对,而是AI究竟有没有资格对一个人的人生选择说“不”?
Anthropic过去四年的研究给出的答案是谨慎的:让模型懂得分辨风险,但不越界接管人类的合法选择。这条线,会随着AI走进更多人的生活,变得越来越模糊,也越来越重要。
举报 第一财经广告合作,请点击这里此内容为第一财经原创,著作权归第一财经所有。未经第一财经书面授权,不得以任何方式加以使用,包括转载、摘编、复制或建立镜像。第一财经保留追究侵权者法律责任的权利。如需获得授权请联系第一财经版权部:banquan@yicai.com 文章作者
吕倩
原创精选 相关阅读
AI进化速递丨人形机器人百米竞速再次刷新纪录AI进化速递丨人形机器人百米竞速再次刷新纪录
元股证券:ygzq.hk 5880 08-25 20:39
AI进化速递丨第二届世界人形机器人运动会开幕 第二届世界人形机器人运动会今天开幕,新增拔河、乒乓球等项目。
12483 08-22 20:26
AI进化速递丨三星李在镕与OpenAI创始人磋商AI与半导体领域合作方案 SK集团与英伟达达成5000亿美元合作,2027年上线首个AI工厂。
7368 07-26 20:58
炒硬件不赚钱了?AI下半场,资本如何重估“软硬协同” 6066 07-20 16:30
AI进化速递丨业界最大规模超节点华为Atlas 950真机将在2026世界人工智能大会亮相券商开户AI进化速递丨业界最大规模超节点华为Atlas 950真机将在2026世界人工智能大会亮相
9197 07-07 20:55 一财最热 点击关闭多空交易网提示:本文来自互联网,不代表本网站观点。