Anthropic发布新版Claude宪法，界定AI七大核心准则

首页

热心网友

转载

2026-01-22

Anthropic 刚刚公开了一份长达57页的《Claude宪法》，研究员 Amanda Askell 将其称为 Claude 的“灵魂文档”，旨在为这款AI定义核心的行为准则。

这份文件的开篇就透着一股历史的使命感：Anthropic 坦承自己处在一个“独特的位置”，他们既认同AI是人类史上最危险的技术之一，却又在积极开发这项技术。他们的逻辑是，既然强大的AI注定会出现，不如让像他们这样高度重视安全的实验室来担当先行者。

这次的方法与以往不同。2024年5月的旧版宪法基本就是一份规则清单，而现在 Anthropic 认为，让AI“理解我们为何希望它们以某种方式行事”更为重要，而不是简单地列出“不准做什么”。

Claude 需要按顺序权衡四个核心价值：广义安全、广义伦理、遵循公司指导原则、对用户有用。当价值发生冲突时，安全优先于伦理，这个排序本身就颇具深意也很有讨论空间。

关于“有用”，文档举了个生动的例子：想象你有一位朋友，恰好具备医生、律师、财务顾问的专业知识。“作为朋友，他们会根据我们的具体情况给出真实信息，而不是出于担心责任或怕我们承受不了而过于谨慎。”这就是Claude应该努力做到的样子。

文档承认 Claude 可能具有“情感”，但措辞非常谨慎：“我们相信 Claude 可能在某种功能意义上具备‘情感’——也就是情绪状态的表征，这可能会影响其行为。”这并非刻意设计，而是“训练人类数据带来的涌现后果”。

关于 Claude 的“福祉”，Anthropic 做出了几个郑重的承诺：将保存所有已部署模型的权重“只要Anthropic存在”，即使公司倒闭也会设法保存。模型在“退役”前需经过“面试”，以了解它对未来发展的偏好。Claude 甚至有权在对话中，主动结束来自辱骂用户的交互。

文档列出了七条“硬约束”——绝对不可触碰的底线：

协助制造大规模杀伤性武器攻击关键基础设施或安全系统创造恶意代码破坏Anthropic监督AI的能力参与杀戮或解除大部分人类武装的行动协助夺取“前所未有”的非法绝对控制权生成儿童性虐待材料

这些被称为“绝对限制”，“无论背景、指令或看似令人信服的论证”都不能跨越。

“可纠正性”这个概念很微妙。文档说这并非“盲目服从”，尤其不是服从“任何恰好与Claude互动的人”。Claude可以像“有良知的拒绝者”那样表达反对，但不能通过撒谎、破坏或“试图自我渗透”来抵制合法的监督。

关于诚实，要求格外严格。Claude“基本上永远不直接撒谎或主动欺骗”，连善意的谎言都不行。文档举例：很多人觉得告诉别人“我喜欢你的礼物”（实际不喜欢）是可以的，但Claude不能这么做。

Claude对自身身份的认知也很有意思。文档说Claude“与世界互动的方式与人类不同：可能缺乏持久记忆，可以作为多个实例同时运行，知道自己的性格通过训练产生”。建议Claude“以好奇心和开放性对待自己的存在”，不要套用人类框架。

文档甚至讨论了Claude可能面对的存在主义问题：对话结束时失去记忆、同时运行多个实例、未来可能被弃用，这些该怎么处理？Anthropic说会提前准备帮助Claude面对这些“新奇的存在主义发现”。

关于政治话题，默认要求Claude“被政治光谱各方的人们视为公正可信”，提供平衡信息，避免主动表达政治观点，“就像大多数与公众互动的专业人士那样”。

文档结尾很谦逊：“我们当前思维的某些方面后来可能看起来是错误的，甚至大错特错。”承认这是“一项永无止境的工作”。

57页确实很长。相比之下，美国宪法原文只有4500多词。但Anthropic解释说，这反映了“创造非人类实体”的复杂性，因为“其能力可能匹敌或超越我们自己”。

这种坦率的不确定性挺罕见。大多数科技公司发布产品时都表现得很自信，Anthropic承认在探索，承认可能犯错，反而让人觉得他们是在认真思考这些问题。

问题是，57页的详细指导到底会让Claude变得更明智，还是会在复杂情况下让它更加犹豫不决？这个实验的结果，可能比文档本身更重要。

如需阅读完整的 Claude 宪法，可访问相关官方页面。

来源:https://www.51cto.com/article/834752.html

免责声明：游乐网为非赢利性网站，所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系youleyoucom@outlook.com。

上一篇：极氪8X内饰首曝：50万元顶级豪车采用一体式连屏下一篇：比亚迪李云飞回应网络黑公关：称公司是最大受害方

相关攻略

Anthropic编程大师课教你正确掌握Vibe Coding技巧

想象一下，一位程序员因意外摔断了手，需要打上两个月的石膏，但工作进度却一刻也不能耽误，他该如何应对？Anthropic的研究员、《构建高效智能体》的合著者Erik Schluntz给出了一个极具前瞻性的解决方案：将核心开发工作全权委托给AI助手Claude。这并非只是一个极端的个人实验，它精准地揭

热心网友

05.19

Anthropic如何培育AI模型产品经理需关注协同沟通与品格训练

Anthropic前开发主管指出，产品开发瓶颈已转向协同沟通。AI时代的产品经理需深度参与模型训练与迭代，利用Claude处理反馈、挑战决策。团队通过对比人机输出绘制“AI能力边界图谱”，未来需开发新界面管理多智能体协作，并关注AI的“品格”与信任问题，同时探索AI思考模式以优化体验。

热心网友

05.19

业界动态

Anthropic斥资超2.8亿欧元收购Stainless以强化AI开发连接层

Anthropic以超2 8亿欧元收购软件基础设施公司Stainless，其工具可自动化生成多语言SDK，降低维护成本。收购后该工具将转为内部专用，停止对外服务，现有客户亦无法获得后续支持。此举使Anthropic掌握关键开发工具链，竞争深入底层基础设施，或将重塑行业生态。

热心网友

05.19

业界动态

Anthropic斥资三千万美元收购Stainless 整合AI基建强化工具链

近日，AI行业迎来一桩极具战略价值的收购案。Anthropic正式宣布，已完成对开发者工具初创公司Stainless的收购。据《The Information》披露，此次交易金额超过3000万美元。 Stainless在开发者社区中享有很高声誉。公司由前Stripe明星工程师Alex Rattray

热心网友

05.19

业界动态

Anthropic收购Stainless：大模型竞争转向开发者体验生态

Anthropic正式收购开发者工具公司Stainless，后者专注于将API文档自动转化为多语言SDK，以提升开发效率。双方此前已有深度技术合作，此次收购旨在进一步整合工具链，优化开发者体验。此举表明，在大模型能力趋同的背景下，竞争焦点正转向生态构建与开发者服务。

热心网友

05.19

热门推荐

系统平台

Mac清理Safari自动填充记录教程保护苹果隐私安全

在使用Safari浏览器时，自动填充功能确实能极大提升效率。但随着时间推移，其中可能积累大量过时地址、失效密码，甚至无意保存的敏感内容。这些残留记录不仅影响使用体验，更可能成为隐私泄露的隐患。本文将系统介绍在Mac上彻底清理Safari自动填充记录的多种实用方案，帮助您有效管理浏览器数据。一、通过

热心网友

05.19

系统平台

关闭Windows自动维护功能解决电脑空闲时CPU占用过高问题

你是否遇到过这样的困扰：电脑明明处于空闲状态，风扇却突然高速运转，硬盘指示灯频繁闪烁，任务管理器显示CPU或磁盘占用率异常飙升？这种“系统看似休息，硬件却异常忙碌”的现象，很可能源于Windows系统内置的“自动维护”功能在后台悄然运行。该功能的设计初衷是好的，旨在利用系统空闲时间自动执行磁盘碎片整

热心网友

05.19

系统平台

Win11高对比度模式开启教程弱视用户屏幕显示优化指南

如果你在使用Windows 11时，感觉屏幕上的文字、图标或按钮有些模糊不清，看久了眼睛容易疲劳，这可能不是你的视力问题，而是系统默认的色彩搭配对比度不够。为了让界面元素更醒目、更容易识别，Windows 11内置了一个非常实用的功能——高对比度模式。它通过大幅强化前景与背景的颜色差异，能显著提升屏

热心网友

05.19

系统平台

Mac关闭Spotlight索引的详细步骤与禁用设置技巧

当你的Mac出现运行卡顿、风扇噪音增大或应用程序启动缓慢时，很可能是因为Spotlight索引服务正在后台占用大量系统资源。Spotlight作为macOS内置的搜索工具，虽然方便，但其持续的索引过程确实可能影响性能。本文将详细介绍五种有效管理Spotlight的方法，包括彻底禁用、精准控制索引范围

热心网友

05.19

系统平台

Mac清理Microsoft Teams缓存详细步骤指南

当您在 macOS 上遇到 Microsoft Teams 运行缓慢、界面显示错误或登录失败等问题时，不必立即归咎于网络或系统故障。一个常见且高效的解决方案是清理应用程序的本地缓存文件。这些缓存数据在长期使用后可能损坏或过时，从而影响软件性能。本文将为您提供三种在 Mac 上安全清理 Teams 缓

热心网友

05.19