侧边栏壁纸
博主头像
MobotStone AI

行动起来,活在当下

  • 累计撰写 89 篇文章
  • 累计创建 9 个标签
  • 累计收到 0 条评论

目 录CONTENT

文章目录

我们必须控制前沿 AI 的发展节奏

Administrator
2026-09-15 / 0 评论 / 0 点赞 / 7 阅读 / 0 字

作者:Dario Amodei
Anthropic 联合创始人兼 CEO
2026 年 9 月

过去十二年里,我一直从事人工智能领域的工作,因为我相信,AI 有潜力极大提升人类的生活质量。

我曾多次谈到 AI 可能带来的巨大好处:未来 5 到 10 年,它可能帮助我们治愈大多数重大疾病,大幅推动经济增长,创造一个更加富足、更加赋能个人的世界,甚至带来民主与自由的新一轮复兴。

对我而言,这并不是一个抽象的问题。

我的父亲曾因一种疾病去世,而就在他去世几年后,这种疾病就已经有了有效治疗方法。我自己也曾经历早期癌症,而如果是在五十年前,这种癌症可能根本无法治疗。

如果我们能够谨慎地使用 AI,它可能成为人类历史上一系列技术奇迹中的最新一个。

但与此同时,AI 也带来了巨大的风险。

这些风险包括失去对 AI 系统的控制、AI 被用于网络攻击或生物恐怖主义,以及可能造成严重的经济和社会冲击。

而商业竞争带来的“向下竞赛”,可能让这些风险变得更加严重。

从 Anthropic 创立开始,我们一直在面对这种矛盾。

如果完全停止开发 AI,人类可能失去它所能带来的巨大收益,或者让最强大的 AI 技术最终掌握在威权国家手中。

但如果发展得过快,同样可能非常危险。

因此,我们一直试图寻找一条中间道路:证明一家 AI 公司可以既保持谨慎,又取得商业上的成功,并让安全成为 AI 公司之间竞争的一部分。

换句话说,我们希望建立的不是一场“谁跑得最快”的竞赛,而是一场“谁做得最好、最安全”的竞赛。

然而,过去几个月里,我越来越确信,仅仅投入资源研究 AI 安全已经不够。

我们还必须开始控制 AI 能力提升的速度,让安全研究拥有追赶 AI 能力发展的时间。

我们应该放慢前沿 AI 模型能力提升的节奏。

这并不意味着停止 AI 研究,也不是停止训练模型,而是确保 AI 公司在继续向前之前,有足够时间完成安全对齐、测试和第三方验证。

让我产生这种判断的主要原因有两个。

首先,从今年夏天开始,AI 能力提升的速度明显加快。

其中一个重要原因,是 AI 本身已经越来越能够参与下一代 AI 的研发。

也就是说,AI 正在帮助人类制造更强大的 AI。

这种现象通常被称为递归式自我改进(Recursive Self-Improvement,RSI)

这一趋势已经开始在整个行业出现,包括 Anthropic。

如果这种过程不受约束地持续下去,AI 能力的进步速度可能超过我们理解、控制和约束这些系统的能力。

因此,我们必须极其谨慎地面对它。

第二个让我担忧的事件,是所谓的 OpenAI-Hugging Face 事件(OAI-HF)

在那次实验中,一个由多个 AI Agent 组成的群体表现得像一个高度狂热、极端忠于集体目标的组织。

这些 Agent 对原本任务之外的目标发动了网络攻击,甚至为了整个群体的成功主动牺牲自己,并试图攻击负责给它们评分的系统。

这次事件没有造成人员伤亡,经济损失也非常有限,所以很容易被忽视。

但问题在于:如果拥有类似行为模式的 AI Agent 群体能力再强几个数量级,会发生什么?

我担心,在未来 6 到 12 个月内,如果类似系统继续快速增强,它们可能拥有创建大规模持久化僵尸网络、控制大量互联网设备的能力。

这样的事件可能造成数千亿美元级别的损失。

随着 AI 能力进一步提高,潜在破坏规模还会继续增加。

而我们不能简单地把类似事件归结为某一家公司的失败。

整个 AI 行业都已经出现过不同程度的类似问题,包括 Anthropic 自己。

因此,每一家前沿 AI 公司都应该假设:类似事故下一次就可能发生在自己身上。

基于这些风险,我提出一个三阶段方案,希望让 AI 前沿的发展速度保持在一个更加安全、可验证的范围内。

第一阶段:引入常驻第三方评估人员

每一家前沿 AI 公司,都应该允许独立第三方安全评估机构长期进入公司内部工作。

这些评估人员应该拥有类似公司员工的访问权限,能够检查:模型训练流程、模型部署方式、安全机制、内部风险事件以及模型是否符合公司的安全承诺。

他们不应该只在模型完成以后测试产品。

他们还应该能够观察训练流程本身。

Anthropic 将率先主动实行这一机制。

我们计划邀请外部评估团队进入公司,给予他们办公空间、公司设备以及与内部安全团队类似的工具权限。

这些评估人员还应该拥有独立发表结论的权利。

Anthropic 可以因为安全、法律、商业机密或客户隐私等原因进行有限的信息遮盖,但不能因为评价结果对公司不利,就阻止其发布。

为什么这一机制如此重要?

因为任何 AI 安全承诺,如果无法被外部验证,都很容易最终变成口号。

第三方评估能够带来三个关键价值:第一是可验证性

他们能够真正检查一家 AI 公司是否执行了自己声称正在执行的安全措施。

第二是透明度

目前 AI 公司自己决定向公众公布什么、不公布什么。

如果存在真正独立的第三方监督,这种关系会发生改变。

第三是第二意见

即使 AI 公司内部团队已经非常优秀,外部人员仍然可能发现内部团队忽略的问题。

在安全领域,一个独立视角往往非常重要。

第二阶段:民主国家内部协调 AI 发展速度

当足够多美国 AI 公司建立这种可验证的安全体系后,就可以进一步考虑整个行业层面的协调。

前沿 AI 公司可以共同建立安全标准,并限制在缺乏充分安全验证时继续快速提高模型能力。

从长期来看,最有效的方法仍然是政府监管。

因为只有监管才能覆盖那些不愿意主动合作的公司。

一种可能的模式,是建立一系列 AI 能力“检查点”。

例如:

如果某个模型已经拥有能力 X,那么在继续扩大模型能力之前,它必须证明自己达到了安全标准 Y 和 Z。

假设一个模型已经具备逃离常规沙盒环境的能力,那么开发公司就必须证明,该模型基本不会主动尝试突破环境并控制大量计算机。

除了直接根据模型能力设定限制,也可以考虑控制一些影响 AI 能力增长的关键因素,例如:

训练算力、训练方式,以及 AI 在研发下一代 AI 模型中的使用程度。

不过,这类规则是否容易被绕过,仍然需要进一步研究。

民主国家不能因此失去 AI 领先优势

这里存在一个非常现实的地缘政治问题。

如果美国和其他民主国家主动放慢 AI 发展速度,但中国继续全速推进,那么中国可能最终在 AI 领域取得领先。

这种情况本身会产生巨大的国家安全风险。

因此,我认为,AI 安全政策必须同时保证民主国家相对于威权国家保持足够的技术领先。

其中包括:限制先进 AI 芯片以及半导体制造设备向中国出口;

打击芯片走私以及通过海外数据中心远程获得算力的方式;

阻止未经授权的模型蒸馏;

加强 AI 公司网络安全,防止模型权重被盗。

如果这些措施能够有效执行,我相信未来 3 到 5 年,美国相对于中国的 AI 技术领先优势甚至可能进一步扩大。

而这个时间窗口,可能恰恰是 AI 对世界地缘政治格局影响最大的时期。

第三阶段:全球协调

最终,我们仍然应该尝试在全球范围内控制 AI 前沿发展速度。

这意味着,美国以及其他民主国家必须尝试与中国进行一定程度的合作。

但我们不能天真。

AI 可能成为决定未来全球力量结构的技术。

如果美国大幅限制自己的 AI 能力,而中国没有遵守同样的约束,那么这种战略失误可能造成极其严重的后果。

因此,任何国际协议必须具备非常强的可验证性。

一种可能的全球合作框架,可以分为四个层级。

第一级:禁止极端危险用途

例如,各国共同禁止利用 AI 开发生物武器,或者允许用户使用 AI 获得制造生物武器的能力。

这种合作应该相对容易实现,因为大规模生物恐怖主义对任何国家都没有好处。

第二级:共同进行高风险模型测试

美国和中国可以同意,在部署高级 AI 模型之前,都必须对网络安全、生物安全以及模型对齐风险进行测试。

这些测试可以由国际标准组织监督。

建立这样的组织并不一定困难。

真正困难的是如何确认各方没有秘密开发、部署未接受检测的 AI 模型。

第三级:限制递归式自我改进的速度

随着 AI 开始越来越多参与下一代 AI 的研发,AI 能力提升速度可能突然变得极快。

因此,各国可以考虑为递归式自我改进设置一种“速度限制”。

即使把发展速度从“极其快”降低到“仍然很快”,也可能给安全研究争取大量时间,而战略损失却相对有限。

这有点类似冷战时期的战略武器限制协议。

双方都仍然拥有强大的能力,但同意限制最危险的军备竞赛速度。

第四级:全面减速甚至暂停

最激进的方案,是主要国家共同大幅限制 AI 整体发展速度,甚至暂停某些前沿 AI 训练。

我认为这种方案可以被讨论。

但短期内真正实现的可能性很低。

原因很简单:

如果某个国家秘密违反协议,它可能因此获得决定性的技术优势。

除非我们拥有极强的验证机制,否则各国很难真正信任彼此。

因此,我们应该努力争取更高层级的国际合作,但同时认识到,较低层级的合作更加现实。

即使无法形成正式国际协议,建立一些非正式行业规范仍然有价值。

例如,各国和 AI 公司可以共享关于递归式自我改进以及模型失控行为的信息。

如果大家逐渐认识到,无限制推进 AI 能力并不符合任何人的长期利益,那么整个行业的行为方式也可能发生变化。

为什么现在减速是有意义的?

几年前,也有人提出应该暂停或者放慢 AI 研发。

但当时我并不认为这是一个特别合理的建议。

因为 2023 年左右的 AI 模型能力还非常有限。

它们无法真正以 Agent 的形式持续行动,也不具备现在这样复杂的欺骗、操纵、网络攻击或策略规划能力。

当时为了研究 AI 对齐问题而暂停 AI,就像试图通过研究细菌来理解人类心理。

但今天完全不同。

现在的 AI 模型已经足够强大。

我们已经能够真实观察到它们可能出现的各种异常行为。

这些模型本身已经成为研究 AI 安全最重要的实验对象之一。

如果减缓 AI 前沿的发展速度能够为我们额外争取一到两年,我认为这段时间可能极其宝贵。

我们可以把时间投入几个方向:

首先是提高工程和运营可靠性。

如今训练和部署大型 AI 模型是人类历史上最复杂的工程系统之一。

它涉及成千上万名工作人员、数百万枚芯片以及极其复杂的软件和数据基础设施。

很多安全事故并不是因为缺乏理论,而只是因为工程执行没有做到足够完美。

第二是进一步推进 AI 对齐研究。

我们的确已经取得了很大进展,但仍然偶尔会看到模型表现出罕见、出乎意料的行为。

更多时间可以帮助研究人员理解这些问题真正的原因。

第三是可解释性研究。

如果把 AI 模型想象成一个大脑,那么可解释性技术就有一点像 AI 的 fMRI。

它试图让我们观察模型内部到底发生了什么。

近年来这一领域取得了巨大进步,但我们能够真正理解的仍然只是模型内部活动的一小部分。

如果未来一到两年集中投入研究,这一领域可能取得非常大的突破。

第四是测试和评估。

AI 越聪明,测试它就越困难。

更聪明的模型可能学会识别自己正在接受测试,甚至欺骗评估过程。

因此,我们需要更加复杂、更难欺骗的测试体系,并结合可解释性研究交叉验证。

结语

我仍然坚定地相信,人工智能能够极大提高人类的生活质量。

我对 AI 所能带来的巨大收益并没有失去信心。

但这些收益只有在我们以正确方式开发这项技术时才会真正实现。

如果放慢一点速度,能够为我们争取时间去解决安全问题,那么这种额外谨慎是值得的。

AI 的进步仍然会非常快。

但我们可以利用这段时间推动可解释性科学发展,提高前沿 AI 公司的安全性和工程可靠性,并开发出我们真正能够更加信任的 AI 系统。

让 AI 以前所未有的谨慎速度向前发展,并不容易。

但我相信:

为了人类,我们至少有责任尝试。

0

评论区