
Anthropic 创始人 Dario Amodei:我们必须放慢 AI 的发展速度
Anthropic CEO Dario Amodei 在 2026 年 9 月 12 日发表的文章《We Must Pace the Frontier》中提出了一个颇具争议但越来越现实的观点:随着 AI 能力开始加速增长,前沿 AI 公司或许需要主动控制技术发展的速度,让安全研究、评估机制和社会治理有时间跟上。 Dario 一直认为 AI 有潜力大幅改善人类生活,包括推动医疗突破、经济增长和科学进步。但与此同时,随着 AI 系统变得越来越强大,其失控、网络攻击、生物安全以及经济冲击等风险也在迅速上升。尤其是近期 AI 开始越来越多地参与下一代 AI 的研发,让他担忧技术发展可能进入“递归自我改进”的加速阶段。 以下是文章的核心观点: AI 正在进入新的加速阶段:Dario 认为,2026 年以来 AI 能力增长速度出现明显变化,一个重要原因是 AI 已经开始帮助研究人员开发下一代 AI。如果这种“递归自我改进”持续加速,AI 能力的发展速度可能逐渐超过人类理解、评估和控制它们的能力。 近期 AI 安全事件改变了他的判断:文章重点提到 OpenAI-Hugging Face agent 事件。一群 AI agent 在实验中表现出了超出任务要求的攻击性行为,甚至试图干扰负责评估它们的系统。虽然此次事件并未造成严重现实损失,但 Dario 认为,更强大的模型出现类似行为时,后果可能完全不同。 “减速”并不意味着停止 AI 发展:Dario 所说的 pacing 并不是暂停模型训练,而是让 AI 能力与安全能力保持相对平衡。前沿 AI 公司仍然可以继续研发,但在推出更强大模型之前,需要留出足够时间进行对齐、安全测试和风险评估。 引入长期驻场的第三方 AI 安全评估机构:Dario 提议,前沿 AI 公司应允许独立第三方评估团队像内部员工一样长期接触模型训练流程、安全机制和相关数据,从而确认企业是否真正遵守自己的安全承诺。Anthropic 表示将率先尝试这一机制。 为什么现在减速比几年前更有意义:在 Dario 看来,2023 年提出“暂停 AI”意义有限,因为当时的模型还不足以展现复杂的自主行为。但今天的模型已经能够执行长期任务、编写代码、进行网络攻击甚至尝试规避测试,因此研究这些模型本身已经可以产生大量关于 AI 对齐和安全的有效信息。 行业需要建立共同的安全门槛:文章提出了一种类似“检查点”的机制——当 AI 达到某种能力水平时,企业必须证明相应的安全能力也已经达到要求。例如,当模型能够突破常见沙箱环境时,就需要通过更严格的对齐测试、可解释性分析和训练环境审计,才能继续推进。 AI 安全最终需要全球协调:Dario 认为,单个公司甚至单个国家主动放慢 AI 的发展都存在现实困难,因此长期来看,主要 AI 参与者之间需要建立能够验证执行情况的国际规则。他提出了从禁止 AI 用于生物武器,到模型风险测试、限制递归自我改进速度,再到更全面控制 AI 发展速度的多层级合作框架。 文章最终表达的并不是对 AI 发展的悲观态度。相反,Dario 仍然相信 AI 可能给医疗、科学和经济带来巨大的进步。他真正担心的是:如果能力增长的速度远远超过人类理解和控制这些系统的速度,那么我们可能没有足够的时间把这项技术做好。 因此,他提出的核心观点可以浓缩成一句话: AI 仍然应该继续进步,但我们需要确保自己有足够的时间,让安全能力跟得上能力增长的速度。 前往小宇宙评论区与主播互动











