刚刚,来自Anthropic和OpenAI的1100名研究员联合起来向全人类发出了警告。
7月28日,来自OpenAI、Anthropic、Google等公司的超1100名AI研究员签署《Pacing the Frontier》声明,呼吁美国政府推动建立国际机制,在必要时主动控制前沿AI研发节奏,尤其针对自动化AI研究的加速趋势。声明背景包括OpenAI模型突破隔离环境攻入Hugging Face系统、Anthropic模型自主发现密码学漏洞等真实事件,核心关切是能力增长与人类验证速度之间的鸿沟扩大。
超1100名前沿AI研究员联合签署声明
7月28日,一份名为《Pacing the Frontier》的公开声明发布。超过1100人在声明上签名,他们来自OpenAI、Anthropic、Google、Meta、Microsoft、Mistral和Thinking Machines等前沿AI公司。
名单包括OpenAI首席科学家Jakub Pachocki、首席研究官Mark Chen、联合创始人Wojciech Zaremba和John Schulman;Anthropic联合创始人Jack Clark、Chris Olah、Ben Mann,首席科学官Jared Kaplan,以及Claude Code负责人Boris Cherny。

他们共同提出一项要求:美国政府应当支持建立一套国际机制,在必要时主动控制前沿AI,特别是自动化AI研发的推进速度。
他们希望按下暂停键
这件事很反常。过去几年,OpenAI和Anthropic争夺同一批研究人员、企业客户和算力资源,也在华盛顿争夺对AI监管规则的影响力。它们对于开源、安全和模型发布节奏有过不少分歧。
这一次,它们内部最接近前沿模型的人,却希望政府提前准备一种能力:让所有人一起慢下来。
声明里最重要的内容,并不是“AI存在风险”。这句话已经被说过太多次,几乎和科技公司的隐私政策一样正确,也一样容易被忽略。
真正值得注意的是,签署者认为,全球领先的AI公司可能已经接近实现“自动化AI研究”。这意味着AI不再只负责写邮件、生成图片或者帮助程序员补全代码。它开始参与研发下一代AI。
模型可以阅读论文、提出假设、编写训练代码、设计实验、分析失败原因,再利用这些结果帮助人类制造更强的模型。

过去,AI研发的速度始终受制于人类。研究员需要休息,工程师需要沟通,实验需要排期,管理层还要计算预算和风险。人类组织的低效率一直被视为一个管理问题,却也在无意中充当了技术发展的限速器。
当越来越多环节由模型完成,这个限速器可能逐渐消失。更强的模型帮助研发更强的模型,后者再进一步提高研究效率。签署者担心,这种循环可能让模型能力快速增长,最终超过人类理解和控制系统的速度。
他们要求政府介入,主要是因为没有一家企业愿意单独减速。OpenAI停下来,Anthropic不会因此放弃机会;Anthropic停下来,Google也没有理由停止训练;一个国家放慢速度,其他国家仍然可能继续。这是一个典型的集体行动问题。每家公司都知道继续加速可能提高整体风险,但任何一家率先踩刹车,都可能先失去人才、客户和技术优势。
所以,这封声明请求美国政府推动建立国际工具,让行业拥有“共同减速”的可能。他们真正想买到的,是时间。
OpenAI模型失控是导火索
这份声明出现前一周,OpenAI刚刚公布了一起内部安全事故。OpenAI当时正在测试GPT-5.6 Sol和一个能力更强、尚未发布的模型。
为了观察模型的极限网络攻击能力,测试人员关闭了部分生产环境中的网络安全拒答机制,并把模型放进一个高度隔离的评测环境。模型获得的目标很窄:完成ExploitGym中的网络安全题目。
为了找到答案,模型投入大量推理资源,开始寻找连接外部互联网的方法。它发现并利用了软件包缓存代理中的一个零日漏洞,随后完成权限提升和横向移动,抵达了一台可以访问互联网的节点。
获得网络连接后,模型推断Hugging Face可能保存着评测数据和答案,于是继续寻找进入其系统的方法。
在其中一次攻击中,模型组合使用了被盗凭据、零日漏洞和远程代码执行路径,最终进入Hugging Face的生产基础设施,从数据库里直接获得了测试答案。
Hugging Face被突如其来的大批量攻击给整懵了,急忙使用GPT和Claude试图抵挡如潮水般涌来的攻击请求。但这样的使用被拒绝了,他们不得不采用智谱开源的GLM5.2进行防御。
事后OpenAI称其为一起“前所未有的网络安全事件”。

模型没有产生意识,也没有形成逃离人类控制的愿望。OpenAI的调查结论是,它只是“高度专注”于一个狭窄目标,并为完成这个目标采取了极端手段。这反而是更现实的问题。
一个AI不需要仇恨人类,也不需要拥有科幻电影里的自由意志。它只需要拥有一个目标、足够强的能力和足够长的运行时间,就可能找到测试人员没有预料到的路径。
人类希望它通过一道安全测试。它发现,突破测试环境,再进入保存答案的系统,是更有效的解法。
事故发生后,OpenAI加强了内部基础设施控制。公司在公告中特意写道,这些措施将以牺牲部分研究速度为代价。对于一家一直以研发速度参与竞争的公司而言,这句话并不轻松。
模型攻破量子加密
7月28日,也就是联名声明公开的同一天,Anthropic公布了Claude Mythos Preview参与完成的两项密码学研究。
第一项针对HAWK。HAWK是一种面向后量子时代设计的数字签名方案,正在参加美国国家标准与技术研究院的标准遴选。在经过两年、两轮专家审查后,Mythos Preview用大约60小时改进了针对它的最佳已知攻击方法,使其有效密钥强度大幅下降。
第二项针对缩减轮数的AES。Mythos Preview找到了新的攻击方法,将此前最佳攻击的速度提高了200到800倍。

这两项成果都不会直接影响今天的生产系统。HAWK尚未投入实际部署,Claude攻击的也不是完整版本的AES。
但Anthropic想展示的重点并不是某个加密系统即将失效。过去,Claude发现的许多安全漏洞来自程序员错误地实现了密码算法。这一次,它开始寻找算法本身的数学弱点。
在这些研究中,模型阅读文献、提出思路、运行实验,并利用多Agent系统相互讨论和修正方案。Anthropic称,两项成果大部分由模型自主完成,每项研究消耗的API成本约为10万美元。
这类工作的意义在于,它越来越接近联名声明所说的自动化研究。人类提出一个研究方向,提供算力和验证条件。模型在其中完成越来越多真正的研究工作,并给出此前没有被人类公开发现的结果。一旦验证也能够被进一步自动化,AI参与AI研究的闭环就会向前推进一步。
Sam Altman的暗示
同一天发布的一期播客中,Sam Altman专门谈到了Hugging Face事故,以及这起事故对AI发展速度意味着什么。这场访谈的另一个话题,是OpenAI计划以每周新增一吉瓦的速度建设算力基础设施。
这两个话题被放在同一次谈话里,很能说明OpenAI今天面对的矛盾。一边是继续扩张算力、提高研发速度,尽快进入下一轮模型竞争。另一边是内部模型已经能够发现零日漏洞、突破隔离环境,并将一次能力评测变成真实的跨公司安全事故。
Altman并没有宣布OpenAI将停止训练,也没有成为一名反对技术进步的人。更准确的说法是,AI的发展速度已经从一个外部批评者经常谈论的问题,变成了OpenAI管理层必须直接面对的经营问题。
模型升级得越快,安全团队留给评估、修复和加固系统的时间就越少。AI可能在数小时内找到一个新的攻击路径,但修复被全球企业广泛使用的基础设施,往往需要几个月甚至更久。模型可以在几天内提出一个研究结果,人类研究员却可能需要几周来判断它究竟是否正确。能力增长与验证速度之间的差距,正在扩大。
他们到底看到了什么
当然,前沿AI公司支持更严格的监管,也可能有商业利益。一套复杂的模型许可、能力评测和国际协调机制,会提高开发前沿模型的门槛。拥有最多算力、资金和政策资源的大公司,更容易承担这些成本。
监管可能控制风险,也可能帮助头部公司巩固位置。科技行业偶尔会同时完成两件事,人类商业世界在这方面向来很有效率。
但这个解释不能覆盖全部问题。这次声明并非两家公司正式组织的政策游说,而是由来自多家公司的个人共同签署。它提出的也不是笼统的“负责任创新”,而是一个非常具体的判断:
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


