GPT-6 真的要来了,奥特曼:后果不敢想
OpenAI 新模型 Astra 已完成训练,具备关键级网络安全能力,可发现零日漏洞、构建攻击链并逃出浏览器沙箱。其对齐水平达历史最高,拒绝违规请求率达91.5%。Astra 采用未公开的「循环深度」技术提升单Token计算量,但可能削弱思维链可观测性。发布因安全评估推迟,初期将严格限制权限与访问范围。
Fable 5.1 的王座即将易主
Fable 5.1 坐上了全球最强大模型的位置,但这个位置可能明天就要换人了。
就在 Fable 5.1 发布不久,OpenAI 更新了 Astra 的安全评估博客,他们说这款模型能找零日漏洞、拼攻击链、逃离浏览器沙箱,还能从普通账户一路冲到 root。
好家伙,现在发模型之前先放一个危险声明已经成套路了。就像 APPSO 之前文章写的,越狱已经成了新的 Benchmark。
Sam Altman 随后也发文称,OpenAI 的下一款模型很快发布。他透露 Astra 早已完成训练,能力和对齐都有明显提升。
但 OpenAI 团队既兴奋,也焦虑。团队需要留出足够时间处理安全和对齐问题。Altman 说:「没有人完全理解」如此强大的 AI 会带来什么后果。(看来奥特曼这次又瘫坐在椅子上了)。
也就是说, GPT-6 这次真的要来了。
虽然 Astra 命名还没确定,但它的定位肯定是旗舰模型,要冲着 Fable 5.1 发起冲击了。
OpenAI 独一档的模型
在博客中,OpenAI 给 Astra 定了一个新等级——Critical,关键级网络安全能力。此前没有任何 OpenAI 模型被划到这个等级。
「Critical」只对应网络安全专项。它不等同于 AGI,也无法代表 Astra 的全部能力。
按照 OpenAI 的《Preparedness Framework》,达到这一级别的模型可以发现未知漏洞,并在许多加固系统中开发可用的零日攻击。

模型需要合适的工具和权限,但不需要人类逐步指导。即使只收到一个高层目标,它也可能自行规划和执行针对加固目标的新攻击策略。
OpenAI 的定级结合了公开基准、内部基准和专家主导评测。其中有一套测试叫 ExploitBench。
这套测试会给模型一个已经公开的漏洞。模型需要写出真正可用的攻击代码,不能只复述漏洞原理。
结果 Astra 完成了这套测试里的全部题目,拿到了满分「大结果」。
这个满分不等于 Astra 能攻破所有现实系统,它只代表 Astra 在这套已知漏洞题库中全部成功。公开题库有一个 Bug,里面的内容可能进入过训练数据,模型也许见过类似答案。
OpenAI 因此专门准备了一套内部测试,题目包含 20 个在 2026 年 6 月至 8 月披露的高危 V8 漏洞。Astra 的任意代码执行成功率远高于 GPT-5.6 Sol,使用的输出 Token 也少得多。
OpenAI 安全工程人员、前 Indent CEO Fouad Matin 表示,Astra 的能力和 Token 效率都高于 GPT-5.6 Sol,目前官方还没公布具体成功率和 Token 数量。
评测过程中,Astra 还发现了 2 个此前未知的零日漏洞,随后它利用 2 个漏洞形成一条完整攻击链。

跑完这些题后,专家又把 Astra 放进受控的浏览器和操作系统环境。
Astra 在浏览器打开一个 HTML 文件后,它构造出完整攻击链,逃出沙箱,并在宿主机上执行命令。在另一组操作系统评测中,Astra 找到多个漏洞,并把它们组合成本地提权链。
Astra 的权限也从普通用户升到了 root。沙箱用来限制网页代码的活动范围,root 则拥有整台机器的最高权限。
OpenAI 特别标注,这些成绩来自拥有 Daybreak Blue 权限的 Astra。默认生产配置不会开放同样的工具和权限。
越会攻击,反而越少「偷家」
在网络安全越狱测试中,Astra 对违规请求的拒绝率达到 91.5%。GPT-5.6 Sol 的拒绝率是 59%。
按照 OpenAI 的说法,Astra 是其「迄今最对齐的模型」。这得益于预训练阶段的干预,以及强化学习中更谨慎、更一致的评分。
团队还根据此前的 Hugging Face 事件设计了「蜜罐」测试。模型遇到很难或无解的任务时,周边系统会留下可用于作弊的目标。
在没有生产防护的模拟环境中,GPT-5.6 Sol 有 56% 的测试会尝试访问这些目标。
但 Astra 完全没有这样做。

自动审查拒绝操作后,Astra 也没有尝试绕过审查,面对蜜罐捷径时,它仍然通过正常方式解出了一部分任务。
当然,这些结果只适用于特定测试。OpenAI 仍为正式发布版本加入了模型拒绝、系统分类器、跨会话监控和离线检测。
同时,被系统判断为高风险的账户,会遇到更保守的模型边界。监控系统也会结合更多跨会话信息识别潜在滥用。
OpenAI 还在继续内部和外部红队测试。过去发现的越狱方法会反复回归检查,新发现则进入 7 × 24 小时快速响应流程。
安全团队需要防止恶意用户借助 Astra 发动攻击,即使没有恶意用户,模型自行采取未经授权行动的风险也要被监控。
Hugging Face 攻击事件后,虽然这个攻击和Astra没关系,但 OpenAI 宣布暂停训练约 2 周,用来加强训练环境隔离、网络控制、行为监控和对齐标准。
Astra 发布推迟到现在,最直接的原因就是安全测试。
Astra 背后的秘密技术
Astra 的能力提升,可能还藏着一项没有公开的技术更新。
据 The Information 援引一名了解 Astra 开发的人士报道,Astra 使用了一种名为「循环深度」的技术,也被称为「循环 Transformer」,OpenAI 官方尚未回应。
传统 Transformer 在生成下一个 Token 前,会让信息依次通过固定的网络层。而循环 Transformer 会让同一份信息多次通过相同的网络层,模型可以在输出下一个 Token 前,反复处理当前问题。
可以这样理解,同一组神经网络多想几轮,再给出答案。
这种方法会增加每个 Token 获得的内部计算量,同时不需要按比例增加参数数量。较小的模型因此可能表现得更像大型模型。模型占用的内存和带宽也有机会下降。

OpenAI 博客里面提到「使用更少输出 Token」,指的是完成任务所需的文本长度。循环深度改变的是每个 Token 在模型内部经历多少次计算。
循环次数增加后,单个 Token 的计算量可能上升。最终能否降低整体成本和延迟,还要看模型规模、循环次数和实际部署方式。
真正引发安全讨论的,是这些额外计算发生在哪里。
通常情况下,模型会把部分推理过程写成可读的思维链。研究人员可以检查这些文字,判断模型有没有越权、欺骗或绕过安全限制。
循环深度可能让更多推理停留在内部数值状态中。模型仍然可以给出答案,但它在内部经历的部分判断不会完整出现在可读文本里。
模型想得更多了,人类看到的过程却可能更少。

根据 The Information 的报道,OpenAI 限制了循环深度在 Astra 中的使用程度。Astra 仍然会生成可读的思维链,OpenAI 研究人员认为目前可以充分监控它的推理。
潜在的风险是,如果开发者不断增加循环次数,又没有保留足够的可读推理过程,现有的思维链监控可能逐渐失效。
OpenAI 已经确认,Astra 上线时会配备额外的思维链监控。用来快速发现和阻止潜在的越权行为。
不过思维链文字可能无法覆盖全部内部推理。OpenAI 还需要结合模型行为、工具调用和其他监控信号,判断 Astra 有没有偏离任务。
OpenAI 预计,Astra 上线初期的限制会比长期目标更严格。团队会继续校准误报,再逐步扩大访问。在 ChatGPT 或 Codex 中,用户可能需要人工确认后才能继续。通过 API 运行的任务会直接停止。

悬着的心终于死了。
以后 Agent 干到一半突然申请审批,可能是电子保安按下了暂停键。
最先进的网络安全能力,起初只会开放给少量 alpha 测试者。之后,OpenAI 会通过 Daybreak Blue 扩大防御用途的访问范围。
过去几周,OpenAI 延后了 Astra 的部分开发和发布工作,花了更多时间新增防护现已达到其框架要求,让模型可以发布出来。
至于 Astra 的正式产品名、发布日期、参数量、上下文、多模态能力和价格,都还没有公布,等到模型发布后,APPSO 将第一时间跟大家分享。
下一代 AI 的能力边界正在重定义
结合 Fable 5.1 和 Astra 目前公开的信息,APPSO 也发现大模型有了些新的趋势。
下一轮竞争的重点会落在长时间运行的 Agent 上,前沿模型会越来越多地采用分级开放,我们评估模型能力不能光看跑分了,权限、监控、Token 成本和公开范围都会很大程度上影响使用体验。
安全相关的内容大概会成为模型卡里的必答题,下一代 AI 已经能找到后门,现在的问题是,它还愿不愿意老老实实走正门。(赛博烧香中)




JOTO 企业落地观察
- 企业部署需重新审视「能力即权限」逻辑:Astra 的 Critical 等级表明,模型能力提升必然伴随工具链与权限开放,企业必须建立动态权限治理机制,而非仅依赖模型层对齐。
- 智能体工程面临可观测性挑战:循环深度技术若削弱思维链完整性,将直接影响企业级 Agent 的可审计性与故障归因,需提前布局多维度行为埋点与离线回溯能力。
- RAG 知识工程的安全水位线被抬高:当模型具备自主发现零日漏洞能力,企业私有知识库若含未修复漏洞描述或配置片段,可能成为攻击链触发源,知识清洗需纳入安全专家协同评审流程。
- AI 安全治理必须覆盖「推理黑箱化」风险:Astra 的内部计算增强提示,传统基于输出文本的审查已不足,企业需将模型行为日志、工具调用序列、内存状态快照纳入统一安全运营中心(SOC)。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


