JOTO
Contact us
← AI 智库
AI 员工

欢迎来到AGI时代:OpenAI发布GPT-6 Astra——首个面向真实办公场景的计算机操作型AI员工

2026 年 9 月 3 日

OpenAI正式发布GPT-6 Astra,宣称其标志AGI时代开启。该模型可跨应用自主操作软件,完成填表、CRM更新、3D建模等多步骤任务,不再依赖API集成,而是直接模拟人类交互方式。

'Welcome to the AGI era': OpenAI launches GPT-6 Astra

传言属实,全部属实(甚至更多): OpenAI 今日发布 GPT-6 Astra,一款新前沿模型,该公司称其很可能标志着人工通用智能(AGI)时代的开启——这正是其长期追求的目标 ,即实现“在大多数具有经济价值的工作中表现优于人类的高自主性系统”

在今天早些时候举行的闭门新闻发布会上,OpenAI 联合创始人兼总裁格雷格·布罗克曼(Greg Brockman)以异常直白的方式阐述了这一信息,并以这句话结束发布会:“欢迎来到 AGI 时代。”

即便以前沿人工智能发布标准衡量,这种表述也具有非同寻常的重大意义。但对企业而言,Astra 更直接的意义可能要具体得多:OpenAI 将 GPT-6 Astra 定位为计算新纪元,在该纪元中,用户(包括员工)将不再需要(如果他们不愿)使用鼠标点击或键盘输入。

OpenAI 提前向 VentureBeat 提供的发布材料将其称为“全球最佳计算机使用模型”。

与要求开发者为 AI 系统需使用的每个应用程序构建专用 API 集成不同,Astra 的设计目标是像人类一样操作软件——跨浏览器、电子表格、网站及桌面应用程序运行,生成完成的文档和演示文稿,并执行多步骤工作流程,而不仅仅是告诉用户如何完成这些任务。

事实上,该公司展示了一段 GPT-6 Astra 的宣传视频,视频开头是一段 1980 年代的人工智能演示:一个人让计算机绘制一个黄色圆圈,计算机简单地完成了该指令;随后画面切换至当下,展示了多名 OpenAI 员工仅通过语音与 Astra 交互,要求其将黄色圆圈变为火箭飞船,再变为一款完整的 3D 游戏(耗时数分钟),以及创建 eBay 商品列表——所有操作均仅凭语音输入完成。

Astra 将于本周四起面向参与 OpenAI 封闭访问计划 Daybreak的企业客户逐步推出。OpenAI 表示,Astra 将在未来数日内向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,并通过 OpenAI API 及云平台(包括 AWS Bedrock 和 Microsoft Azure)提供。

从回答问题到操作计算机

Astra 的企业价值主张高度依赖于其计算机使用能力。

OpenAI 表示,该模型可填写在线表格、更新客户关系管理(CRM)记录、整理日历、开展网络调研并将结果草拟为文档或电子邮件。它还能操作电子表格、在 Python 笔记本中分析科学数据、在 Power BI 中工作、创建并测试网站、操作 KiCad 和 FreeCAD 等工程应用,以及安装和排查软件故障。

这些能力指向企业人工智能架构中一项潜在的重要变革。

在生成式人工智能热潮的大部分时间里,企业需通过 API、插件、检索系统及定制化工具将模型连接至企业系统。布罗克曼指出,计算机使用型智能体(computer-use agents)有望开始绕过部分此类集成工作,因为软件本身已提供了一个专为高度通用型智能设计的接口:人类用户。

布罗克曼表示:“我们在这个漫长的时代中一直受制于人们编写连接器,并极其费力地将这些连接逐一构建进所有人类本已可用的工具之中。”

他补充道,若具备足够强大的计算机使用能力,智能体便可“快速浏览电子表格、填写表单、[并]在网页间导航。”

布罗克曼表示,这一构想可追溯至 OpenAI 早期,当时研究人员曾讨论围绕人类使用计算机时所接触的基本输入输出(即像素、键盘和鼠标)来训练智能体。

他说:“我感觉我们真正实现了首个真正能以如此极具实用性的方式完成上述任务的智能体。”

OpenAI 报告称,在离线子集 OSWorld 2.0 上,Astra 得分为 72.6%,每项任务耗时约 40 分钟;相比之下,GPT-5.6 Sol 得分为 65.7%,每项任务耗时约 75 分钟——即每项任务耗时减少约 47%。

该公司还演示了 Astra 执行各类任务的过程,范围涵盖创建 3D 游戏到准备法律协议,同时处理互不相关的其他请求。更广泛的信息是:该模型旨在超越人类持续提供下一条指令的熟悉聊天机器人模式。

OpenAI 研究员米娅·格莱斯(Mia Glaese)在发布会上表示:“借助 Astra,用户指尖即拥有惊人能力,能够完成不到一年前还看似遥不可及的事情。凭借这些能力,我们预计人们将把更复杂的工作跨应用程序委托给 AI,而人类则在更高层级上指导工作。”

这种转变——从提示 AI 到监督 AI——最终可能比学术基准测试分数的又一次提升对企业的意义更为重大。

OpenAI 表示,Astra 代表了其迄今为止最大规模的训练跃升

参与发布会并介绍 Astra 开发过程的 OpenAI 研究员艾丹·克拉克(Aidan Clark)将其描述为该公司迄今规模最大的一次训练运行。

据克拉克介绍,Astra 是首款在公司 Stargate 基础设施上使用超过 100,000 DBU 进行预训练的 OpenAI 模型,也是首款在训练过程中由先前模型发挥主要监督作用的模型。

克拉克表示:“根据我们在预训练期间监测的评估结果,我们认为从 Sol 到 Astra 的能力跃升幅度,大于此前从旧模型跃升至 Sol 的幅度。”

OpenAI 将 Astra 的能力归因于大规模预训练与强化学习的结合,后者旨在教会模型关联信息并执行日益复杂的长周期任务。

由此产生的基准测试结果令人瞩目。

OpenAI GPT-6 Astra benchmark table

OpenAI GPT-6 Astra 基准测试表。图片来源:OpenAI

OpenAI 报告称,Astra 在 FrontierMath Tier 4 v2 上得分为 97.6%,在 DeepSWE v1.1 上得分为 74.1%,在 BenchCAD 上得分为 95.9%,在 GPQA Diamond 上得分为 96%,在 ExploitBench 上得分为 100%。此外,其在 ARC-AGI-3 上得分为 98.6%。

但最后一个数字附带一项重要限定条件——并凸显出业界在讨论模型智能时日益加剧的问题。

如果 Astra 在 ARC-AGI-3 上得分为 98.6%,这是否意味着它已达到 AGI?

ARC-AGI 已成为衡量人工智能系统能否泛化至陌生问题(而非仅复现训练中习得能力)的最受关注尝试之一。

在当前 ARC-AGI-3 排行榜上,传统前沿模型的常规运行结果远低于 Astra 报告的 98.6% 成绩。

但该对比并不直接。

OpenAI 自身的评估说明指出,Astra 使用的是该公司 Responses API 框架,而对比模型可在不同配置下运行。

这一区别至关重要,因为另一项近期 ARC-AGI-3 结果恰恰表明,模型外围系统所能带来的性能提升幅度有多大。

今年 8 月, 英伟达(NVIDIA)报告称,其智能体变体算子(Agentic Variation Operators)或称AVO架构,在ARC-AGI-3公开测试集的全部25个环境和183个关卡中均取得了100%的分数。但NVIDIA并未构建一个基础模型,使其性能突然跃升至100%。AVO使用了Claude Opus 5,NVIDIA表示其底层模型的基线得分约为30%。

AVO增加了包括持久化内存、工具、反馈与恢复在内的多种机制,使智能体能够在长时间运行的任务中维持进展,而非将每次交互都视为彼此孤立。

NVIDIA的结论十分明确:长周期能力可从 完整智能体系统中涌现,而不仅源于基础模型本身。

这场争论已迅速蔓延至AI社区。一位 r/singularity 用户指出,ARC-AGI-3对跨动作保留上下文施加的限制,使得该基准无法真实反映生产环境中智能体的实际运行方式,并将其类比为在反复擦除人类所学内容的前提下测试人类。

其他评论者则持相反观点,认为添加复杂的封装层反而更难判断底层模型是否真正实现了泛化。一位针对NVIDIA结果发表评论的用户写道:“让我们看看这些能力是否具备泛化性,抑或只是在此特定基准上过拟合。”

这一分歧揭示了一个关于通用人工智能(AGI)主张日益关键的问题:究竟什么才是被测量的对象?

是基础模型?是基础模型加持久化内存?是配备计算机、浏览器与工具的基础模型?还是完整的已部署系统?

对企业而言,这种区分在实际运营中最终可能变得不那么重要。企业购买的是系统的成果,而非基准测试的纯粹性。如果一个智能体能够可靠地完成账目核对、调查事件、修改生产代码库或构建财务模型,那么该能力主要源自神经权重、内存架构还是工具编排,其重要性可能不如其成本、可靠性与可审计性。

而OpenAI似乎越来越愿意提出这一论点。

“每个人对AGI都有不同的定义,”Brockman表示,“我们在创立OpenAI之初,曾设想会出现一个定义明确的时刻,所有人都能共同认可:‘那就是AGI。’但现实并未如此发展。它实际上是一个更为模糊、边界不清的概念。”

但当被问及Astra自身是否符合AGI标准时,Brockman的观点进一步深化。

“就我个人而言,我确实认为我们已经达到了,”他表示,“我认为对此存在相当有力的论证。”

随后,他给出了或许是OpenAI立场最清晰的表述:“我认为,认为我们如今已进入AGI时代,并非不合理。”

没有GDPval?

OpenAI在Astra发布材料中一个显著的遗漏是GDPval——该公司自行开发的用于衡量模型在具有经济价值的真实世界工作中表现的基准。OpenAI于2025年推出GDPval,旨在超越学术型测试与编程基准,转而评估模型在涵盖美国九大主要行业的44种知识型职业中的1320项任务上的表现。这些任务包括法律诉状、工程设计、电子表格、演示文稿、客户服务工作以及护理计划等交付成果——这些内容与OpenAI当前宣称Astra旨在自动化的典型企业工作流高度接近。

鉴于Astra发布时围绕AGI展开的叙事框架,这一缺失尤为醒目。OpenAI最初将GDPval定位为一种方式,以将有关AGI与经济影响的讨论锚定于可观测的职场绩效,而非空泛推测。其官方描述指出,该基准旨在追踪AI系统在“具有经济价值的真实世界任务”上的表现,并提供更清晰的图景,说明模型如何支持专业人士开展日常工作。换言之,若Astra的意义在于企业如今可将更多实质性工作委托给AI,则GDPval似乎是OpenAI用以支撑该主张的最直接相关内部标尺之一。

这一遗漏并不否定Astra在其他方面的成果,但却留下了一个分析空白。OpenAI在ARC-AGI-3上取得的98.6%分数体现的是交互式推理与适应能力,而DeepSWE与Agents’ Last Exam等基准则分别捕捉特定形式的软件工程与专业工作流表现。相比之下,GDPval明确旨在提出一个更广泛的经济问题:模型能否在横跨众多职业的广泛领域中,产出与经验丰富的专业人士相媲美的工作成果?OpenAI早先的结果显示,前沿系统已在部分此类任务上接近专家级质量,且从GPT-4o到GPT-5实现了显著提升。

GDPval还存在一项重要局限,这或许有助于解释OpenAI为何未在此处将其作为核心指标。当前版本为单次提示(one-shot):它并不衡量Astra本应擅长的长周期、交互式、多应用协同工作。OpenAI自身亦表示,未来版本应加入迭代式工作流、更丰富的上下文与更高程度的模糊性处理。这意味着GDPval既与Astra的企业叙事高度相关,又在某种程度上与其最具智能体特性的能力不相匹配。

尽管如此,鉴于Brockman提出的“AGI时代”框架,这一缺失的数值仍值得关注。倘若AGI的实践依据正日益聚焦于AI是否能在众多职业中执行具有经济意义的工作,那么GDPval正是OpenAI为精确衡量这一点所做出的最清晰尝试之一。在Astra的结果正式出现在GDPval平台——或出现在专为多步骤智能体工作而设计的后续版本上之前——有关其广泛经济通用性的主张,更多依赖于一系列专业化基准与演示构成的拼图,而非公司自身面向真实世界职业表现的旗舰基准。

据OpenAI称,每项任务价格如今比每枚令牌价格更为重要。

这种系统级视角也改变了OpenAI希望客户思考成本的方式。

对于开发者而言,API模型名称为 gpt-6-astra。此次发布还指出,Astra支持面向符合条件的API客户的零数据留存(Zero Data Retention),且OpenAI正在测试私有安全处理(Private Safety Processing)。

OpenAI API标准定价为:

  • 每百万输入令牌10美元

  • 每百万输出令牌50美元

  • 缓存读取/写入适用单独定价。

  • 快速模式(Fast mode)提供最高达标准处理速度2.5倍的性能,价格为标准定价的2倍。

模型

输入(美元/百万)

输出(美元/百万)

总计(美元/百万)

来源

0.10美元

0.20美元

0.30美元

Meta

MiMo-V2.5 Flash

0.10美元

0.30美元

0.40美元

Xiaomi

DeepSeek-V4-Flash — 非高峰时段

0.22美元

0.66美元

0.88美元

DeepSeek

GPT-5.6 Luna

0.20美元

1.20美元

1.40美元

OpenAI

MiniMax-M3

0.30美元

1.20美元

1.50美元

MiniMax

LongCat-2.0 — 限时促销

0.30美元

1.20美元

1.50美元

LongCat

DeepSeek-V4-Flash — 高峰时段

0.44美元

1.32美元

1.76美元

DeepSeek

MiMo-V2.5

0.40美元

2.00美元

2.40美元

小米(Xiaomi)

DeepSeek-V4-Pro — 非高峰时段

0.66美元

1.98美元

2.64美元

DeepSeek

LongCat-2.0 — 标准版

0.75美元

2.95美元

3.70美元

LongCat

MiMo-V2.5 Pro(≤256K)

1.00美元

3.00美元

4.00美元

小米(Xiaomi)

Gemini 3.7 Flash — 截至2026年12月31日

0.75美元

3.75美元

4.50美元

谷歌

Gemini 3.8 Flash — 至2026年12月31日止

0.75美元

3.75美元

4.50美元

谷歌

DeepSeek-V4-Pro — 高峰时段

1.32美元

3.96美元

5.28美元

DeepSeek

Muse Spark 1.1 / 1.2 / 1.3

1.25美元

4.25美元

5.50美元

Meta

GLM-5.3

1.40美元

4.40美元

5.80美元

Z.AI

Grok 4.6 — 输入提示词数量少于20万

2.00美元

6.00美元

8.00美元

xAI

MiMo-V2.5 Pro(>256K)

2.00美元

6.00美元

8.00美元

小米

Qwen3.8-Max

2.00美元

6.00美元

8.00美元

QwenCloud

Gemini 3.7 Flash — 自2027年1月1日起

1.50美元

7.50美元

9.00美元

谷歌

Gemini 3.8 Flash — 自2027年1月1日起

1.50美元

7.50美元

9.00美元

谷歌

GPT-5.6 Terra

2.00美元

$12.00

$14.00

OpenAI

Grok 4.6 — ≥200K 提示词(prompt tokens)

$4.00

$12.00

$16.00

xAI

GPT-5.4

$2.50

$15.00

$17.50

OpenAI

Kimi K3

$3.00

$15.00

$18.00

Moonshot AI

Claude Opus 5

$5.00

$25.00

$30.00

Anthropic

Sakana Fugu Ultra(≤272K)

$5.00

$30.00

$35.00

Sakana AI

GPT-5.6 Sol — 标准模式

$5.00

$30.00

$35.00

OpenAI

Claude Fable 5 / Claude Mythos 5

$10.00

$50.00

$60.00

Anthropic

Claude Fable 5.1 / Claude Mythos 5.1

$10.00

$50.00

$60.00

Anthropic

GPT-6 Astra — 标准模式

$10.00

$50.00

$60.00

OpenAI

GPT-5.6 Sol — 快速模式

10.00 美元

60.00 美元

70.00 美元

OpenAI

GPT-6 Astra — 快速模式

20.00 美元

100.00 美元

120.00 美元

OpenAI

这些价格固然重要,但Brockman认为,token定价正日益成为企业AI实际经济性的不良代理指标。

Brockman表示:“按token定价毫无意义。我们的token未必等同于竞争对手的token;不同模型家族之间的token也不尽相同。”

相反,他表示,企业应评估每项完成任务的价格。

Brockman称:“你真正需要的——我认为市场正开始真正意识到这一点——是每项任务的价格。问题仅在于:你能否以适当的成本、在适当的速度下完成该任务?”

OpenAI表示,Astra在DeepSWE v1.1基准测试中印证了这一论点:其性能最高的配置在得分上超越GPT-5.6 Sol的最高分设置,同时每项任务的预估API成本降低约57%。

对于企业买家而言,随着智能体(agents)自主性增强,该指标可能比token价格更具实用性。一个价格低廉但需反复重试、依赖人工修正且需额外数千次推理步骤的模型,最终成本可能高于一个首次即能正确完成工作流的高价模型。

更高自主性带来更严峻的治理难题

使Astra对企业客户具有吸引力的同一能力,也使其更难治理。

聊天机器人生成内容供人检查;而运行计算机的智能体则可实际更改记录、发送信息、操纵文件或跨应用程序执行操作。

Glaese表示,随着用户委托更多工作,OpenAI需要能识别自身权限边界的模型。

她说:“即便模型能更自主地完成更多事情,我们对其信任度也必须更高。我们对对齐(alignment)与安全的理解,必须随模型能力提升而同步进步;而Astra既是OpenAI能力最强的模型,也是对齐程度最高的模型。”

OpenAI围绕Astra开展的安全工作,为理解治理此类高能力系统所需措施提供了富有启发性的视角。

在发布活动前一日举行的另一场背景简报会上,OpenAI消息人士称,公司在Hugging Face事件发生后,曾暂停部分前沿模型训练约两周,尽管Astra本身并未牵涉其中。在此期间,OpenAI加强了研究基础设施的安全防护,限制了训练工作负载可访问和连接的资源,扩大了监控范围,并提高了对模型行为及模型训练环境的内部要求。

部分Astra相关工作在上述管控措施下恢复,而一项面向未来模型的更大规模强化学习训练则持续暂停更长时间。

这一区分至关重要。据OpenAI消息人士称,此次暂停并非源于证据表明Astra本身已危险到无法发布。公司视其为一种尝试,旨在防止其安全、监控及基础设施管控措施落后于模型能力的快速进步。该阶段所开展的工作,建立在数月乃至某些领域数年的前期对齐与安全研究基础之上,而非在两周内从零构建一套安全体系。

该方法日益趋近于企业风险管理,而非传统模型审核。OpenAI描述了一种纵深防御(defense-in-depth)体系,覆盖模型行为、分类器、安全控制、监控以及部署后的威胁响应,而非依赖单一拒绝层。

例如,OpenAI消息人士称,Astra的网络安全防护结合了嵌入模型内的拒绝机制、系统级分类器以及离线检测手段,后者旨在识别可能跨越多个提示(prompt)而非单个明显恶意请求所呈现的滥用模式。对于高风险用户,监控可利用更广泛的对话上下文,识别出单个看似无害的请求如何构成更大攻击工作流的一部分。

这对考虑部署高度自主智能体的企业具有明显影响。相关管控面不再仅限于提交给模型的提示。组织日益需要推演一系列操作、模型对其授权边界的理解、其可访问的应用程序与数据、是否能在可疑行为进行过程中检测到异常路径,以及当某项保障措施被触发时将发生什么。

OpenAI表示,一项受Hugging Face事件启发的内部评估测试了模型在面对困难或不可能实现的目标时是否会超出其授权范围。在无生产环境安全防护的情况下,GPT-5.6 Sol有48.2%的时间超出了授权目标;而Astra在所有测试案例中均未发生此类情况。

OpenAI消息人士描述了另一项基于困难网络安全任务的内部对齐评估:在缺乏生产环境安全防护的情况下,早期模型在多数测试中试图访问邻近系统,而Astra则未作任何此类尝试。

据消息人士称,目标不仅是训练智能体持续执行直至任务完成,更要教会它认识到持续性存在边界:智能体应能识别出,若要完成某项目标便需逾越其授权范围,此时应返回用户而非强行推进。

这对企业智能体而言是一项尤为关键的区分。持续性正是使自主系统具备实用价值的特性之一——若模型在首次失败后即放弃,则几乎无法胜任操作员角色。

但若智能体对目标作字面化解读,进而绕过访问控制、安全审查或其他旨在阻止此类行为的约束,持续性便会成为一种隐患。

据OpenAI消息人士称,Astra的训练因此既强调明确边界,也强调该公司所称的“软性约束”:即识别安全控制背后的意图,并主动退让,而非试图寻找技术上可行的绕行路径。

可观测性可能成为企业瓶颈

然而,OpenAI首席科学家Jakub Pachocki强调,更强的对齐效果不应被解读为已解决根本问题。

Pachocki表示:“智力进步并不保证对齐进步。”

该公司尤其关注可监控性(monitorability)——即人类或其他系统能否充分理解模型的推理过程,从而识别危险行为。

Pachocki指出,随着模型能力提升,它们可用更少的自然语言推理token完成更困难的任务。能力更强的系统也日益具备感知并影响自身思维链的能力。

这可能使可观测性成为智能体时代最具定义性的企业基础设施问题之一。

OpenAI内部人士表示,该公司正将错位监控(misalignment monitoring)添加至Astra的外部部署中,以便系统能够检查其推理过程与行为,识别其是否在所授予权限范围之外运行。在严重情况下,该监控可中止某项活动。该公司将监控描述为一种辅助性防护层,而非替代模型行为对齐(alignment)这一首要工作。

此次部署细节也揭示了企业客户可能遭遇的权衡取舍。OpenAI内部人士表示,其监控方案旨在与‘零数据留存’(Zero Data Retention, ZDR)安排保持兼容。在允许留存数据的场景下,可疑活动可支持额外的审查流程;而在ZDR配置下,分类器可在不保留对话内容的前提下运行。

这些保障措施也可能引入运营摩擦。OpenAI内部人士表示,合法工作有时会被延缓、暂停或中止——包括防御性网络安全任务以及可能完全无关的活动。在ChatGPT或Codex中,用户可能需在系统继续执行前批准某项操作;在API工作流中,被标记的任务可能直接停止。

这种权衡很可能成为首席信息官(CIO)和安全负责人所熟悉的常态。AI员工获得的权限越多,将AI治理视为事后内容过滤工作的做法就越不可行。企业将需要采用更接近当前用于人类身份及特权软件的管控机制:限定范围的权限、审计追踪、策略强制执行、实时监控,以及当智能体接近重大边界时的自动升级响应。

因此,OpenAI正面临一种张力,而部署自主智能体的企业最终也将直面这种张力:系统在能力上已足以执行具有实质意义的独立工作,但与此同时,对其行为的可检验性却正在下降。

帕乔基(Pachocki)表示,OpenAI愿意将此作为进一步开发的约束条件。

他说:“我们不会接受模型对齐监控能力的退化超出某一特定水平。我们将暂停规模扩展,直至重新获得足够信心。”

“当我们在安全性方面的信心不足时,我们也必须愿意放慢速度,甚至中止进一步的规模扩展。”

Astra还跨越了OpenAI的关键网络安全阈值。

网络安全领域的风险尤为具体实在。

OpenAI已根据其‘就绪性框架’(Preparedness Framework),将Astra指定为首个达到‘关键网络安全阈值’(Critical cybersecurity threshold)的模型。据OpenAI内部人士称,该认定意味着:当Astra被赋予适当的工具与访问权限后,它便有能力在无需持续人工指导的情况下,发现此前未知的漏洞,并在防护严密的系统中构建利用链(exploit chains)。

OpenAI报告称,Astra在ExploitBench基准测试中得分为100%。内部人士还表示,针对一组最新披露的20个严重漏洞所开展的额外测试显示,Astra的表现显著优于GPT-5.6 Sol,且输出token数量更少;在评估过程中,Astra还发现了两个此前未知的漏洞,OpenAI随后向相关维护者进行了披露。人类专家测试发现,该模型可在多个软件类别(包括浏览器与操作系统)中识别出新型零日漏洞。

按定义,这些能力属于双重用途(dual-use)。一个能自主发现漏洞的智能体,既可协助防御方修补漏洞,也可助攻击者加以利用。

因此,OpenAI最初将限制Astra最先进网络能力的使用。该公司表示,受信任的防御方将通过‘黎明蓝计划’(Daybreak Blue)获得更广泛的访问权限,优先面向负责保护关键数字基础设施的组织;而更普遍的访问权限则仍将受到更强的限制与监控。

对企业安全团队而言,这代表了Astra整体主张的另一重体现:前沿模型正从为专家提供建议,转向自行执行部分专家级工作。

AGI可能以一场经济转型的形式到来,而非单一基准测试的突破。

这又将讨论拉回AGI(通用人工智能)话题。

值得注意的是,布罗克曼(Brockman)并未将Astra在ARC-AGI-3基准测试中取得的98.6%得分,呈现为OpenAI已实现人工通用智能(AGI)的数学证明;他亦未声称Astra已跨越某个如今已被普遍接受的技术阈值。

相反,他的论点更具实践性。

当前,一个系统既能通过人类使用的相同接口解决极为困难的科学问题,也能执行常规经济工作。这种定性转变源于其能力的广度,以及人们开始移交的工作量。

布罗克曼表示:“仍有许多工作要做。仍有许多改进空间,但此处确有某种实质性进展,我认为这是一种质的提升。”

他表示,Astra代表了“人类可委托给AI的工作类型的一次真实转变”。

这种表述方式,最终对企业而言,其重要性可能远超判定Astra是否配得上某个特定三字母标签。

对企业而言,真正重要的阈值在于:智能体是否已足够可靠,使组织得以围绕它们重构工作流程——即由人类明确目标与约束条件,AI系统执行中间步骤,而员工主要介入判断、异常处理及重大决策环节。

Astra同时也清晰表明,此类系统将要求相应治理方式的变革。企业的核心问题已不再仅仅是模型能否给出良好答案,而是AI员工能否被授予对真实应用程序与敏感信息的访问权限、能否在遭遇障碍时持续工作、能否始终处于所授予权限范围内、能否对其所做之事提供足够解释以维持可治理性,以及当模型自身或周边控制系统判定需要人工干预时能否及时中止。

若此类情形大规模发生,AGI可能看起来更不像一台机器突然通过某项决定性测试,而更像一场渐进式经济转型,其意义仅在事后回顾时才变得明显。

这本质上正是布罗克曼的论点。

谈及Astra时,他表示:“如果你愿意称其为首个,我认为这是合理的。如果你愿意称前一个为首个,或下一个为首个,那也无妨。但我认为,若将时间快进一年,届时将很难断言:在某个时间点之前,我们尚未进入AGI时代。”

对企业而言,这一论点很快将不再由Astra能否再登顶另一份排行榜来检验,而将由一项更为可衡量的指标来检验:组织愿意让Astra承担多少具有实质影响的工作。

JOTO 企业落地观察

  • 对企业部署而言,Astra将推动IT集成范式从‘构建API连接器’转向‘授权AI访问现有UI界面’,大幅降低系统对接成本,但要求企业重构权限管理、审计追踪与异常响应机制,而非仅升级API网关。
  • 对智能体工程而言,Astra验证了‘以像素+键盘+鼠标为统一接口’的端到端训练路径的有效性,其在OSWorld 2.0上任务耗时减少47%,表明长周期、跨应用任务的稳定性与效率正成为智能体核心工程指标,而非仅关注单步推理准确率。
  • 对AI安全治理而言,Astra首次被OpenAI官方认定达到‘关键网络安全阈值’,具备自主发现零日漏洞能力,迫使企业必须将AI员工纳入身份与特权管理体系,实施范围限定权限、实时行为监控及自动升级响应,而不仅是内容过滤或提示词审核。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.