JOTO
Contact us
← AI 智库
大语言模型

Gemini 4 Argon:迈入前沿智能新时代

2026 年 10 月 1 日

Google DeepMind 推出全新前沿 AI 模型 Gemini 4 Argon,专为复杂长流程任务中的深度推理设计,已通过 Fairwind 计划向网络安全专家开放试用。该模型输出 token 上限提升至 100 万,在量子算法优化、内存效率提升、大规模代码迁移、漏洞挖掘与修复等场景中展现出突破性能力,并在 DeepSWE v1.1、CWE-bench v1、LVBench 等多项基准测试中刷新纪录。

正式发布与首批试用

今天,我们正式推出了全新的前沿 AI 模型——Gemini 4 Argon。目前,我们正通过“Fairwind 计划”,率先向一批信赖的网络安全专家开放试用。Argon 专为处理复杂、长流程任务中的深度推理而设计,它已经从根本上改变了 Google 内部的工作和开发方式。无论是在真实的软件工程、法律与金融等企业知识工作、还是网络安全防御领域,Argon 都能应对极具挑战的工作流,展现出顶尖的性能。

分阶段安全释出机制

前沿技术能力的安全释出会分阶段展开。我们正在积极参与美国政府的模型发布前自愿评估流程,并同步逐步放开访问权限。在开发者、企业和用户使用之前,Google 会持续收集早期测试者的反馈,进一步完善安全防护机制。

重塑 Google 的工作与开发方式

Gemini 4 Argon 已开始为 Google 内部的工作流提供支持。数以千计的 Google 员工表示,该模型在专业代码编写、深度研究以及写作质量方面表现尤为突出。它不仅在帮助团队加快开发进度、突破工程生产力的极限,还在加速各项技术突破:

  • 量子算法优化:在量子计算研究中,Argon 正帮助我们的研究人员优化限制关键应用性能的“时空资源”(量子比特数 × 量子逻辑门数)。在一个实际案例中,它仅用几分钟就将已知公开的最佳基准提升了 40%。
  • 内存使用效率:Argon Agent 团队通过分析全集群性能遥测数据,实现了 Google 数据中心内存优化的自主识别与部署,项目一经上线即释放超 300 TiB 内存,预计整体内存节省规模将达 500 TiB 到 1 PiB。
  • 超大规模代码库迁移与优化:Argon Agent 正在将 Google 内部的 C/C++ 代码库向 Rust 迁移——处理规模从小到核心库(如 re2、libgav1)的几万行代码,大到 Fuchsia OS Zircon 内核超 80 万行的庞大系统。鉴于其中许多系统至关重要,此类大规模重写在正式部署到生产环境之前,都会经过严苛的自动化与人工审计、仿真测试以及层层代码复核。

针对 Google 的开源视频解码软件 libgav1,Argon Agent 基于现有的 Rust 移植版本展开优化,通过多轮性能引导(profile-guided)分析实验与编译器输出研究,生成了可实现自动向量化的安全 Rust 代码,从而成功替换了 3.2 万行 SIMD 代码,最终打造出一款内存安全的视频解码器,它的运行速度比原 Rust 移植版快了 2.7 倍,视频输出完全一致,性能已非常接近高度优化的 C++ 版本。

倾力解决您最棘手的难题

为了让 Gemini 4 Argon 能够应对更长、更复杂的使用场景,我们将模型的输出token上限大幅提升至行业领先的 100 万,而此前这一限制为 6万4。当模型拥有足够的发挥空间去展开深度思考、并在单次推演中生成数十万token时,它的推理深度将提升至全新高度,从而能够一步到位地解决各类硬核难题。

Gemini 4 Argon 输出 token 上限对比图
Gemini 4 Argon 输出 token 上限对比图

实现跨领域的编码和企业工作流程

Gemini 4 Argon 在代码编写、逻辑推理和多模态方面拥有出色能力, 同时具备处理长流程、多步骤任务的持续执行力,使其能在各种企业工作流中脱颖而出。

Google 工程师们已将 Argon 融入日常,用它来处理从代码调试到大规模代码库迁移,再到算法设计等各种任务。特别是在衡量真实世界的、长周期软件工程任务 DeepSWE v1.1 基准测试中,Argon 以 77.9% 的得分刷新了行业纪录。

除了代码编写,Argon 在 Vals 指数中也名列前茅。Vals 指数用于衡量金融、编码、法律和税务工作的经济影响,每个行业都根据其对美国 GDP 的贡献进行加权。我们在其他特定领域的评估中也看到了类似的领先表现,例如 Vals Finance Agent v2(多步骤财务研究)和 Harvey’s Legal Agent Benchmark(法律研究和起草)。在 Zapier 的 AutomationBench 基准测试中,Argon 以 51.3% 的得分位居榜首,该基准测试衡量核心业务功能的端到端执行力。

Argon 在需要视觉理解的知识型工作中也展现出独特的优势。它能够进行专业的图表分析,从长视频中识别细节,并根据一系列文档采取行动。例如,在衡量长视频理解能力的 LVBench 测试中,Argon 的得分高达 91.7%。

Argon 在多领域基准测试中的表现对比图
Argon 在多领域基准测试中的表现对比图

引领防御性网络安全

为了让网络安全人员更好地应对新时代的网络攻击,我们对 Gemini 4 Argon 进行了专项训练,赋予了它极强的网络安全防御能力。Argon 能够自主发现、验证并修复关键的软件漏洞。对于信赖的安全员以及 Google 内部团队,我们将提供无网络安全护栏的 Argon 版本,以便他们充分发挥其前沿级别的安全防御能力。

网络安全公司 Wiz 已经通过其“Scan for Good”倡议将 Argon 应用于网络安全防御——该项目旨在通过寻找并修复高危漏洞,免费保护关键的公共基础设施。在早期效果展示中,该模型成功发现了一处影响全球医院所用医疗软件的致命漏洞,该漏洞会导致敏感个人信息泄露,而此前的前沿模型均漏掉了这一严重风险。

在评估模型安全漏洞修复能力的 CWE-bench v1 测试中,Argon 以 68% 的最高分并列第一,这是在 3.8 Flash Cyber 于 CWE-bench v0 取得的优异表现之上的进一步突破。

与 3.8 Flash Cyber 相比,Gemini 4 Argon 在漏洞发现能力上实现了令人瞩目的飞跃。例如:

  • 在 Google 的内部综合漏洞测试中, Argon 在涵盖 20 种编程语言的复杂代码库中,挖掘出了涵盖面极广的安全隐患。
  • 在 Wiz 的内部黑盒渗透测试中,该测试主要评估无源码环境下的实时 Web 系统分析能力,Argon 在攻击面识别、漏洞发现及概念验证(PoC)证据生成等维度上,全面超越了 3.8 Flash Cyber。
  • Gemini 4 Argon:迈入前沿智能新时代 配图 3
Argon 与 Flash Cyber 在漏洞检测维度对比图
Argon 与 Flash Cyber 在漏洞检测维度对比图

在广泛推出之前加强前沿安全保障

在全面推出 Gemini 4 Argon 之前,我们将继续在四个关键领域加强前沿安全保障措施:

防范滥用:为防止恶意行为者将 Argon 用于网络攻击或化学、生物、放射性与核武器(CBRN)攻击,根据我们的前沿安全框架 (Frontier Safety Framework),该模型被设计为能拒绝有害请求,同时保留合法的双重用途科学研究。针对本次发布,我们强化了安全护栏,包括升级内部激活监测技术以识别违规行为。这些防护措施已经通过内部和外部红队结合手动与自动攻击的方法进行了稳健性测试。

抵御提示词注入攻击:Argon 也是我们迄今为止在防范间接提示词注入(利用恶意指令或上下文劫持模型行为)方面最具韧性的模型。这些攻击非常复杂,需要持续保持警惕并采取多层防御措施。通过自动化红队测试和对抗性训练,Gemini 4 Argon 在 Gray Swan 的间接提示词注入(IPI)基准测试中,其提示词注入的稳健性处于领先地位。

Argon 在 Gray Swan IPI 基准测试中的表现
Argon 在 Gray Swan IPI 基准测试中的表现

对齐监测:我们使用类似的系统来监控我们的训练运行,并向专门的事件响应团队发送警报。我们采取了谨慎的预防措施,避免将研究结果反馈回训练中,以免导致 Argon 形成规避监控的推理能力。我们强烈鼓励业界同仁在应对对齐风险的同时,在模型能力提升的关键时刻,保持推理过程的透明度,以确保模型的思考过程依然有助于识别和诊断不对齐问题。

系统加固:随着前沿模型的能力日益增强,对其进行安全地测试需要能够与系统自身能力相匹配的安全环境。为了与智能体控制路线图保持一致,我们在高风险训练或评估开始前,通过隔离和密封来加固沙盒环境。我们致力于与合作伙伴分享这些智能体安全最佳实践,以提升整个生态系统的安全性。

即将上线

我们打造了具备前沿级编程、知识工作、网络安全防御和创意写作能力的 Gemini 4 Argon,使其成为开发者、专业人士和企业攻克棘手问题的得力伙伴。我们非常感谢首批网络安全防御人员和信赖的测试人员,他们的实地评估与反馈将帮助我们在面向开发者、企业和用户(从付费 API 客户和 Google AI Ultra 订阅者开始)发布之前进一步强化我们的系统。

Gemini 4 Argon:迈入前沿智能新时代 配图 6
Gemini 4 Argon 即将上线宣传图
Gemini 4 Argon 即将上线宣传图
Gemini 4 Argon:迈入前沿智能新时代 配图 8

JOTO 企业落地观察

  • 企业若计划将类似 Argon 的长上下文、高推理深度模型接入生产系统,需重新评估 RAG 知识工程的架构边界——传统分块检索+重排序范式可能无法匹配百万 token 输出所需的语义连贯性,需转向基于图谱的动态知识编织或端到端记忆增强机制。
  • Argon 在漏洞挖掘与修复任务中展现的自主闭环能力,对企业智能体工程提出新要求:不再仅关注单步工具调用准确率,而需构建包含“假设生成-沙盒验证-影响评估-合规审查”四阶反馈环的智能体工作流编排框架。
  • 其无护栏版本专供可信安全团队使用的设计,凸显企业在部署前沿模型时的安全治理取舍:完全关闭护栏不可行,但通用护栏又会抑制专业场景能力;可行路径是构建可插拔、可审计、按角色分级启用的细粒度护栏策略引擎。
  • Argon 在 DeepSWE v1.1 和 CWE-bench v1 等垂直基准上的领先表现,说明企业评估智能体能力时,应放弃通用 MMLU 类指标,转而采用与自身核心工作流强耦合的定制化基准,例如法务合同审查链路、金融风控决策树覆盖度、或产线缺陷归因准确率。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.