
图片:METAL
摘要
- Google DeepMind 于 9 月 30 日发布新一代前沿模型 Gemini 4 Argon,并率先向 Fairwind Program 中受信任的网络防御者部署。
- Argon 在 DeepSWE v1.1 上取得 77.9%,Vals Index 为 68.9%,AutomationBench 为 51.3%,但在 FrontierSWE v2 和 Terminal-bench 4.0 上由其他模型领先。
- Google 将输出 token 上限从 64K 提高到 1M,并表示将在强化滥用防御、提示注入防御、失准监控和沙箱加固四类安全措施后再广泛开放。
Google DeepMind 于 9 月 30 日(当地时间)发布新一代前沿模型 Gemini 4 Argon。该模型面向真实软件工程、法律与金融等企业知识工作以及网络安全防御等漫长而复杂的工作流程。首批用户并非普通公众,而是参与 Google Fairwind Program 的受信任网络防御者。
发布顺序本身就是此次公告的第一条信息。Google DeepMind 高级副总裁兼 Google 首席 AI 架构师 Koray Kavukcuoglu 在公告中表示:“要安全地发布这一水平的前沿能力,需要分阶段推进。”Google 正在参与美国政府自愿性质的发布前模型访问流程,并计划根据早期测试者的反馈完善防护措施,再逐步扩展到开发者、企业和消费者。全面开放将从付费 API 客户和 Google AI Ultra 订阅用户开始。
Argon 已经在 Google 内部投入工作。据 Google 介绍,数千名员工认可该模型在专门编程任务、深度研究和写作质量方面的优势。量子计算研究人员用 Argon 降低了制约重要应用的子程序的时空资源(量子比特数与门数的乘积),在一个案例中,它在几分钟内就比已公开的基准提升了 40%。一组 Argon 智能体分析了 Google 数据中心全集群的性能剖析遥测数据,自主发现并实施内存优化,部署后释放了超过 300TiB 内存。公司估计总节省规模为 500TiB 至 1PiB。
代码迁移的规模同样庞大。Argon 智能体正在把 Google 各处的 C/C++ 代码迁移到 Rust,范围从 re2、libgav1 等核心库的数万行扩展到 Fuchsia Zircon 内核的 80 万行以上。在 Google 的开源视频解码软件 libgav1 中,智能体替换了现有 Rust 移植版中的 3.2 万行 SIMD 代码。它们多轮运行基于性能剖析的实验并研究编译器输出,生成编译器可以自动向量化的安全 Rust 代码,最终得到的内存安全解码器比原 Rust 移植版快 2.7 倍,视频输出完全一致。Google 补充说,这类大规模重写在进入生产环境之前要经过自动与人工审计、仿真测试和审查。
为支撑长任务,模型设计也有所调整。Google 将 Argon 的输出 token 上限从此前的 6.4 万(64K)提高到 100 万(1M)。公司表示,让模型在单条执行轨迹中有余地深入思考并生成数十万 token,可以一次性解决难题。
在 Google 公布的对比表中,Argon 在衡量长周期软件工程任务的 DeepSWE v1.1 上取得 77.9%。同一张表中,GPT-6 Astra 为 74.1%,Claude Opus 5.5 为 74.2%,Claude Fable 5.1 为 67.4%。在按美国 GDP 贡献加权金融、编程、法律和税务工作的 Vals Index 上,Argon 以 68.9% 位居第一;在 Zapier 的业务自动化基准 AutomationBench 上取得 51.3%,领先 Claude Opus 5.5(42.5%)和 GPT-6 Astra(41.4%)。在 Harvey 的法律智能体基准上,它取得 19.6%,与其余三个模型的个位数成绩差距明显;在衡量长视频理解的 LVBench 上为 91.7%。
同一张表也列出了 Argon 未能排名第一的项目。在 FrontierSWE v2 上,GPT-6 Astra 以 65.5% 领先 Argon 的 55.0%;在 Terminal-bench 4.0 上,Claude Opus 5.5 以 66.4% 最高,Argon 为 57.4%。PostTrainBench、Terminal-Bench Science 0.1 和 OSWorld-2.0 也由其他模型位居榜首。

网络安全决定了这款模型的发布路径。Google 训练 Argon 自主发现、验证并修补关键软件漏洞,并以关闭网络安全防护限制的状态提供给受信任的防御者和内部团队。安全公司 Wiz 正在其免费保护关键公共基础设施的 Scan for Good 项目中使用 Argon。据 Google 介绍,Argon 在全球医院使用的医疗软件中发现了一个会暴露敏感个人信息的严重漏洞,这是此前前沿模型都未能发现的风险。在衡量漏洞修复能力的 CWE-bench v1 上,Argon 以 68% 与 Grok 4.7、GPT-6 Astra 并列第一;在 Google 内部漏洞基准上,它在涵盖 20 种编程语言的代码中发现了多种暴露问题。
Fairwind Program 是 Google 向政府和受信任合作伙伴有限开放网络防御工具的渠道。据报道,该项目于 9 月 2 日启动,全球有 650 多家合作伙伴参与,首个提供的工具是 Gemini 3.8 Flash Cyber 与 CodeMender 框架的组合。METAL 曾报道 Google 通过 Fairwind Program 向政府和企业开放网络防御 AI。大约一个月后,Argon 成为首个进入这一渠道的前沿模型。

Google 表示,在广泛开放之前,正在从四个方面加强安全措施。第一是滥用防御。模型被设计为拒绝网络攻击以及化学、生物、放射性和核(CBRN)攻击请求,同时保留正当的两用科学研究,Google 还改进了监测模型内部激活以发现滥用的技术。第二是间接提示注入防御,Google 称 Argon 在 Gray Swan 的间接提示注入基准上表现出最高的稳健性。第三是失准监控。系统会监视 Argon 的思维链和行为,一旦超出用户意图就停止执行。第四是系统加固,在高风险训练和评估开始前隔离并封闭沙箱环境。
失准监控在训练阶段也在运行。Google 解释说,类似的系统监控了训练过程并向专门的事件响应团队发送警报,同时注意不把监控结果反馈到训练中,以免模型的推理被塑造成规避监控的方向。Kavukcuoglu 表示:“我们强烈鼓励业界在能力不断增强的关键时刻保持推理的透明性。”其逻辑是,只有模型的思考保持可读,才能识别和诊断失准问题。
METAL 查阅的 Google 公告全文中没有全面开放的日期,只写明将“尽快”向开发者、企业和消费者提供。在对比表的领先分数之前,先确定的是谁先拿到模型,而 Google 把防御者而非攻击者排在了队伍最前面。前沿模型竞争的标准正在从性能排名转向发布顺序。
信息来源
- Google — Gemini 4 Argon: our next era of frontier intelligence →
- Google DeepMind (X) — Introducing Gemini 4 Argon – our new frontier model. →
- Unite.AI — Google Announces Gemini 4 Argon Frontier Model for Coding, Cyber Defense →
- Business Today — Gemini 4 Argon explained: Google's frontier AI model build for coding, finance, legal and more →





评论