dev.to #ai新闻
Google发布Gemini 4 Argon:性能登顶但暂不开放,防御者优先获取
Google DeepMind于2026年9月30日发布前沿模型Gemini 4 Argon,这是自Gemini 3.1 Pro以来首个非Flash类大模型。该模型在18项基准测试中击败GPT-6 Astra和Claude Opus 5.5,取得13项第一,支持单次调用百万token,成本仅为竞品一半。目前仅向网络安全防御者开放访问,普通用户尚不可用。
一句话总结:谷歌近一年来推出的首款前沿模型在大多数基准测试中名列前茅,单次调用可生成百万级token,成本仅为Claude Opus 5.5的一半——但你无法使用它。网络安全防御者率先获得访问权限。
2026年9月30日,Google DeepMind发布了Gemini 4 Argon——这是自去年11月Gemini 3.1 Pro以来其推出的首款全新前沿模型,也是大约七个月内首款非Flash级别的模型。数据亮眼:在与GPT-6 Astra和Claude Opus 5.5的对比中(据VentureBeat统计),Argon在18项基准测试中的13项排名第一;输出预算提升了15.6倍;入门定价恰好是Claude Opus 5.5的一半。
几乎没人能接触到它。Argon首先向Google“Fairwind”计划中经过审核的网络安全防御者开放。付费API客户和Google AI Ultra订阅用户被列为“下一批”——但并未公布具体日期。
这种“先防御者,后其他人”的顺序才是真正的看点。让我来拆解Argon究竟是什么,这些数字实际意味着什么,以及为什么发布节奏比排行榜更重要。
ELI5:什么是“前沿模型”发布,为什么要先从黑客的对手开始?
可以将前沿模型想象成一种新型超级计算机设计。当它确实比此前存在的模型更具能力时,同时存在两个事实:
- 它能完成更多有益的工作——编写更大的代码库、完成更长的研究报告、更好地保护网络。
- 它也能造成更多危害——发现你代码中漏洞的能力,同样能发现他人代码中的漏洞。
历史上,实验室通常在发布后进行红队测试并制定使用政策。谷歌通过Argon采取的做法不同:防御者在攻击者甚至不了解其形态之前就已获得该模型。网络安全团队之所以获得优先访问权,是因为Argon的主要用例是发现和修复软件漏洞——谷歌报告称其在CWE-bench v1上得分68%(与GPT-6 Astra持平),而在Gray Swan提示注入套件中,攻击者的成功率创下最佳记录,仅为0.7%。
美国政府也通过自愿预发布访问流程提前介入。数千名谷歌员工已在内部使用Argon进行编码、研究和写作——其中一个内部案例显示,在优化量子计算子程序时,Argon的表现比已发布的基线高出40%。

Argon的分阶段 rollout:先面向防御者,后面向开发者。来源:Google,2026年9月30日。
工作原理:底层究竟发生了什么变化
谷歌几乎未披露任何关于架构或参数数量的信息。我们所知如下:
- 具备扩展思考能力的推理模型。Argon并非更大号的自动补全工具——它是为长时间、多步骤工作而设计的:软件工程、法律与金融知识工作、网络安全。在这三个领域中,任务耗时以小时计,而非秒。
- 100万输入token,100万输出token。输入上下文如今已是标配;输出的跃升才是真正新闻。此前的Gemini模型将输出限制在约64K token。Argon可在单次调用中生成多达约100万token——相当于约3,000页文本,或在不中断的情况下完整重写一个中型代码库。
- 输出预算改变了智能体的运算逻辑。能够在一次生成中容纳其全部计划和全部交付成果的智能体,无需分块、恢复和重新 grounding。往返次数更少,上下文腐烂的机会也更少。这正是下方基准测试表现背后所押注的能力。

输出上限:从64K提升至1M token。按每token约0.75个词计算,每次调用约为190页 vs 3,000页。
基准测试快照(请带着保留意见阅读)
谷歌报告数据,2026年9月30日:

谷歌报告的分数。竞争对手的比较分数来自提供商/公共排行榜来源,并非相同的测试设置。
- DeepSWE v1.1(长周期软件工程):77.9% — 排名第1,领先Opus 5.5(74.2%)和GPT-6 Astra(74.1%)几个百分点
- AutomationBench(端到端业务流程):51.3% — 排名第1,对比Opus 5.5的42.5%、Astra的41.4%
- Harvey Legal Agent(法律研究与起草):19.6% — 排名第1,对比Astra的5.4%和Opus 5.5的3.8%。在专业工作而非智力谜题上,差距约为4-5倍。
- FrontierSWE V2:55%,排名第1。LAB-Bench 2:88.8%,排名第1。LVBench(长视频理解):91.7%,排名第1。
- Vals Finance Agent:65.4%,领先约7个百分点。Vals Index(按美国GDP份额加权涵盖金融/编程/法律/税务):68.9%。
- Gray Swan(提示注入鲁棒性):0.7%的攻击成功率 — 目前最佳报告成绩。
- Artificial Analysis Intelligence Index:53 — 与GPT-6 Astra持平(最高分),比GPT-6.1 Sol高出一分。值得注意的是,AA还记录了Terminal-Bench 4的成绩为57% — 相比Gemini 3.1 Pro Preview实现了53个点的飞跃,但仍落后于Sonnet 5.5(最高分,64%)、Opus 5.5(最高分,60%)和Astra(59%)。代理式编码的王冠争夺战仍在继续。
诚实的保留意见:彭博社报道(通过匿名消息源称),一些谷歌员工认为内部性能不足;谷歌对此予以否认。此外,谷歌自身的方法论说明指出,部分Argon的得分是内部计算的,而竞争对手的得分来自提供商或公共排行榜——因此请将这些差距视为方向性的参考,而非绝对真理。还需注意:在Harvey等专业基准上的绝对得分(19.6%)从绝对数值来看仍然很低。“最佳”和“良好”是两个不同的概念。
前沿状态:发布背后的模式
关于Argon的三点观察描述了行业的走向,而不仅仅是谷歌的位置:
- 旗舰价格现在就是主力价格。入门级API定价为每百万输入/输出令牌2美元/10美元(缓存输入价格为0.10美元 — 折扣95%),随后恢复至4美元/20美元。这相当于Claude Opus 5.5的$4/$20的一半,也是GPT-6 Astra定价的五分之一。以中端价格推出前沿模型并非出于慷慨——这是九月的模式:Opus 5.5本身相比Opus 5就削减了20%的输入/输出价格和60%的缓存读取价格。前沿模型正在被重新定价为一种规模业务。

$/百万令牌,输入+输出。Argon的入门费率低于榜单上所有前沿竞争对手。
- 分阶段发布正成为实现真正能力跃升的默认策略。优先面向防御者并非营销话术;而是行业意识到,擅长发现漏洞的模型在第一天就具有双重用途属性。预计更多发布将始于审核墙之后。
- 基准测试的战场已转向专业工作。最大的优势不在推理谜题上——而是在Harvey(法律)、Vals Finance、AutomationBench上。各大实验室已经明白,企业买家不买Elo评分;他们买的是“能否完成工作流程”。Argon的基准测试表读起来像是一份针对律师事务所和银行的推销演示文稿,这是刻意为之。
要点总结
- Gemini 4 Argon(2026年9月30日宣布)是谷歌约一年来首款新前沿模型:支持1M输入/1M输出令牌,具备扩展推理能力,旨在服务于软件工程、知识工作和网络防御。
- 在与GPT-6 Astra和Claude Opus 5.5的对比中(基于厂商报告的数据;方法论保留意见适用),它在18-19项基准测试中的约13-14项上领先或持平,其中在专业代理基准测试上的差距最大。
- 入门级定价为每百万令牌2美元/10美元(缓存输入享受95%折扣)— 相当于Opus 5.5的一半,GPT-6 Astra的五分之一。
- 你目前还无法使用它:首先面向Fairwind网络防御者,其次是美国政府预发布,然后是付费API和AI Ultra。优先面向防御者的发布模式已成为双重用途能力的新常态。
- 悬而未决的问题:究竟是内部异议报告(谷歌对此存在争议)还是公开基准测试更能准确描述该模型。独立的复现结果将最终定论——一旦Fairwind之外的人获得访问权限。
来源:Google DeepMind 公告(2026 年 9 月 30 日);llm-releases.com 追踪器;Artificial Analysis;TechCrunch、VentureBeat、Axios/Bloomberg、MorningTick、DEV、AlexTech、Digest AI 等媒体报道。所有基准测试和定价数据均由厂商或第三方报告,发布时未经过独立复现验证。
建议标签:AI、LLMs、机器学习、Google、科技新闻
配套笔记本:本文的可运行教程——在此下载(在 Colab/Jupyter 中打开)。
译文已达到本站中文翻译的字数上限,剩余内容请查看原文。