Google 发布 Gemini 4 Argon:官方 18 项基准领先 12 项,但第一批只给网络安全防御方

Google 于 9 月 30 日发布新一代旗舰模型 Gemini 4 Argon,最大输出从 6.4 万 token 提到 100 万 token。首批只通过 Fairwind 计划开放给经过审核的网络安全防御方,开发者、企业和普通用户要等后续放开,付费 API 客户与 Google AI Ultra 订阅者优先。官方公布的 18 项基准里,Argon 单独领先 12 项、并列第一 1 项,DeepSWE v1.1 为 77.9%;但在 Terminal-Bench 4.0、FrontierSWE v2 等项目上仍落后 Claude Opus 5.5 或 GPT-6 Astra。上线初期价格为每百万 token 输入 2 美元、输出 10 美元,优惠期后回到 4 美元和 20 美元。

先给防御方,再给所有人

Gemini 4 Argon 是 Google DeepMind 在 9 月 30 日发布的新旗舰,官方定位是真实软件工程、法律金融类知识工作和网络安全防御。它最显眼的变化是单次输出上限从 6.4 万 token 提到 100 万 token,适合一次产出大规模代码迁移或长报告。

不过这次没有全面开放。首批用户只来自 Fairwind 计划:关键基础设施运营方、核心技术平台等防御机构经审核后才能使用,并须遵守仅限防御用途、强制抗钓鱼多因素认证、不得转售等条款。面向开发者、企业和普通用户的版本,官方只说「即将推出」,没有给出日期。

成绩单要分开看

按 Google 公布的 18 项基准,Argon 单独领先 12 项、并列 1 项:DeepSWE v1.1 77.9%(Opus 5.5 为 74.2%),Harvey 法律 agent 基准 19.6%,长视频理解 LVBench 91.7%。但 Terminal-Bench 4.0 落后 Opus 5.5 约 9 个百分点(57.4% 对 66.4%),FrontierSWE v2 落后 GPT-6 Astra 10.5 个百分点。第三方 Artificial Analysis 的智能指数给它 53 分,在该榜排第 8,说明官方领先面在中立测试里有所收窄。

影响判断

对大多数开发者来说,短期内还用不上。价格是值得记住的信号:优惠期 2/10 美元每百万 token,大约是 GPT-6 Astra 标价的五分之一;优惠结束后的 4/20 美元与 Opus 5.5 持平。等 API 放开后,终端操作类任务仍建议先和 Opus 5.5 对比实测,法律、金融长文档和长视频分析则值得优先试。

via: Google 官方博客、Fairwind 计划说明、VentureBeat 报道、Artificial Analysis 模型页