涨幅集中在编码与 agent
按谷歌自己公布的数字,FrontierCode 1.1 Main 从 34.4% 到 43.6%,DeepSWE v1.1 从 49.0% 到 65.3%,AutomationBench 从 17.0% 到 30.4%,Arena.ai 的 WebDev Elo 从 1538 升到 1588。谷歌把提升归因于多步规划与工具调用两处改进,指向的是一次过写对代码、以及跑得完多步流程的 agent 场景。模型已在 Gemini API 正式可用,AI Studio 与 Antigravity 也能调到。
便宜是真的,但要看有效期
首发价每百万 token 输入 0.75 美元、输出 3.75 美元,上下文缓存 0.075 美元,均为 3.6 Flash 发布价的一半。这套价格只到 2026 年 12 月 31 日,之后翻倍到输入 1.50、输出 7.50。作为参照,谷歌自己的对比表里 Claude Sonnet 5 是 2.00 / 10.00、GPT-5.6 Terra 是 2.00 / 12.00。也就是说,年底前它在这个能力档位里价格优势明显,年后差距会收窄到不到一半——按这个价位做长期预算的团队要把翻倍写进模型。
别只看头条数字
同一批官方数据里也有它落后的地方:Terminal-bench 2.1 上 Gemini 3.7 Flash 是 85.8%,GPT-5.6 Terra 87.4%,后者在 Terminal-bench 3.0 与 OSWorld-2.0 上同样领先;Agent's Last Exam 上 Claude Sonnet 5 以 33.3% 对 26.3% 胜出。另有报道指出,五项头条提升里有三项来自 AI 公司自己跑的评测而非独立第三方。合理的读法是:这是一次让中档价位在编码和 agent 上更能打的更新,而不是把更贵的对手整体顶掉。另外谷歌这次没给 Gemini 3.5 Pro 的发布时间,3.7 Flash 抢在 Pro 之前落地。
via: 谷歌官方公告《Gemini 3.7 Flash: our most intelligent workhorse model》、The Decoder 报道、VentureBeat 报道;核实于 2026-08-15