Gemini 3.7 Flash 上线:编码分明显上台阶,首发价只有上一代的一半——但限时到年底

谷歌 8 月 13 日发布 Gemini 3.7 Flash,距上一代 3.6 Flash 只隔三周。官方给的编码成绩 FrontierCode 1.1 Main 从 34.4% 升到 43.6%、DeepSWE v1.1 从 49.0% 升到 65.3%;首发价每百万 token 输入 0.75 美元、输出 3.75 美元,是 3.6 Flash 发布价的一半,但只维持到 2026 年 12 月 31 日,之后翻倍。

涨幅集中在编码与 agent

按谷歌自己公布的数字,FrontierCode 1.1 Main 从 34.4% 到 43.6%,DeepSWE v1.1 从 49.0% 到 65.3%,AutomationBench 从 17.0% 到 30.4%,Arena.ai 的 WebDev Elo 从 1538 升到 1588。谷歌把提升归因于多步规划与工具调用两处改进,指向的是一次过写对代码、以及跑得完多步流程的 agent 场景。模型已在 Gemini API 正式可用,AI Studio 与 Antigravity 也能调到。

便宜是真的,但要看有效期

首发价每百万 token 输入 0.75 美元、输出 3.75 美元,上下文缓存 0.075 美元,均为 3.6 Flash 发布价的一半。这套价格只到 2026 年 12 月 31 日,之后翻倍到输入 1.50、输出 7.50。作为参照,谷歌自己的对比表里 Claude Sonnet 5 是 2.00 / 10.00、GPT-5.6 Terra 是 2.00 / 12.00。也就是说,年底前它在这个能力档位里价格优势明显,年后差距会收窄到不到一半——按这个价位做长期预算的团队要把翻倍写进模型。

别只看头条数字

同一批官方数据里也有它落后的地方:Terminal-bench 2.1 上 Gemini 3.7 Flash 是 85.8%,GPT-5.6 Terra 87.4%,后者在 Terminal-bench 3.0 与 OSWorld-2.0 上同样领先;Agent's Last Exam 上 Claude Sonnet 5 以 33.3% 对 26.3% 胜出。另有报道指出,五项头条提升里有三项来自 AI 公司自己跑的评测而非独立第三方。合理的读法是:这是一次让中档价位在编码和 agent 上更能打的更新,而不是把更贵的对手整体顶掉。另外谷歌这次没给 Gemini 3.5 Pro 的发布时间,3.7 Flash 抢在 Pro 之前落地。

via: 谷歌官方公告《Gemini 3.7 Flash: our most intelligent workhorse model》The Decoder 报道VentureBeat 报道;核实于 2026-08-15