出品 | 网易智能

作者 | 小小

编辑 | 王凤枝

谷歌AI部门最近几个月的日子不太好过。

新旗舰Gemini 3.5 Pro原定6月发布,到7月下旬仍未上线。与此同时,OpenAI、Anthropic和中国创业公司的新模型一款接一款,把谷歌挤出了多个主流榜单的第一梯队。因为差距明显,Gemini甚至被一些中文网友戏称为"美国豆包"。

7月22日凌晨,谷歌一口气发布了三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber,主打更低成本、更快速度和更高效率。


其中,3.6 Flash的输出token消耗比前代减少17%,部分工程任务中最多可减少65%;Flash-Lite每秒可生成350个token;Flash Cyber则专门用于发现和修复代码漏洞。

但外界真正等的Gemini 3.5 Pro,依然没有出现。 谷歌只表示,这款旗舰模型仍在与合作伙伴测试。

马斯克随后在X上发梗图调侃:xAI、OpenAI、Anthropic轮番发布"全球最强模型",终于轮到谷歌时,交出的却是几款主打省钱的Flash模型。

风水轮流转,这次似乎偏偏没转到谷歌家。

这既像一次务实调整,也像一次被迫防守:最强模型暂时交不出来,就先靠价格、速度和生态守住开发者。

01 "省钱"是一门新绝活,但真能打动开发者吗?

这次更新,谷歌把"省钱省资源"当作了最大的亮点。

在AI模型的商业应用里,token就相当于计费单位,模型输出的token越多,开发者要付的钱就越多。如果能在保持能力不降的前提下,让模型更"精炼",对大规模运行AI工作负载的企业来说,节省的成本相当可观。

新推出的Gemini 3.6 Flash被定位为绝对主力,它在设计上就瞄准了"如何用更少输出token、推理步骤和工具调用完成任务"。

谷歌官方博客引用第三方测评机构Artificial Analysis Index的数据显示,Gemini 3.6 Flash在输出时消耗的token数量比上一代Gemini 3.5 Flash平均减少了17%。

在Datacurve的DeepSWE这类长周期、多步骤的工程任务基准测试中,谷歌甚至观察到了最多65% 的token节省。

价格也随之下调,每百万输入token为1.50美元,输出为7.50美元。

一同发布的Gemini 3.5 Flash-Lite则将"极致性价比"推向了新高度。它是谷歌Gemini 3.5系列中最快、最省钱的模型。

根据Artificial Analysis实测,它每秒能生成350个输出token,速度大约是上一代Gemini 3.1 Flash-Lite的两倍。价格更是探到了每百万输入token 0.30美元、输出2.50美元,仅为GPT-5.4 mini的三分之一。

谷歌显然希望用这款模型来承接那些对延迟极其敏感、需要高吞吐量的任务,比如大规模文档处理、智能体搜索、收据翻译和摘要这类工作。

第三款模型Gemini 3.5 Flash Cyber则走了专业路线。它基于Gemini 3.5 Flash微调,专门用来发现和修复网络安全漏洞。

在流行的网络安全基准测试CyberGym上,这款模型达到了与Anthropic Mythos等前沿网络安全模型接近的性能水平。

据谷歌透露,在内部测试中,该模型在名为V8 JavaScript Engine的复杂开源代码里发现了55个问题,其中包括10个此前未被其他模型发现的漏洞。

从分发渠道来看,Gemini 3.6 Flash和Gemini 3.5 Flash-Lite自今天起就通过Google AI Studio、Android Studio中的Gemini API向开发者开放,Gemini 3.6 Flash也可以在Google Antigravity中使用。

企业用户可以通过Gemini Enterprise Agent Platform获取,普通消费者则能在Gemini应用里体验这些模型,Gemini 3.5 Flash-Lite也正在谷歌搜索中逐步推出。

然而,价格牌能否真正打动开发者,还得看模型的实际表现。谷歌目前展示的主要竞争力集中在效率和价格上,而非能力领先。

科技博主 @reight_s评论说:"谷歌正在输掉AI智能竞赛,但悄无声息地赢得了廉价竞赛。"他进一步指出,在大家等一个煮不熟的旗舰产品时,谷歌似乎已经将重心转向了降低成本的策略。


但这引发了另一个问题:如果模型本身不够聪明,再便宜又有什么用?

02跑分里的"尴尬":赢了自己却输给了对手

在谷歌给出的官方基准测试成绩单上,Gemini 3.6 Flash相比前代模型确实有着肉眼可见的提升。

在反映计算机操作能力的OSWorld-Verified测试中,得分从78.4% 提升到了83.0%,这是所有对比模型中的最高分,甚至高于OpenAI的GPT-5.6 Luna和xAI的Grok 4.5。

在衡量机器学习研究能力的MLE Bench上,Gemini 3.6 Flash得分从49.7% 跃升至63.9%。在DeepSWE基准测试中,得分从37% 提升至49%。

处理知识型工作的GDPval-AA v2中,这款模型得分也从1349提高到了1421。在SWE-Bench Pro上,它取得了58.7% 的成绩,高于前代的55.1%。

在需要处理100万token长上下文的测试中,Gemini 3.6 Flash得分达到54.0%,而前代模型连27% 都达不到。

Gemini 3.5 Flash-Lite同样有一些亮点。谷歌的资料显示,这款"Lite"模型在SWE-Bench Pro、OSWorld-Verified等几项关键评估中甚至优于标准版的Gemini 3 Flash。

在终端基准测试Terminal-Bench 2.1上,它从3.1 Flash-Lite时代的31% 跃升至54%。在现实世界任务执行测试GDPval-AA v2上,Gemini 3.5 Flash-Lite的得分也从642提升至1140。

这意味着,即使是谷歌产品线里最便宜的模型,在某些方面也已经具备了过去中端模型的水平。

然而,如果我们把视线从谷歌自家的纵向对比移开,看看横向竞争,情况就不那么乐观了。

科技媒体TechCrunch注意到,自2月份谷歌上次更新旗舰模型以来,OpenAI已经发布了GPT-5.5并开始推出GPT-5.6,Anthropic则推出了Claude Opus 4.8、Claude Sonnet 5,并扩大了其网络安全前沿模型Fable 5的访问权限。

中国公司也没有闲着,月之暗面的Kimi K3吸引了大量需求以至于限制了新订阅,阿里巴巴的Qwen3.8-Max-Preview也刚刚上线。

根据Artificial Analysis的综合排名,谷歌在新模型发布前,甚至没有一款模型能挤进前十。

网友 @synthwavedd尖锐地指出,Gemini 3.6 Flash在Artificial Analysis上的综合得分和Gemini 3.5 Flash完全相同,远远落后于Meta Muse Spark 1.1、智谱GLM-5.2、OpenAI GPT-5.6 Luna、Anthropic Claude Sonnet 5以及xAI Grok 4.5等一长串对手。

谷歌自己的测试数据非常亮眼,而第三方综合评分却原地踏步,这看似矛盾,其实原因并不复杂。

谷歌选择展示的OSWorld-Verified、MLE Bench、DeepSWE等测试,恰好是Gemini 3.6 Flash重点优化的方向,进步自然明显。但Artificial Analysis的综合指数覆盖维度更广,包括推理能力、事实准确率等多项指标,权重分配也不同。

Gemini 3.6 Flash在谷歌强调的几个赛道上跑出了加速度,放到更全面的竞技场上,整体排名并没有实质变化。

正如AI分析师 @Teksart所言,Gemini 3.6 Flash给人的感觉是"谷歌优化了效率,而不是能力"。

"Gemini 3.6 Flash运行成本更低,但没有更聪明。这感觉像是Gemini 4处于预训练阶段时的占位发布。谷歌需要提醒大家它在模型战争中依然存在。它成功了,但没有改变排行榜。"


03实测反馈:速度快了,但输出质量没有跟上

跑分之外,部分早期用户也分享了明显负面的上手体验。

一位名为 @LuminaXspace的用户详细记录了他用Gemini 3.6 Flash构建3D金门大桥的失败经历。

据他描述,这个过程堪称灾难:他不得不重复提示三次,因为模型反复忽略指令。

第一次,它没有按要求创建 .html文件,而是试图在Gemini应用内部用模拟方式来完成任务;第二次,它开始从网上找图片贴到聊天里,而不是真正生成文件;直到第三次才勉强完成,但最终输出质量惨不忍睹。

更让他沮丧的是,这个结果竟然比5个月前发布的、如今已跌出前十的Gemini 3.1 Pro还要差得多。后来他换用Antigravity平台再次测试,结果同样令人失望。他最后的结论是等待Gemini 3.5 Pro或Gemini 6 Pro发布再尝试。

另一名用户Da7em的体验更让人哭笑不得。他给Gemini 3.6 Flash布置了一个中等规模的任务,本以为会花合理的时间来处理,结果模型两分钟就跑完了。

他一开始还惊叹于这个速度,"然后我看到了结果。一个本地的4B模型都能比它做得更好。谷歌人难道没有羞耻心吗?"

速度快当然好,但如果生成的内容连本地小参数模型都比不上,那这种速度就毫无意义。

在编码基准测试方面,网友Ejaaz抛出了两个让谷歌脸上挂不住的参照物:一个是月之暗面出品的Kimi K3,另一个是智谱的GLM 5.2。这两个模型背后实验室的资金规模跟谷歌完全不在一个量级。

月之暗面的估值仅为300亿美元,而谷歌的市值高达4.5万亿美元,两者的差距达到150倍。 用Ejaaz的原话就是:"无限资本只买来了中规中矩的结果。"

普通开发者的吐槽还显得有些零散,前谷歌Apps产品负责人、现任Abacus.AI联合创始人兼CEO宾度·雷迪(Bindu Reddy)的评论更具分量。

她曾亲历谷歌内部的产品体系建设,如今以创业者的身份站在使用者的角度,对谷歌AI产品线做了一次从头到脚的审视。

她先从开发者最常用的文本模型说起。她承认Flash拿来聊天还行,但一旦进入智能体循环(Agentic Loop)场景,它的表现就被Grok甩开了,哪怕是执行简单的任务也不例外。

接着她把矛头指向了Pro系列:这款本该撑门面的旗舰早已名不副实,只是一个停留在过去的老旧模型,跟当下前沿竞品之间隔着一个代际的差距。

随后,雷迪把话题延伸到了其他产品线。视频生成工具Veo太贵,性价比不及竞争对手SeeDance;图像模型NanoBanana Pro则被GPT的图像生成明显甩开。至于这次主打速度和低价的Flash Lite,她认为延迟问题让"低价"的优势打了折。

最后,雷迪总结道:"谷歌没有针对核心工作负载的领先AI模型。即使是在谷歌相对拿手的聊天功能上,Grok和GPT Luna也做得相当不错,而且在遵循用户指令方面还更胜一筹。"

这番评价等于将谷歌在图像、视频、智能体等多个维度的产品都判定为落后于竞争对手。

当然,也有站在长期视角上看好谷歌的声音。有投资者提醒市场注意一个基本事实:人们现在用疯狂的倍数给Anthropic和OpenAI估值,基于的是每年200到400亿美元的收入预期,而谷歌今年有望实现4800亿美元的收入,完全不在一个数量级。定制芯片、分发网络和生态系统构成的护城河,让"落后"看起来更像是暂时的。

另一种声音则搬出"马拉松而非短跑"的老话:现在最聪明的模型不等于第一个到达AGI的模型,去年Gemini也曾是顶尖,Claude曾经排名落后,真正决定胜负的,是拥有坚实基础和垂直技术栈的公司。

04失约的旗舰:Gemini 3.5 Pro去哪了?

在这场新品发布会上,最引人注目的"主角"反而不是任何一款新模型,而是一款没出现的模型,Gemini 3.5 Pro。

谷歌在5月份发布Gemini 3.5 Flash时曾高调预告,更强的Pro版本已在内部使用,预计6月推出。然而到了7月下旬,谷歌技术主管洛根·基尔帕特里克(Logan Kilpatrick)在X上给出模糊回应:"正在与合作伙伴测试,准备就绪后立即推出"。

Business Insider在6月就曾报道,谷歌已将Gemini 3.5 Pro的目标发布日期推迟至7月。彭博社随后报道称,该模型可能已被进一步推迟,原因是难以达到内部性能目标。

这些报道勾勒出一个尴尬的现实:谷歌自己的旗舰产品,可能尚未达到内部性能目标。

在预测市场Polymarket上,交易者给出了90%的概率,认为Gemini 3.5 Pro不会在7月发布。

网友 @goodworse基于已经泄露信息的评论说:"这个模型将比Mythos还要差,而Mythos是在4个月前发布的。AI时间线进展如此之快,以至于4个月的延迟感觉像是一年。"

他总结道,谷歌去年拥有一切成为最好的条件,但他们把一切都搞砸了。


更尖锐的评论来自知名报料人"草莓哥(X用户 @iruletheworldmo)"。

他用一种讽刺口吻描述了当前局面:谷歌把自己最好的计算资源都给了Anthropic,人家拿这些资源训练出了Fable,反手就把谷歌的Gemini 3.5 Pro碾压了,所以谷歌只好含糊地谈论一个"雄心勃勃"的新预训练计划。

这段话虽然刻薄,但它反映的是社交媒体上一种普遍情绪,作为云服务商,谷歌在向其他AI公司提供算力,而自家模型的发布却一再延期。

CNBC在报道中也提到了一个客观事实:谷歌云与Anthropic签有数十亿美元的芯片交易。只是,云服务收入和内部研发所用的GPU通常是不同的资源池,两者之间是否存在直接竞争关系,目前并没有公开信息能够证实。

05有钱、有人、有数据,谷歌为何还跑得这么慢?

6月18日,Gemini联合负责人诺姆·沙泽尔(Noam Shazeer)宣布离开谷歌加入OpenAI。第二天,DeepMind关键高管、2024年诺贝尔化学奖得主约翰·贾珀(John Jumper)也宣布离开,去向是Anthropic。前后脚出走的两位核心人物,是谷歌AI部门这一年最直白的裁决。对于一家正处于追赶期的公司来说,核心人才的离开不仅是面子问题,更意味着项目的主导权和技术判断力出现真空。

而人才只是问题的一面。另一个被反复提及的现象是,谷歌同时在推进的项目实在太多了,Gemini文本模型、Omni多模态模型、Nano Banana图像模型、Genie世界模型……每多一个项目,就多一个分流人才和算力的口子。

问题或许不在于算力够不够,而在于组织注意力被摊薄了。当竞争对手把所有精力都压在单一旗舰模型上时,谷歌的精力却被分散到了近十个不同的战场上。这种注意力和决策速度上的分散,有时比算力不足更难弥补。

资本市场的耐心也在被消耗。

路透社指出,Alphabet在4月份将2026年资本支出指引提高至1800亿至1900亿美元,还通过股权发行筹集了约850亿美元。投入如此巨大,投资者自然紧盯着回报。

Aptus Capital Advisors的投资组合经理戴夫·瓦格纳(Dave Wagner)表示,谷歌正在错失AI编码这个赛道的机会,这种担忧在投资者中相当普遍,而且日益加重。在他看来,谷歌目前的战略核心是押注生态系统的整体优势,而非在单项能力上争高下。

不过,市场对这套"生态系统"故事的耐心正在受到考验。自4月下旬谷歌公布云销售数据以来,Alphabet的股价已累计下跌约9%,同期表现落后于其他科技巨头。投资者显然不再满足于远期愿景,他们更想看到的是模型能力上实打实的追赶。

来自中国公司的竞争压力也在加剧。不少开发者在讨论中都提到同一个困惑:为什么资金只有谷歌零头的实验室能做出更强的模型?

月之暗面的Kimi K3就是一个典型例子,估值300亿美元,是谷歌的1/150,编码能力却更胜一筹。这种反差让谷歌的技术实力受到了前所未有的质疑。

在这种压力之下,一个越来越明显的行业现象是,"最强模型"的称号正在以周为单位轮换。

马斯克今天在X上发过一张梗图,精确地概括了当下的竞争生态:无论哪家发布新模型,无一例外都会打出"推出全球最强大模型"的标语。

xAI发布Grok新版本,声称全球最强;谷歌紧接着发布Gemini新版本,反超并宣称全球最强;Anthropic随即推出Claude,登顶SOTA;OpenAI不甘落后发布新模型,再次抢回宝座。

如此循环往复,霸榜周期往往只有几个月甚至几周。

这张图的调侃核心在于,只要等上几个星期,轮盘就会转到下一个厂商发布"史上最强AI"。

正是在这种"轮流坐庄"的节奏里,谷歌目前的位置显得有些尴尬。近几个月,它始终没有重新站上综合能力榜单的头部位置,上一次有竞争力的文本模型还要追溯到2025年11月的Gemini 3。

3.6 Flash主打省钱高效,可以理解为谷歌在用价格和效率换取时间,为后续旗舰模型争取窗口。 但问题在于,当所有对手都在用"全球最强"的旗号抢夺开发者注意力时,一味强调"便宜"能否真正守住阵地,恐怕连谷歌自己也没有十足把握。

面对内外交困的局面,谷歌似乎也在进行战略调整。

就在外界对Gemini 3.5 Pro议论纷纷之际,谷歌DeepMind产品技术主管洛根·基尔帕特里克(Logan Kilpatrick)确认,团队已经启动了"迄今为止最雄心勃勃的预训练工作",即下一代基础模型Gemini 4。

CNBC还报道,谷歌正在开发一种专为运行Gemini而设计的专用芯片,效率最高可提升10倍。谷歌云发言人对此回应称,团队一直在做各种创新尝试来提升性能和效率,虽然不保证每个项目都能落地,但持续探索本身就是公司"全栈方法"的核心。

大模型测评专家 @kimmonismus对Gemini 4的启动给出了一个耐人寻味的评论:想必是3.5 Pro的进展令人失望,所以他们直接启动了一个新的预训练计划。但他也提醒,谷歌拥有全世界的数据和海量计算资源,如果到现在还没领先,那换个"预训练程序"恐怕也不是关键。

谷歌这次证明了自己仍能把AI做得更快、更便宜。但市场等的不是又一款省钱模型。

3.6 Flash可以帮助谷歌守住阵地。

真正决定它还能不能反攻的,仍然是迟迟没有出现的Gemini 3.5 Pro,以及更远处的Gemini 4。