七月二十一日,谷歌终于祭出了自家的新大模型。
这回倒也没搞什么发布会或者直播,官方也就是发了个推,挂了个页面便草草收场。说实话这操作多少有点敷衍,毕竟咱们盼星星盼月亮等来的,本该是备受瞩目的 Gemini 3.5 Pro,结果送上门来的却是这三款轻量模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 以及 Gemini 3.5 Flash Cyber。
五月 I/O 开发者大会上明明亲口承诺过六月就要上旗舰 Pro 模型,如今都到七月末了,连个影子都没见着,这难道就是 AI 纪元里新出的“大记忆消失术”?
既然如此,那咱们只能看看这三款新模型到底表现几何了。
首先是这次主推的 3.6 Flash,谷歌对外宣称主打的是同成本下的效果提升。官方给的数据显示,3.6 Flash 的输出 Token 消耗相比前代降低了百分之十八。虽说这个幅度不算特别大,但意味着干活更利索了,至少不再那么啰嗦,能用最快路径搞定任务,省下来的也就是真金白银。
输出单价也跟着降了,从九美元砍到了七点五美元每百万 Token,反正只要能省钱,谷歌怎么来都行。在代码基准测试上,DeepSWE 指标从百分之三十七涨到了百分之四十九。毕竟代码生成需求激增,这方面的能力提升显然是贴合现实生产场景优化的重点。
单看纸面参数,似乎是一次均衡升级,可实测结果却有些不对劲。Artificial Analysis 的测试数据显示,3.6 Flash 的综合智能评分跟上一代 3.5 Flash 持平。本质上它只是优化了推理链路,底层理解能力没变,虽然算力消耗少了,但解决复杂问题的上限一点没涨。
翻译翻译就是:变便宜了,脑子没变聪明……
X 平台上也有用户实际分享了不同场景下的体验,只能说一言难尽了……说白了,这次 Gemini 的升级优化的不是智商,而是推理效率。它学会了少说废话、少走弯路,在完成简单任务时,确实消耗了更少的算力,更省钱。但若指望它搞定更复杂的事,比如长链条代码重构、复杂多模态创作或者深度逻辑推演,抱歉,表现还是跟以前一样拉胯。不谈智能光谈省钱,这明显就是伪命题啊……省 Token 是真省,笨也是真笨。简单批量任务用着划算,一旦涉及复杂逻辑,就得反复提示、多轮修正,看似单次便宜了,算下来总调用成本反而更高,离了大谱!
另一款 3.5 Flash-Lite,定位更加极致:便宜、快、吞吐量大。价格自然不用问,主打量大管饱,输入零点三美元、输出二点五美元每百万 Token,这价格算是直接干到了地板价。代价同样明显,模型能力被大幅裁剪,上下文深度和逻辑复杂度都砍了一刀,更适合干批量摘要、简单检索这类流水线粗活。不过,总归比 3.1 Flash-Lite 聪明那么一点点。实话说,我觉得这就是专门给海量标准化任务准备的“算力耗材”,跟“智能”两个字基本不沾边。
至于 3.5 Flash Cyber,这款模型其实跟普通用户没啥关系。它专为代码漏洞扫描微调,目前仅对政府和可信企业内测开放。谷歌在 AI 安全防范这块叙事上比较严谨,生怕这模型被用来挖掘攻击漏洞,所以严格锁死了准入门槛。看下来,3.5 Flash Cyber 更像是补足安全赛道的点缀产品,谈不上核心竞争力,也撑不起大众口碑。至于表现究竟如何?普通用户根本测不到。在知名的 CyberGym 基准上,官方表示属于具有竞争力的水平,咱们就当看个热闹吧。
所以,说了这么多,大家最关心的问题其实还是:还能等到 Gemini 3.5 Pro 吗?据彭博社等多家科技媒体报道,3.5 Pro 跳票的原因大概率是代码生成与智能体规划能力不达标。在企业付费场景中,代码生成和自主 Agent 是商业价值颇高的赛道,客户愿意为能独立完成工程重构、自动化运维的模型支付高额服务费。据说,在谷歌多轮内部测试中,3.5 Pro 在代码基准和长程工具调用上始终达不到内部及格线,即便迭代了多版训练数据集,提升幅度依旧远低于预期,最终只能跳票。这么一看,谷歌现在的处境挺棘手的,高端客户一直在流失,自家旗舰又迟迟交不出货,除了拿低价 Flash 模型守着中低端市场,好像也没别的办法。
谷歌这边,没准也是因为关注到舆论,发现大家都在抱怨旗舰跳票,官方工作人员顺势放了个消息:Gemini 4 已经启动了史上最大规模的预训练。这……谷歌你这浓眉大眼的,怎么也学会画饼了!当下的产品拿不出手,就用下一代的远期预期来安抚资本市场和用户。只能说,这种操作硅谷大厂玩得轻车熟路,但远水救不了近火,而且用多了,只会越来越消耗大家的信任。按道理说,谷歌做 AI 大模型,不该拉垮。它是 Transformer 的诞生地,是深度学习时代的王者,DeepMind 也曾做出过 AlphaGo 这种惊艳全世界的成果。没人会怀疑谷歌的技术底蕴,可一手好牌打成今天这样,旗舰跳票、人才流失、市场份额被蚕食,确实让人唏嘘。此前,网上还流传过 Anthropic 创始人说 Kimi 蒸馏了他们尚未开发完成的模型,成了大家的笑谈。实在不行,不如让 Gemini 直接蒸馏 Kimi K3 吧,这样起码模型表现能好点。毕竟 AI 时代,没有永远的王者,菜就是原罪。
这是一档深耕十余年的科技媒体,近千万读者的兴趣栖息地。我们每日跟踪科技、数码、AI、新能源及热点等重磅内容,专注于提供更新鲜、前沿、专业、发展的热点科技报道,欢迎关注 @科技狐!
















