ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

Gemini 3.6 Flash发布:官方力推“高效省本”,网友却直呼“不争气”

时间:2026-07-22 08:07:32来源:互联网编辑:快讯

谷歌近日一口气发布了三款Gemini系列新模型,本想借此扭转外界对其AI进展的质疑,却意外引发了更大范围的吐槽。网友们纷纷调侃,这些新模型非但没能证明谷歌的实力,反而让人觉得“自家兄弟的阿尔茨海默症更严重了”。

此次发布的三款模型分别是3.6 Flash、3.5 Flash-Lite和专攻网络安全的3.5 Flash Cyber。谷歌官方博客中,这些模型被描述为“更高效”“更聪明”“为大规模AI agent而生”,但实际体验却让不少人感到失望。3.6 Flash作为主打模型,被定位为“主力干活模型”,最大的卖点是节省token使用。根据Artificial Analysis Index的数据,3.6 Flash比前代3.5 Flash在输出token上减少了17%,在某些场景下甚至能节省65%。谷歌还声称,它在执行多步任务时推理步数和工具调用更少,成本也随之降低。输入价格为1.5美元/百万token,输出价格为7.5美元/百万token,比上一代的9美元有所下降。

在基准测试中,3.6 Flash的代码能力有所提升,DeepSWE从37%提升至49%,机器学习方向的MLE Bench从49.7%提升至63.9%。计算机操作能力也有进步,OSWorld-Verified从78.4%升至83%。知识工作方面,GDPval-AA v2从1349涨到1421。然而,尽管数据看似亮眼,但网友们并不买账。第三方评测机构Artificial Analysis指出,3.6 Flash的智能水平与3.5 Flash相比几乎没有提升,价格也没有便宜到足以忽略能力差距。

3.5 Flash-Lite的定位更低,主打“快”和“便宜”,适用于高吞吐、低延迟的任务,如agent搜索和文档处理。它是3.5系列中最快的模型,每秒可输出350个token,输入价格为0.3美元/百万token,输出价格为2.5美元/百万token。谷歌称其质量比3月发布的3.1 Flash-Lite有显著提升。3.5 Flash-Lite还支持调整“推理档位”,用户可以根据任务需求选择不同的思考强度。尽管如此,它在某些任务上的表现反而超过了更高级的3 Flash,例如在SWE-Bench Pro和OSWorld-Verified上得分更高。这一结果让不少人感到意外,甚至有网友认为,3.5 Flash-Lite成了3 Flash的“平替”。

3.5 Flash Cyber则是一款专门用于检测和修复代码安全漏洞的模型。谷歌的逻辑是,既然AI检测漏洞的速度已经超过现有系统修复漏洞的速度,不如用更便宜高效的Flash模型来批量处理。该模型基于3.5 Flash微调而成,搭配自家的CodeMender工具使用。然而,这款模型目前仅对“可信合作伙伴”限量开放,走内测路线,普通用户暂时无法使用。谷歌此举被认为是为了防止模型被滥用,同时也为一线防守方争取修复漏洞的时间。

尽管谷歌发布了三款新模型,但外界更关注的旗舰模型3.5 Pro却迟迟未见踪影。据彭博社等媒体报道,3.5 Pro的代码生成能力一直未能达到谷歌内部预期,甚至有传闻称谷歌推翻了原有训练方案,从头开始重训。谷歌AI宣传委员Logan Kilpatrick在舆论上直接跳过3.5 Pro,转而将重点放在Gemini 4上,声称已启动史上最雄心勃勃的预训练,进展令人兴奋。这一说法被不少人解读为转移视线、画饼续命。

网友们对新模型的吐槽声此起彼伏。有人认为,3.6 Flash在Artificial Analysis上的得分与3.5 Flash相同,甚至不如meta Spark 1.1、GLM-5.2等对手。网友Angel直言,Gemini 3.6 Flash的使用成本比GPT-5.6 Sol medium更高,但智能程度更低,性价比不如对手。实测派网友Balder则吐槽,三款新模型的性能全比3.5 Flash差,基础解码有问题,中文选词离谱,生成的图片视频质量差,还经常记忆混乱、调用错误工具。网友Conor Dart用Google自家的Antigravity测试AI生成游戏,结果发现木头纹理更差,大理石效果仍不可用,直言这是一次翻车。

谷歌此次发布新模型,本想证明自己在AI领域的实力,却意外引发了更多质疑。一边是官方宣传的“更高效、更便宜、更省token”,一边是网友们的当场差评,再加上旗舰模型跳票、大牛出走、市值缩水等一连串问题,让人不禁怀疑谷歌是否点歪了科技树,光顾着省成本忘了提智商。随着Gemini 4预训练的启动,谷歌能否扭转局面,仍需时间验证。

更多热门内容