Jay 发自 凹非寺
刚刚,Gemini 3.8 Flash,正式发布。
Coding能力大幅提升,LMArena上,Gemini 3.8 Flash空降Agent榜单第14名,以微弱优势险胜DeepSeek-V4-Pro。
对一款走量定位的Flash模型来说,无疑是超常发挥了,值得表扬。
毕竟价格一分没涨。
是的,3.8 Flash在定价上,仍然与3.7 Flash保持一致。
Benchmark啥的就不细说了,大家看看就行。
相比而言,背后的方法论可能更有意思一点——
从谷歌披露的这些数据看来,Gemini好像「邪修」上了啊。。。
OpenAI和Anthropic都在努力让模型表现更强,同时用更少的步骤完成任务。
谷歌这边,完成任务需要走的步骤却越来越多,主打靠Loop大力出奇迹。
估计也是为了弥补模型智能本身的不足吧。
这可能也是Gemini如此注重「速度」的原因。
目前看来,3.8 Flash是市面上输出最快的模型,断崖碾压的那种,比第二名meta高了几乎一倍。。。
但就是不知道实际用起来到底咋样。
如果智能水平跟不上,输出的全是劣质Token啊。
这方面,有网友发现了端倪。
说这玩意儿完全就是刷分刷出来的,像Terminal-bench 4.0这种8月底刚出的bench,新版Gemini表现纯纯一坨。
但不管怎么样,谷歌这次,终于是睡醒了吧。
过去一个半月,谷歌经历了一窝人事变动,甚至连二进制能力拥有者Jeff Dean都离职了——
谷歌,却连出了三款Flash。
关于这点,DeepMind成员姚顺宇的新帖子,或许能给出一点解释。
对模型来说,那只是一小步;但对RSI来说,则是一次巨大的飞跃呢
六周三款Flash,搞不好只是开胃菜。
Gemini 3.8 Flash:笨,但很努力
3.8 Flash无疑是一款性价比模型,相比3.7 Flash性能大涨,多数场景已经逼近更高成本的旗舰模型。
DeepSWE v1.1上,它能端到端自主解复杂工程问题,得分超过大多数体型大得多的前沿模型,成本只要零头。
金融和法律这类企业级agent场景,它也压过3.7 Flash和其他前沿模型。
HLE-Verified,人类最后的考试上拿到 54.9%,跨STEM、人文、专业领域的多步推理,和旗舰的差距肉眼可见地缩小了。
但智能方面,似乎并没有本质的提升。
3.8 Flash能考出这个分数,单纯是靠卷出来的。。。
是的,面对复杂任务,它会多走几步推理,反复迭代调用工具,所以在高effort档位下,它可能比前辈们烧更多Token。
这么一看,好像也没性价比到哪去啊。
谷歌如果想重回第一梯队,光靠这种Trick估计是不太行的。
还是坐等一手Pro吧。
只守不攻的Cyber模型
对了,还有一款模型——
3.8 Flash Cyber。
谷歌史上最强的网络安全模型。专攻自主发现漏洞、自动生成补丁。
基准上,CyberGym 漏洞发现测试里,3.8 Flash Cyber 超过 3.5 Flash Cyber,也超过大得多的前沿模型。在覆盖 20 种编程语言的内部代码库测试里,挖洞成功率超过 70%。
修洞方面,CWE-Bench上它pass@1达到47.2%,目前领跑的前沿模型是47.8%,几乎打平,成本却低出一大截。
更硬核的是实战报告,它已经在谷歌内部上岗了。
Chrome安全团队拿它修洞,产出的正确补丁数量,是最强商业模型的 2.6倍。
Wiz用它跑内部渗透测试,召回率提升7.5到9.7个百分点,同样成绩的花费,只有其他前沿模型的2.3到5.2分之一。
最夸张的是Google Cloud漏洞研究团队,用它不到两小时,就挖出了一个以往需要研究数月的关键基础漏洞。
不过吧,这又是一个不公开发布的模型。。。
是的,谷歌表示能力太强,只通过Fairwind计划向受信防御者开放。
One More Thing
就在谷歌发模型的当口,meta也端出了新货,Muse Spark 1.3。
又是一款对标Opus 5的模型,Agent和Coding能力同样大幅提升。
还顺手嘲讽了Gemini一波——
我真不想这么说,但是……
Gemni,谁啊?
不是,bro,你跟Gemini比个啥啊???