ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

4个月4个Flash,Gemini到底在下什么怪棋?

时间:2026-09-04 15:00:15来源:差评编辑:快讯

四连超凡 Quadra kill,不是游戏,而是 Gemini 又双叒叕发新的 Flash 模型了。

出于刻板印象和谷歌低调的宣发,这次的 Gemini 3.8 Flash 世超本来没太上心。

但意外的是,网上风评很不错,尤其是编辑部的谷歌老粉,纷纷感慨:

难道说,Flash 才是对的?

看官方的跑分表,确实会被唬住,因为它拉来对标的,已经是 Claude 和 GPT 的旗舰模型了。

最有冲击力的提升都集中在「干活」两字上。

DeepSWE 这项,主打长线的编程开发能力,已经摸到了 Claude Opus 5 的屁股,只差 0.3%。

而像传统测 Agent 能力的 Terminal-bech,它在 2.1 版的测试里也是力压全场,豪取 89.45%;

不过在上个月更新的 4.0 版中,它又拉了个 19.1%,能力泛化差点意思。

除此之外,多模态成绩还算强势,科研,金融分析等专业领域,也小有进步。

而且翻开更具体的模型卡片能看到,3.8 Flash 的世界知识来到了 26 年的 3 月份,脑子里终于更新了点新东西。

但难崩的是谷歌很快打了个补丁,说只有部分领域是新的,很多老领域仍然是雷打不动的 25 年 1 月。。。

当然,重头戏还是性价比,3.8 Flash 这次性能跑分库库涨,但吐 token 的速度仍旧一泻千里。

看 Artificial Analysis 的榜单,大伙儿多半是两位数,就它干到了三百多。

不过话说回来,比起之前,它执行起任务的速度反而要慢一些。

因为谷歌说 3.8 Flash 在工作中会更努力的调用工具,推理更多步骤,这样活儿会干得更漂亮,代价就是拉长交付时间。

价格这块儿也挺有活儿,虽然 Flash 的便宜大碗众所周知,但直接贴到跑分表里头两行,大写特写的,咱还是头一回见。

我们也简单实测了一下,省流就是除了快还是快,干活儿不懒,智商一般,但写东西意外的挺有人味儿。。。

比如同样生成一篇文章,讲述最近 DLSS 5 有争议的内容。

GPT 5.6 这儿东拼西凑两分半开始下笔,但你一下就能品到 AI 味儿,直冲天灵盖儿。

像「不是而是」这种已经是老版本了,现在是三五个字儿一句话,配合莫名其妙的设问,再点缀上无穷无尽的排比,读起来断断续续的,非常割裂。。。

Gemini 3.8 Flash 则是另一种画风,3000 字的稿子,17 秒足矣,多一秒都是对 Flash 的亵渎。

遣词造句的习惯也完全不同,风格更犀利,乐意用一些网络热梗去类比。

虽然偶尔显得用力过猛,但场景的渲染和情绪的递进都丝滑很多,读起来也流畅一些,起码没那么乏味。

不过你仔细看完,就会发现,这俩纯偏科生来的,Gemini 虽然说人话了,但它论证的准确度远不如 GPT 严谨。

接下来的 Coding 测试,表现就没有跑分看起来那么猛了。

先来个常规的 3D 场景建模,用网页还原二游那种渲染的质感,造个日式便利店。

就结果来看,确实达不到原作者 Demo 中 Claude Opus 5 的那种质感。

模型整体的规格和样式基本没错,但内部的细节就少了太多,而且光影效果也没按提示词来,整体的滤镜色调都差了个档次。

作为对比,下面又拿 GPT 5.6 Terra 和 Kimi K3 跑了一轮,虽然跑分表上他们旗鼓相当,但这俩的质感明显好很多。

超市的门能打开了,模型边缘也加了非常灵魂的黑色描边,多了很多二次元风格化的处理细节。

依次为GPT 5.6 Terra和Kimi K3

接下来加大难度,让它复刻经典的 Minecraft 游戏。

如果是网页版,配上一句话的提示词,那你将体验到窜稀一样的速度,它不到一分钟就能搓出来。

虽然跟预想的一样拉完了,但好在没啥 BUG,方块能挖也能放,主打一个简约。

而如果升级一下,用谷歌 AI Studio 的那套工具打辅助,那质感挠一下就上来了。

细节更接近 Minecraft 原版,方块的类型更多,玻璃草地的材质也很还原,尤其是游戏本体的功能性更丰富了,菜单有更多设置选项,游戏中也多了背包之类的复杂系统。

能看出来,有工具跟没工具的 Gemini 3.8 Flash 是两个玩意儿。

所以我干脆安装了 Antigravity,谷歌官方的本地 Agent 工具,看看更专业的 Harness 加持下,会不会有更好的效果。

不过还是得吐槽一下,比起 Codex,WorkBuddy 之类的应用,Antigravity 的使用体验就是一坨,没有中文适配,没有技能商店,第三方插件寥寥无几,一切都透露着原始美。。。

言归正传,这一版的 Minecraft 我让它结合一下漫威蜘蛛侠的玩法,能在城市间荡蛛丝。

这回没那么快了,花了大概 8 分钟,它才把成品掏出来。

地点设置在纽约的曼哈顿,Minecraft 的玩法都还在,方块都转化成了更适配主题的现代化材质。

可能是因为在执行前写了计划书的原因,完成度明显高了很多。

比如很多地标建筑,像帝国大厦,跨海悬索桥,拿方块还原的都不错,过河小桥,路灯这些小细节也不少,连史蒂夫本人都换成了 Spiderman 的皮肤。

不过这个荡蛛丝的玩法物理判定太复杂,它修了好几轮都还有 Bug,Spiderman 的速度诡异,一会儿飞起,一会儿卡住,在大楼之间来回抽搐抖动。

最后我又测了一下代码理解能力,让它去 GitHub 上把 DeepSeek Harness 拉下来,做个方便理解代码仓库的 wiki。

花了十分钟,它把项目从头到尾读了一遍,然后搓出了 wiki。

内容倒是没偷懒,架构设计,接入的协议,以及后续二次开发的标准都扒了出来。

但审美这块儿还是祖传的 AI 味儿,后续我让它自己装个 skill,然后重构一下前端。

结果它老毛病又犯了,2 分钟安装执行糊弄完毕,风格切换就是换个色儿,翻开思维链能看到,skill 装是装了,但只调用了一半儿就自作主张交差了。。。

这通测试下来,也能感觉到 Gemini 3.8 Flash 的尴尬之处,它执行速度奇高,但又有一堆莫名其妙的小毛病。

有前面 4 个月 4 个 Flash 模型的积累,没人比谷歌更懂 Flash 的性价比,所以执行效率没啥毛病。

但小毛病这块儿又确实影响体验,像 Minecraft 这个任务,网页版,AI Studio 和 Antigravity 的产物存在明显差距。

工具越少,约束越松散,它就越随心所欲。反之如果有靠谱的 Harness 去约束,有清晰的规划和边界,那它又会听话很多。

所以只能期待一手谷歌给 Harness 的升级,给模型补上能动的手脚,到时候就知道 Flash 这条路到底是夯还是拉了。。

更多热门内容
小米卢伟冰谈内存涨价:不能简单把成本转移
​9月4日,在IFA 2026小米全球发布会后,小米集团合伙人、总裁、手机部总裁卢伟冰与媒体对话。谈及存储持续涨价话题,他表示,涨也好、跌也好,总要往前走。但小米在预测之后,至少有一个很简单的结论:不能简单地把成本转移,一定要把产品做得更好。“产品要卖贵了,怎么让用户感受到物超所值才是关键。这次 K100 Pro 系列超出我的预期,也超了很多人的预期,就是因为这款产品在成本上涨的同时,我们在不断做加法,把产品做得更好。”

2026-09-04

当AI碾压智力工作者,普通人如何对冲风险?守住“押注人生”的权利
我在这里用“对冲”这个词,因为它准确描述了一种很具体的处境:你知道浪会打过来,也知道自己拦不住,所以应该提前换掉一部分和浪潮同涨同跌的头寸。真正的个人品牌是一条公开的判断记录:你在什么还没成为共识时说过什么…

2026-09-04

OpenAI重磅推出GPT-6 Astra,在多领域达全球先进水平或成AGI关键转折
来源:环球网 【环球网科技综合报道】9月4日消息,据彭博社报道,OpenAI于周四正式推出新一代旗舰AI大模型GPT-6 Astra,官方称该模型在计算机操作、软件工程、科学研究及各类专业工作场景下均实现重…

2026-09-04