炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
(来源:网易科技)
四连超凡 Quadra kill,不是游戏,而是 Gemini 又双叒叕发新的 Flash 模型了。
出于刻板印象和谷歌低调的宣发,这次的 Gemini 3.8 Flash 世超本来没太上心。
但意外的是,网上风评很不错,尤其是编辑部的谷歌老粉,纷纷感慨:
难道说,Flash 才是对的?
看官方的跑分表,确实会被唬住,因为它拉来对标的,已经是 Claude 和 GPT 的旗舰模型了。
最有冲击力的提升都集中在「干活」两字上。
DeepSWE 这项,主打长线的编程开发能力,已经摸到了 Claude Opus 5 的屁股,只差 0.3%。
而像传统测 Agent 能力的 Terminal-bech,它在 2.1 版的测试里也是力压全场,豪取 89.45%;
不过在上个月更新的 4.0 版中,它又拉了个 19.1%,能力泛化差点意思。
除此之外,多模态成绩还算强势,科研,金融分析等专业领域,也小有进步。
而且翻开更具体的模型卡片能看到,3.8 Flash 的世界知识来到了 26 年的 3 月份,脑子里终于更新了点新东西。
但难崩的是谷歌很快打了个补丁,说只有部分领域是新的,很多老领域仍然是雷打不动的 25 年 1 月。。。
当然,重头戏还是性价比,3.8 Flash 这次性能跑分库库涨,但吐 token 的速度仍旧一泻千里。
看 Artificial Analysis 的榜单,大伙儿多半是两位数,就它干到了三百多。
不过话说回来,比起之前,它执行起任务的速度反而要慢一些。
因为谷歌说 3.8 Flash 在工作中会更努力的调用工具,推理更多步骤,这样活儿会干得更漂亮,代价就是拉长交付时间。
价格这块儿也挺有活儿,虽然 Flash 的便宜大碗众所周知,但直接贴到跑分表里头两行,大写特写的,咱还是头一回见。
我们也简单实测了一下,省流就是除了快还是快,干活儿不懒,智商一般,但写东西意外的挺有人味儿。。。
比如同样生成一篇文章,讲述最近 DLSS 5 有争议的内容。
GPT 5.6 这儿东拼西凑两分半开始下笔,但你一下就能品到 AI 味儿,直冲天灵盖儿。
像「不是而是」这种已经是老版本了,现在是三五个字儿一句话,配合莫名其妙的设问,再点缀上无穷无尽的排比,读起来断断续续的,非常割裂。。。
Gemini 3.8 Flash 则是另一种画风,3000 字的稿子,17 秒足矣,多一秒都是对 Flash 的亵渎。
遣词造句的习惯也完全不同,风格更犀利,乐意用一些网络热梗去类比。
虽然偶尔显得用力过猛,但场景的渲染和情绪的递进都丝滑很多,读起来也流畅一些,起码没那么乏味。
不过你仔细看完,就会发现,这俩纯偏科生来的,Gemini 虽然说人话了,但它论证的准确度远不如 GPT 严谨。
接下来的 Coding 测试,表现就没有跑分看起来那么猛了。
先来个常规的 3D 场景建模,用网页还原二游那种渲染的质感,造个日式便利店。
就结果来看,确实达不到原作者 Demo 中 Claude Opus 5 的那种质感。
模型整体的规格和样式基本没错,但内部的细节就少了太多,而且光影效果也没按提示词来,整体的滤镜色调都差了个档次。
作为对比,下面又拿 GPT 5.6 Terra 和 Kimi K3 跑了一轮,虽然跑分表上他们旗鼓相当,但这俩的质感明显好很多。
超市的门能打开了,模型边缘也加了非常灵魂的黑色描边,多了很多二次元风格化的处理细节。
向左滑动,依次为GPT 5.6 Terra和Kimi K3
接下来加大难度,让它复刻经典的 Minecraft 游戏。
如果是网页版,配上一句话的提示词,那你将体验到窜稀一样的速度,它不到一分钟就能搓出来。
虽然跟预想的一样拉完了,但好在没啥 BUG,方块能挖也能放,主打一个简约。
而如果升级一下,用谷歌 AI Studio 的那套工具打辅助,那质感挠一下就上来了。
细节更接近 Minecraft 原版,方块的类型更多,玻璃草地的材质也很还原,尤其是游戏本体的功能性更丰富了,菜单有更多设置选项,游戏中也多了背包之类的复杂系统。
能看出来,有工具跟没工具的 Gemini 3.8 Flash 是两个玩意儿。
所以我干脆安装了 Antigravity,谷歌官方的本地 Agent 工具,看看更专业的 Harness 加持下,会不会有更好的效果。
不过还是得吐槽一下,比起 Codex,WorkBuddy 之类的应用,Antigravity 的使用体验就是一坨,没有中文适配,没有技能商店,第三方插件寥寥无几,一切都透露着原始美。。。
言归正传,这一版的 Minecraft 我让它结合一下漫威蜘蛛侠的玩法,能在城市间荡蛛丝。
这回没那么快了,花了大概 8 分钟,它才把成品掏出来。
地点设置在纽约的曼哈顿,Minecraft 的玩法都还在,方块都转化成了更适配主题的现代化材质。
可能是因为在执行前写了计划书的原因,完成度明显高了很多。
比如很多地标建筑,像帝国大厦,跨海悬索桥,拿方块还原的都不错,过河小桥,路灯这些小细节也不少,连史蒂夫本人都换成了 Spiderman 的皮肤。
不过这个荡蛛丝的玩法物理判定太复杂,它修了好几轮都还有 Bug,Spiderman 的速度诡异,一会儿飞起,一会儿卡住,在大楼之间来回抽搐抖动。
最后我又测了一下代码理解能力,让它去 GitHub 上把 DeepSeek Harness 拉下来,做个方便理解代码仓库的 wiki。
花了十分钟,它把项目从头到尾读了一遍,然后搓出了 wiki。
内容倒是没偷懒,架构设计,接入的协议,以及后续二次开发的标准都扒了出来。
但审美这块儿还是祖传的 AI 味儿,后续我让它自己装个 skill,然后重构一下前端。
结果它老毛病又犯了,2 分钟安装执行糊弄完毕,风格切换就是换个色儿,翻开思维链能看到,skill 装是装了,但只调用了一半儿就自作主张交差了。。。
这通测试下来,也能感觉到 Gemini 3.8 Flash 的尴尬之处,它执行速度奇高,但又有一堆莫名其妙的小毛病。
有前面 4 个月 4 个 Flash 模型的积累,没人比谷歌更懂 Flash 的性价比,所以执行效率没啥毛病。
但小毛病这块儿又确实影响体验,像 Minecraft 这个任务,网页版,AI Studio 和 Antigravity 的产物存在明显差距。
工具越少,约束越松散,它就越随心所欲。反之如果有靠谱的 Harness 去约束,有清晰的规划和边界,那它又会听话很多。
所以只能期待一手谷歌给 Harness 的升级,给模型补上能动的手脚,到时候就知道 Flash 这条路到底是夯还是拉了。。。
撰文 :风华
编辑:江江 & 面线