
{{aisd}}
AI生成 免责声明
谷歌的Pro模型迟迟未来,但是Flash模型又更新了,这已经是谷歌在六周内发布的第三个Flash模型。
当地时间9月2日,谷歌宣布推出Gemini 3.8 Flash,定位是“最智能的主力模型”,在软件工程、智能体任务以及特定领域的关键多步骤推理方面,相比3.7 Flash有了提升。与此同时,谷歌还同步推出了一个安全模型Gemini 3.8 Flash Cyber,在漏洞检测和自动修补方面具有前沿性能。
一位创业者感慨,Flash从3.7更新到3.8只用了14天,“模型升级周期现在比你的评估周期还短。这才是对任何构建智能体的人来说的真正故事。”
谷歌DeepMind核心成员姚顺宇也下场推荐新模型,他表示,对模型而言,这只是迈出了一小步;但对于RSI(递归自我改进)来说,是一次巨大的飞跃。RSI通常指的是让AI自己参与设计、训练和改进下一代AI,但在博客中谷歌并未展开讲这一点。

根据谷歌的测评,在DeepSWE v1.1(衡量模型自主解决复杂工程问题能力的评测)中,3.8 Flash得分73.7%,仅比Claude Opus 5的74%低0.3个百分点,超过了GPT-5.6 Sol的72.7%以及上代3.7 Flash的65.3%。
根据基准测试机构Artificial Analysis的测评,Gemini 3.8 Flash在智能上得分59,比 Gemini 3.7 Flash高3分,目前排在模型榜单第十位。
在价格方面,Gemini 3.8 Flash延续了此前的优惠促销定价,API价格维持在每百万Token输入0.75美元、输出3.75美元,延续谷歌用低价推动中端模型在复杂工程和自动化任务中普及的策略。
不过,根据业界的反馈,3.8 Flash在智能上的得分并没有提升太多,其模型能力提升源于底层设计上的调整。与前代相比,新模型在处理复杂任务时会执行更多步骤的推理,并以循环迭代的方式调用内部工具。
这可能会导致实际成本的上升。Artificial Analysis测评显示,Gemini 3.8 Flash每项智能指数任务的成本为0.58 美元,尽管定价未变,但较 Gemini 3.7 Flash 价格上涨约 40%,这主要是由于每任务输出token增加30%,以及智能体评估中回合数增多所致。
谷歌表示,在部分高难度任务中,模型可能会消耗额外的Token,但这种机制旨在提高任务的首次成功率,并减少死循环重试和人工干预。对于强调极简Token消耗的场景,开发者可以通过调整思考配置降低消耗,或继续使用Gemini 3.7 Flash。
这背后是谷歌当下的产品逻辑,旗舰没有更新,Flash系列既要把守成本和速度的基本盘,也要顶上原本属于旗舰的复杂任务。
值得一提的是,谷歌发布新模型的同一天,沉寂许久的Meta也回来了。
Meta推出了新模型Muse Spark 1.3,号称是一款对标Opus 5的模型,在榜单中超过了Gemini 3.8 Flash。
Meta将这款模型的升级重点放在Agent长任务、编程以及推理效率上,并强调它能够在较长的工作流中持续调用工具、修正自己的计划,并处理多个并行任务。按照Meta公布的数据,Muse Spark 1.3在DeepSWE v1.1上的成绩达到75.4%,超过了Gemini 3.8 Flash。
但此次引发关注的是Meta AI负责人Alexandr Wang,他在社交媒体上转发了榜单数据并调侃谷歌称,“我真不想这么说,但是……Gemini 是谁?”

这条略带挑衅意味的评论引起不少争议,有网友认为,这样明确的比较“给人小家子气的感觉”。此外,Meta仅仅发布了模型基准数据,还未经开发者实际任务检测,Benchmark上的胜负并不能直接等同于模型在真实世界中的胜负。
AI竞赛的时间单位,已经从季度压缩到了周,对于真正用模型做事的开发者来说,这些发布宣传和榜单排名并不重要,两款新模型具体性能如何,还需要等待一段时间后社区的应用反馈,到那时或许才能评判一款模型的更新是否成功。