谷歌Gemini 3.8 Flash震撼发布,性能飙升挑战DeepSeek,姚顺宇解读RSI飞跃
2026-09-03 10:46:45未知 作者:徽声在线
Jay 来自 科技前沿观察站
徽声在线 | 公众号 TechInsight
就在刚刚,谷歌正式推出了其最新力作——Gemini 3.8 Flash模型。
这一新模型在编程能力上实现了质的飞跃,在LMArena的Agent榜单上,Gemini 3.8 Flash一跃成为第14名,以极其微弱的优势战胜了DeepSeek-V4-Pro。
对于一款定位为走量的Flash模型而言,这样的表现无疑超出了预期,值得称赞。
更令人惊喜的是,其价格并未因性能提升而上涨。
没错,Gemini 3.8 Flash在定价策略上与3.7 Flash保持一致,继续为用户提供高性价比的选择。
关于具体的Benchmark数据,这里就不一一赘述了,大家自行查阅即可。
相比之下,我们更想探讨的是其背后的技术革新与方法论。
从谷歌公布的数据来看,Gemini似乎走上了一条不同寻常的“强化”之路。
当OpenAI和Anthropic都在努力提升模型效率,减少完成任务所需步骤时,
谷歌却选择了增加步骤,通过Loop机制来增强模型的输出质量,这无疑是一种大胆的尝试。
或许,这是谷歌为了弥补模型在智能水平上的不足而采取的策略。
这也解释了为什么Gemini如此注重“速度”。
目前,3.8 Flash已成为市场上输出速度最快的模型,其速度之快,几乎将第二名Meta甩在身后一倍之多。
然而,速度虽快,但实际使用效果如何,仍有待验证。
毕竟,如果智能水平跟不上,即便输出速度再快,也可能只是产生一堆无用的Token。
对此,有网友提出了质疑。
他们认为,Gemini 3.8 Flash在Terminal-bench 4.0等新基准测试中的表现并不理想,怀疑其成绩是刷出来的。
但无论如何,谷歌这次似乎真的“觉醒”了。
在过去的一个半月里,谷歌经历了多次人事变动,甚至二进制能力领域的佼佼者Jeff Dean也离职了,
然而,谷歌却连续推出了三款Flash模型,展现了其强大的研发实力。
关于这一点,DeepMind成员姚顺宇的新帖子或许能为我们提供一些线索。
对模型而言,这只是微小的一步;但对RSI(可能是指某种技术或指标)而言,却是一次巨大的飞跃。
六周内推出三款Flash模型,或许只是谷歌的“开胃菜”。
Gemini 3.8 Flash:虽笨但努力
3.8 Flash无疑是一款性价比极高的模型,相比3.7 Flash,其性能有了显著提升,在多数场景下已接近更高成本的旗舰模型。
在DeepSWE v1.1上,它能端到端自主解决复杂工程问题,得分超过了许多体型更大的前沿模型,而成本却只是它们的一小部分。
在金融和法律等企业级agent场景中,它也表现优异,超越了3.7 Flash和其他前沿模型。
在HLE-Verified(人类最后的考试)中,它取得了54.9%的成绩,在跨STEM、人文、专业领域的多步推理方面,与旗舰模型的差距正在逐渐缩小。
然而,在智能水平方面,它似乎并没有实现本质的提升。
3.8 Flash能取得这样的成绩,很大程度上是依靠“努力”得来的。
面对复杂任务,它会进行多步推理,反复迭代调用工具,因此在高effort档位下,它可能会消耗更多的Token。
这样一来,其性价比优势似乎也就不那么明显了。
对于谷歌而言,如果想要重回第一梯队,仅靠这种“技巧”恐怕是不够的。
我们还是期待谷歌能推出更强大的Pro版本吧。
只守不攻的Cyber模型
此外,还有一款模型值得关注——
3.8 Flash Cyber。
这是谷歌史上最强的网络安全模型,专攻自主发现漏洞和自动生成补丁。
在基准测试中,CyberGym漏洞发现测试里,3.8 Flash Cyber的表现超过了3.5 Flash Cyber,也超越了许多体型更大的前沿模型。在覆盖20种编程语言的内部代码库测试中,其挖洞成功率超过了70%。
在修洞方面,CWE-Bench上它pass@1达到了47.2%,与目前领跑的前沿模型47.8%几乎持平,而成本却低出了一大截。
更令人印象深刻的是其实战表现,它已经在谷歌内部得到了广泛应用。
Chrome安全团队利用它修洞,产出的正确补丁数量是最强商业模型的2.6倍。
Wiz利用它进行内部渗透测试,召回率提升了7.5到9.7个百分点,而同样成绩的花费却只有其他前沿模型的2.3到5.2分之一。
最令人震惊的是Google Cloud漏洞研究团队,利用它不到两小时就挖出了一个以往需要研究数月的关键基础漏洞。
然而,这款强大的模型却并未公开发布。
谷歌表示,由于其能力过于强大,只通过Fairwind计划向受信防御者开放。
One More Thing
就在谷歌发布新模型的同时,Meta也推出了其新品——Muse Spark 1.3。
这是一款对标Opus 5的模型,其Agent和Coding能力同样有了大幅提升。
Meta还不忘嘲讽谷歌一波——
我真不想这么说,但是……
Gemini,那是谁啊?
不过,Meta,你跟Gemini比个啥啊?
参考链接:
[1]https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

