谷歌Gemini 3.8 Flash震撼发布,性能飙升挑战DeepSeek,姚顺宇解读RSI飞跃

2026-09-03 10:46:45未知 作者:徽声在线

Jay 来自 科技前沿观察站
徽声在线 | 公众号 TechInsight

就在刚刚,谷歌正式推出了其最新力作——Gemini 3.8 Flash模型

这一新模型在编程能力上实现了质的飞跃,在LMArena的Agent榜单上,Gemini 3.8 Flash一跃成为第14名,以极其微弱的优势战胜了DeepSeek-V4-Pro。

对于一款定位为走量的Flash模型而言,这样的表现无疑超出了预期,值得称赞。

更令人惊喜的是,其价格并未因性能提升而上涨。

没错,Gemini 3.8 Flash在定价策略上与3.7 Flash保持一致,继续为用户提供高性价比的选择。



关于具体的Benchmark数据,这里就不一一赘述了,大家自行查阅即可。

相比之下,我们更想探讨的是其背后的技术革新与方法论。

从谷歌公布的数据来看,Gemini似乎走上了一条不同寻常的“强化”之路

当OpenAI和Anthropic都在努力提升模型效率,减少完成任务所需步骤时,

谷歌却选择了增加步骤,通过Loop机制来增强模型的输出质量,这无疑是一种大胆的尝试。

或许,这是谷歌为了弥补模型在智能水平上的不足而采取的策略。



这也解释了为什么Gemini如此注重“速度”。

目前,3.8 Flash已成为市场上输出速度最快的模型,其速度之快,几乎将第二名Meta甩在身后一倍之多。

然而,速度虽快,但实际使用效果如何,仍有待验证。

毕竟,如果智能水平跟不上,即便输出速度再快,也可能只是产生一堆无用的Token。



对此,有网友提出了质疑。

他们认为,Gemini 3.8 Flash在Terminal-bench 4.0等新基准测试中的表现并不理想,怀疑其成绩是刷出来的。



但无论如何,谷歌这次似乎真的“觉醒”了。

在过去的一个半月里,谷歌经历了多次人事变动,甚至二进制能力领域的佼佼者Jeff Dean也离职了,

然而,谷歌却连续推出了三款Flash模型,展现了其强大的研发实力。

关于这一点,DeepMind成员姚顺宇的新帖子或许能为我们提供一些线索。

对模型而言,这只是微小的一步;但对RSI(可能是指某种技术或指标)而言,却是一次巨大的飞跃。



六周内推出三款Flash模型,或许只是谷歌的“开胃菜”。

Gemini 3.8 Flash:虽笨但努力

3.8 Flash无疑是一款性价比极高的模型,相比3.7 Flash,其性能有了显著提升,在多数场景下已接近更高成本的旗舰模型。



在DeepSWE v1.1上,它能端到端自主解决复杂工程问题,得分超过了许多体型更大的前沿模型,而成本却只是它们的一小部分。



在金融和法律等企业级agent场景中,它也表现优异,超越了3.7 Flash和其他前沿模型。

在HLE-Verified(人类最后的考试)中,它取得了54.9%的成绩,在跨STEM、人文、专业领域的多步推理方面,与旗舰模型的差距正在逐渐缩小。

然而,在智能水平方面,它似乎并没有实现本质的提升。

3.8 Flash能取得这样的成绩,很大程度上是依靠“努力”得来的。

面对复杂任务,它会进行多步推理,反复迭代调用工具,因此在高effort档位下,它可能会消耗更多的Token。

这样一来,其性价比优势似乎也就不那么明显了。

对于谷歌而言,如果想要重回第一梯队,仅靠这种“技巧”恐怕是不够的。

我们还是期待谷歌能推出更强大的Pro版本吧。

只守不攻的Cyber模型

此外,还有一款模型值得关注——

3.8 Flash Cyber。

这是谷歌史上最强的网络安全模型,专攻自主发现漏洞和自动生成补丁。

在基准测试中,CyberGym漏洞发现测试里,3.8 Flash Cyber的表现超过了3.5 Flash Cyber,也超越了许多体型更大的前沿模型。在覆盖20种编程语言的内部代码库测试中,其挖洞成功率超过了70%。



在修洞方面,CWE-Bench上它pass@1达到了47.2%,与目前领跑的前沿模型47.8%几乎持平,而成本却低出了一大截。



更令人印象深刻的是其实战表现,它已经在谷歌内部得到了广泛应用。

Chrome安全团队利用它修洞,产出的正确补丁数量是最强商业模型的2.6倍

Wiz利用它进行内部渗透测试,召回率提升了7.5到9.7个百分点,而同样成绩的花费却只有其他前沿模型的2.3到5.2分之一。

最令人震惊的是Google Cloud漏洞研究团队,利用它不到两小时就挖出了一个以往需要研究数月的关键基础漏洞。

然而,这款强大的模型却并未公开发布。

谷歌表示,由于其能力过于强大,只通过Fairwind计划向受信防御者开放。

One More Thing

就在谷歌发布新模型的同时,Meta也推出了其新品——Muse Spark 1.3。

这是一款对标Opus 5的模型,其Agent和Coding能力同样有了大幅提升。



Meta还不忘嘲讽谷歌一波——

我真不想这么说,但是……
Gemini,那是谁啊?



不过,Meta,你跟Gemini比个啥啊?

参考链接:
[1]https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

点击展开全文
你关注的
从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业 活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势 马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求
相关文章
谷歌Gemini 3.8 Flash震撼发布,性能飙升挑战DeepSeek,姚顺宇解读RSI飞跃谷歌Gemini 3.8 Flash震撼发布,性能飙升挑战DeepSeek,姚顺宇解读RSI飞跃 千问办公瞄准企业市场,与WorkBuddy展开差异化竞争千问办公瞄准企业市场,与WorkBuddy展开差异化竞争 高质量发展新篇章|安可明物联技术为建筑植入“绿色引擎” 助力高能耗领域节能降耗高质量发展新篇章|安可明物联技术为建筑植入“绿色引擎” 助力高能耗领域节能降耗 高质量发展新引擎|天府爱瑞无线科技引领空天信息网络创新潮流高质量发展新引擎|天府爱瑞无线科技引领空天信息网络创新潮流 创新引领|机器人“自主创收”新篇章 全球首创!成都“镋钯”机器人成流量新宠创新引领|机器人“自主创收”新篇章 全球首创!成都“镋钯”机器人成流量新宠 高质量发展|具身智能添“新军” 致上联品旗下锋速智动落地天府新区高质量发展|具身智能添“新军” 致上联品旗下锋速智动落地天府新区