METAL LAB

谷歌发布Gemini 3.8 Flash 聚焦编程与智能体任务

新模型基于Gemini 3.7 Flash打造,通过6条渠道部署,上下文最长支持100万Token

摘要

  • Google DeepMind于2026年9月2日公布了基于Gemini 3.7 Flash打造的Gemini 3.8 Flash模型卡
  • 该模型支持文本、图像、音频、视频输入,上下文窗口最长100万Token,输出最长支持6.4万Token
  • 该模型通过Gemini应用、Google AI Studio、Gemini API等6条渠道部署,主要面向软件工程与智能体任务

Google DeepMind于2026年9月2日公布了Gemini 3.8 Flash模型卡。作为Gemini 3系列的最新迭代版本,此次发布的核心是在软件工程和智能体型知识工作方面提升了性能。

点状种子形态的3.7 Flash原封不动地保留了骨架,针对编程和智能体任务调优后的3.8 Flash以不断扩大的圆点呈现,用放射状光芒的符号描绘出这一模型同时向六条部署渠道扩散开来的画面。点状种子形态的3.7 Flash原封不动地保留了骨架,针对编程和智能体任务调优后的3.8 Flash以不断扩大的圆点呈现,用放射状光芒的符号描绘出这一模型同时向六条部署渠道扩散开来的画面。

Google DeepMind 官方网站

简单来说,Gemini Flash是谷歌以数周为间隔、通过升级小数点版本号来持续打磨的实验性产品线。

从3.6到3.8,仅隔三周

上月12日,TestingCatalog曾在Gemini Enterprise界面中捕捉到"Gemini 3.6 Flash"的测试横幅。不到三周后,谷歌就正式上线了3.8 Flash模型卡。卡片中特别注明,请同时参考3.7 Flash模型卡,因为两者在架构、训练数据、硬件和软件方面完全一致。

具体改动是什么

模型卡披露的变化可归纳为两点:一是在软件工程和智能体型知识工作上的性能提升,二是继续支持用于权衡质量、成本与延迟的effort level参数。具体数值整理在下面的官方性能部分。

模型可接收文本、图像、音频、视频文件作为输入,上下文窗口最长100万Token,文本输出最长可达6.4万Token。这些数值与3.7 Flash完全相同,说明此次更新更像是在同一框架内进行性能调优,而非架构上的重新设计。官方说明可在评估方法说明页查看详细的评估方式。

项目内容
基础模型Gemini 3.7 Flash
输入文本、图像、音频、视频
上下文窗口最长100万Token
输出文本,最长6.4万Token
主要用途软件工程、智能体任务、复合型知识工作

官方性能表——价格便宜5至7倍,但胜负分布悬殊

模型卡第5页收录了一张涵盖14项基准测试的对比表。该表在PDF中是以图片形式呈现的, 仅抓取正文文本是看不到的。以下是原样转录的表格内容。

先看价格。3.8 Flash每百万Token输入0.75美元、输出3.75美元, 仅为Claude Opus 5(5美元、25美元)的七分之一。不过这是引入价, 仅适用到2026年12月31日。从2027年1月1日起,价格将上调至输入1.50美元、输出7.50美元。

每百万Token3.8 Flash3.7 FlashOpus 5Sonnet 5GPT-5.6 SolGPT-5.6 Terra
输入$0.75(原价$1.50)$0.75$5.00$2.00$4.00$2.00
输出$3.75(原价$7.50)$3.75$25.00$10.00$20.00$12.00

3.8 Flash排名第一的项目

基准测试3.8 Flash3.7 FlashOpus 5Sonnet 5GPT-5.6 SolGPT-5.6 Terra
Vals Finance Agent v2(金融分析)61.4%59.0%58.6%53.9%53.8%54.4%
Harvey 法律智能体10.0%8.8%6.7%5.0%2.5%0.8%
Terminal-bench 2.1(终端编程)89.4%85.8%89.1%80.4%88.8%87.4%
CharXiv Reasoning(复杂图表解读)86.2%84.5%83.7%70.1%85.8%85.9%
LVBench(长视频理解)87.8%85.4%75.4%68.5%82.1%78.9%
HLE-Verified(专业知识推理)54.9%53.6%54.4%31.0%54.5%51.1%
BioMysteryBench(高难度)56.5%43.5%49.4%34.1%44.7%49.4%
LABBench2(生物研究)86.2%82.1%84.2%80.1%82.1%81.2%

3.8 Flash落败的项目——这些可能更重要

基准测试3.8 Flash排名第一模型
Terminal-bench 4.0(通用智能体)19.1%Opus 5 51.8%
OSWorld-2.0(计算机操作)59.0%Opus 5 75.4%
GDPVal-AA v2(知识工作,Elo评分)1545Opus 5 1824
DeepSWE v1.1(长周期软件工程)73.7%Opus 5 74.0%
GDP.PDF(专业PDF阅读理解)35.0%GPT-5.6 Sol 40.0%

谷歌在宣传页面上着重展示的是上面这张表。把两张表放在一起看,画面就不一样了。 在通用智能体(Terminal-bench 4.0)上是19.1%对51.8%,在计算机操作(OSWorld-2.0)上是 59.0%对75.4%,明显落后于Opus 5。也就是说,3.8 Flash在"使用既定工具的窄域任务"上 物美价廉,但"在陌生环境中自主完成任务"的能力,目前仍是前沿模型的强项。

DeepMind在官方产品页面引用的客户评价 也印证了这一点。文档检索公司Glean的AI产品负责人Tai Tran表示,在"文档密集的长周期 工作流"中,该模型完成的任务量是3.7 Flash的三倍以上;游戏制作智能体公司 Loopit的CTO Haoyuan Guo则表示,他们将其用于编程、素材推理和视觉验证。 需要留意的是,这两条引用都是谷歌自己挑选的。

wWEwX2i0HtKcCbqllmsPq68sJY8vl0qTP1O8gXfEl81ulUVafxvPrgtY p60TZGOMTgiz 5u VQvGFYQckQVol37BnvcPoyXENT657y PyMsRE5oEw=w1440 rw lo

模型卡里悄悄提到的几件事

除了数值表之外,卡片中还有三点值得关注。

第一,多语言安全性下降了5.4个百分点。 在谷歌的自动安全评估中,文本安全性提升了 0.4个百分点,图像安全性没有变化,唯独多语言表现变差,卡片也写道"非英语安全性表现 相较3.7 Flash略有退步"。对于韩语用户来说,这不是可以随便略过的项目。

第二,前沿安全性评估并未针对3.8本身进行。 卡片说明,评估的是3.7 Flash是否达到 风险阈值(T/CCL),结果为未达到,而对于3.8,则是推测"由于没有出现有意义的新能力 或实质性性能提升",结论应当相同。

第三,知识截止日期为2026年3月。不过卡片也提前说明,某些领域的知识水平可能仍停留在 2025年1月。已知的局限包括幻觉问题、越狱抵御能力、偶发的延迟或超时, 以及在高effort level设置下过度消耗Token的问题。

官方页面同时公布了四个演示案例:在Antigravity中通过一句反复指令做出的3D解谜游戏、 上方视频中的DOS版谷歌地图、利用美国地质调查局和OpenWeather真实数据制作的地形剖面图, 以及用Three.js渲染硬件分解图的3D查看器。

可以在哪里使用

Gemini 3.8 Flash通过六条渠道部署:Gemini应用、Gemini Enterprise智能体平台、Google AI Studio、Gemini API、Google AI Mode,以及Google Antigravity。

开发者可在Google AI Studio或Gemini API中将模型名称指定为gemini-3.8-flash,并通过effort level参数选择质量、成本与延迟的组合。普通用户则可以在Gemini应用的模型选择菜单中直接选中该名称来使用。

渠道定位
Gemini 应用面向大众消费者的聊天机器人
Gemini Enterprise Agent Platform企业级智能体平台
Google AI Studio面向开发者的原型开发工具
Gemini API用于服务集成的API
Google AI Mode搜索内的AI答案模式
Google Antigravity智能体式开发平台

局限与安全措施

模型卡承认,已知局限之一是幻觉(把看似合理的虚假信息当作事实陈述)问题依然存在。谷歌表示正持续改进越狱抵御能力,并在近期整体加强了前沿安全方面的缓解措施。

国内情况

据国内报道,谷歌已于上月30日正式推出面向个人用户的AI智能体"Gemini Spark",本月又重启了针对大学(研究)生的Gemini付费会员免费提供,以及AI Pro套餐折扣促销活动。而专注于软件工程和智能体任务的3.8 Flash,很可能会成为支撑此类国内智能体服务的底层模型。

同日发布的第二款模型——3.8 Flash Cyber

Google DeepMind当天在官方X账号上 同时宣布了"两款新的Gemini模型"。一款是上文介绍的3.8 Flash, 另一款是3.8 Flash Cyber——一款专门用于发现安全漏洞并自动生成补丁的模型。

谷歌提出的问题是这样的:安全团队目前只能在"庞大、昂贵且缓慢的前沿模型" 和"便宜但无法处理复杂代码修复的小模型"之间二选一,而3.8 Flash Cyber能够 在组织自有的云环境内,几分钟就生成可部署的修复方案

31jyeMWAamsR699oN thAvrro WbOIIQ5R r2jaYhC5Fb7pcP7eQNl3cRVriT4rNg2rdEEeDtOGBGuRZy0O9TaaCsuhSxpxkJ0vunrgnseAMN8mm=w1440 h810 n nu rw lo

CyberGym——号称在C/C++漏洞发现上排名第一

CyberGym Pass@1基准测试——Gemini 3.8 Flash Cyber以86.2%排名第一
CyberGym Pass@1(C/C++漏洞发现)得分
Gemini 3.8 Flash Cyber86.2%
GPT-5.5-Cyber85.6%
Mythos 583.8%
GPT-5.6 Sol83.6%
Gemini 3.5 Flash Cyber77.5%

虽然排名第一,但与第二名GPT-5.5-Cyber(85.6%)的差距仅0.6个百分点。反倒更值得关注的是, 相较上一代3.5 Flash Cyber(77.5%),此次提升了8.7个百分点。

CWE-Bench——准确率相近,价格却只有三分之一

CWE-Bench Pass@1对比单次运行成本——3.8 Flash Cyber位于帕累托曲线之上

横轴为单次运行的平均成本(越靠右越便宜),纵轴为准确率。

CWE-Bench Pass@1准确率单次运行成本(约)
Claude Fable 547.9%约$10.3
Gemini 3.8 Flash Cyber47.3%约$3.6
GPT-5.6 Sol44.3%约$2.4
Gemini 3.7 Flash44.2%约$1.5
Opus 4.842.2%约$2.5
Grok 4.638.4%约$2.0
Hy4 Preview33.8%约$0.8
DeepSeek V4 Flash30.5%约$0.2

准确率排名第一的是Claude Fable 5(47.9%)。3.8 Flash Cyber以47.3%的成绩低了0.6个百分点, 但成本只有前者的三分之一,谷歌正是用帕累托曲线来展示这一点的。 这张图表想说的不是"表现最好",而是**"用差不多的成本做到接近的效果"**。

除了基准测试,谷歌还给出了一个来自真实代码的数字:据称在Chrome代码库上的测试中, 该模型生成的有效修复(valid fixes)数量是对照模型的2.6倍。至于具体对照的是哪个模型, 公告中并未说明。

并非人人可用——Fairwind计划

3.8 Flash Cyber并非面向公众开放。谷歌表示将通过名为Fairwind计划(Fairwind Program)的 专门渠道,优先向国家网络安全机构以及通信、能源等关键服务运营商提供可信访问权限, 理由是保护核心公共基础设施。

发现漏洞并自动生成补丁的能力,对防御方和攻击方同样适用。 将访问范围限定在国家机构和关键行业,本身也说明谷歌意识到了这种两面性。 与此同时,3.8 Flash(普通版)正通过Google Antigravity和AI Studio API陆续部署上线。

编辑观察

"软件工程"和"智能体型知识工作"这两个词反复出现,并非偶然。同一时期,Gemini通过智能体式视频理解功能将Token消耗降低了多达88%,企业端界面里也在试验聊天与任务模式之间的切换开关。这三个动作指向同一个方向——把重心从"擅长回答问题的聊天机器人",转移到"能代替人完成工作的智能体"。

与上一代模型相比,真正能让人感受到差异的不是数字,而是部署方式。架构、训练数据乃至硬件都原封不动地继承自3.7 Flash,这说明谷歌选择的路径不是每次从零开始重造模型,而是在同一框架内以数周为周期反复调优。把这类小数点版本放到实际工作中检验,得出的结论往往差不多——与其期待大幅度的性能飞跃,不如期待它在特定任务上、这次是编程和智能体任务上的细微改进。

对国内企业而言,与其纠结是否要立即引入这款模型,不如更现实一点:在已经使用的Gemini API管线中,只需重新调整effort level参数,就能重新平衡成本与延迟。由于目前尚未公布对照基准数值,现在判断准确率的提升幅度还为时过早,唯一的办法是放到实际工作负载中直接比较。

未来几周内,随着智能体式处理方式扩展应用到Gemini应用和YouTube的"Ask YouTube"功能,3.8 Flash很可能会作为底层模型出现在这些场景中。既然小数点版本更新的速度已经如此之快,下一个版本不是几周后、而是几天后就发布,也不会让人意外。

评论