
摘要
- Google DeepMind于2026年9月2日公布了基于Gemini 3.7 Flash打造的Gemini 3.8 Flash模型卡
- 该模型支持文本、图像、音频、视频输入,上下文窗口最长100万Token,输出最长支持6.4万Token
- 该模型通过Gemini应用、Google AI Studio、Gemini API等6条渠道部署,主要面向软件工程与智能体任务
Google DeepMind于2026年9月2日公布了Gemini 3.8 Flash模型卡。作为Gemini 3系列的最新迭代版本,此次发布的核心是在软件工程和智能体型知识工作方面提升了性能。
简单来说,Gemini Flash是谷歌以数周为间隔、通过升级小数点版本号来持续打磨的实验性产品线。
从3.6到3.8,仅隔三周
上月12日,TestingCatalog曾在Gemini Enterprise界面中捕捉到"Gemini 3.6 Flash"的测试横幅。不到三周后,谷歌就正式上线了3.8 Flash模型卡。卡片中特别注明,请同时参考3.7 Flash模型卡,因为两者在架构、训练数据、硬件和软件方面完全一致。
具体改动是什么
模型卡披露的变化可归纳为两点:一是在软件工程和智能体型知识工作上的性能提升,二是继续支持用于权衡质量、成本与延迟的effort level参数。具体数值整理在下面的官方性能部分。
模型可接收文本、图像、音频、视频文件作为输入,上下文窗口最长100万Token,文本输出最长可达6.4万Token。这些数值与3.7 Flash完全相同,说明此次更新更像是在同一框架内进行性能调优,而非架构上的重新设计。官方说明可在评估方法说明页查看详细的评估方式。
| 项目 | 内容 |
|---|---|
| 基础模型 | Gemini 3.7 Flash |
| 输入 | 文本、图像、音频、视频 |
| 上下文窗口 | 最长100万Token |
| 输出 | 文本,最长6.4万Token |
| 主要用途 | 软件工程、智能体任务、复合型知识工作 |
官方性能表——价格便宜5至7倍,但胜负分布悬殊
模型卡第5页收录了一张涵盖14项基准测试的对比表。该表在PDF中是以图片形式呈现的, 仅抓取正文文本是看不到的。以下是原样转录的表格内容。
先看价格。3.8 Flash每百万Token输入0.75美元、输出3.75美元, 仅为Claude Opus 5(5美元、25美元)的七分之一。不过这是引入价, 仅适用到2026年12月31日。从2027年1月1日起,价格将上调至输入1.50美元、输出7.50美元。
| 每百万Token | 3.8 Flash | 3.7 Flash | Opus 5 | Sonnet 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|---|---|---|
| 输入 | $0.75(原价$1.50) | $0.75 | $5.00 | $2.00 | $4.00 | $2.00 |
| 输出 | $3.75(原价$7.50) | $3.75 | $25.00 | $10.00 | $20.00 | $12.00 |
3.8 Flash排名第一的项目
| 基准测试 | 3.8 Flash | 3.7 Flash | Opus 5 | Sonnet 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|---|---|---|
| Vals Finance Agent v2(金融分析) | 61.4% | 59.0% | 58.6% | 53.9% | 53.8% | 54.4% |
| Harvey 法律智能体 | 10.0% | 8.8% | 6.7% | 5.0% | 2.5% | 0.8% |
| Terminal-bench 2.1(终端编程) | 89.4% | 85.8% | 89.1% | 80.4% | 88.8% | 87.4% |
| CharXiv Reasoning(复杂图表解读) | 86.2% | 84.5% | 83.7% | 70.1% | 85.8% | 85.9% |
| LVBench(长视频理解) | 87.8% | 85.4% | 75.4% | 68.5% | 82.1% | 78.9% |
| HLE-Verified(专业知识推理) | 54.9% | 53.6% | 54.4% | 31.0% | 54.5% | 51.1% |
| BioMysteryBench(高难度) | 56.5% | 43.5% | 49.4% | 34.1% | 44.7% | 49.4% |
| LABBench2(生物研究) | 86.2% | 82.1% | 84.2% | 80.1% | 82.1% | 81.2% |
3.8 Flash落败的项目——这些可能更重要
| 基准测试 | 3.8 Flash | 排名第一模型 |
|---|---|---|
| Terminal-bench 4.0(通用智能体) | 19.1% | Opus 5 51.8% |
| OSWorld-2.0(计算机操作) | 59.0% | Opus 5 75.4% |
| GDPVal-AA v2(知识工作,Elo评分) | 1545 | Opus 5 1824 |
| DeepSWE v1.1(长周期软件工程) | 73.7% | Opus 5 74.0% |
| GDP.PDF(专业PDF阅读理解) | 35.0% | GPT-5.6 Sol 40.0% |
谷歌在宣传页面上着重展示的是上面这张表。把两张表放在一起看,画面就不一样了。 在通用智能体(Terminal-bench 4.0)上是19.1%对51.8%,在计算机操作(OSWorld-2.0)上是 59.0%对75.4%,明显落后于Opus 5。也就是说,3.8 Flash在"使用既定工具的窄域任务"上 物美价廉,但"在陌生环境中自主完成任务"的能力,目前仍是前沿模型的强项。
DeepMind在官方产品页面引用的客户评价 也印证了这一点。文档检索公司Glean的AI产品负责人Tai Tran表示,在"文档密集的长周期 工作流"中,该模型完成的任务量是3.7 Flash的三倍以上;游戏制作智能体公司 Loopit的CTO Haoyuan Guo则表示,他们将其用于编程、素材推理和视觉验证。 需要留意的是,这两条引用都是谷歌自己挑选的。

模型卡里悄悄提到的几件事
除了数值表之外,卡片中还有三点值得关注。
第一,多语言安全性下降了5.4个百分点。 在谷歌的自动安全评估中,文本安全性提升了 0.4个百分点,图像安全性没有变化,唯独多语言表现变差,卡片也写道"非英语安全性表现 相较3.7 Flash略有退步"。对于韩语用户来说,这不是可以随便略过的项目。
第二,前沿安全性评估并未针对3.8本身进行。 卡片说明,评估的是3.7 Flash是否达到 风险阈值(T/CCL),结果为未达到,而对于3.8,则是推测"由于没有出现有意义的新能力 或实质性性能提升",结论应当相同。
第三,知识截止日期为2026年3月。不过卡片也提前说明,某些领域的知识水平可能仍停留在 2025年1月。已知的局限包括幻觉问题、越狱抵御能力、偶发的延迟或超时, 以及在高effort level设置下过度消耗Token的问题。
官方页面同时公布了四个演示案例:在Antigravity中通过一句反复指令做出的3D解谜游戏、 上方视频中的DOS版谷歌地图、利用美国地质调查局和OpenWeather真实数据制作的地形剖面图, 以及用Three.js渲染硬件分解图的3D查看器。
可以在哪里使用
Gemini 3.8 Flash通过六条渠道部署:Gemini应用、Gemini Enterprise智能体平台、Google AI Studio、Gemini API、Google AI Mode,以及Google Antigravity。
开发者可在Google AI Studio或Gemini API中将模型名称指定为gemini-3.8-flash,并通过effort level参数选择质量、成本与延迟的组合。普通用户则可以在Gemini应用的模型选择菜单中直接选中该名称来使用。
| 渠道 | 定位 |
|---|---|
| Gemini 应用 | 面向大众消费者的聊天机器人 |
| Gemini Enterprise Agent Platform | 企业级智能体平台 |
| Google AI Studio | 面向开发者的原型开发工具 |
| Gemini API | 用于服务集成的API |
| Google AI Mode | 搜索内的AI答案模式 |
| Google Antigravity | 智能体式开发平台 |
局限与安全措施
模型卡承认,已知局限之一是幻觉(把看似合理的虚假信息当作事实陈述)问题依然存在。谷歌表示正持续改进越狱抵御能力,并在近期整体加强了前沿安全方面的缓解措施。
国内情况
据国内报道,谷歌已于上月30日正式推出面向个人用户的AI智能体"Gemini Spark",本月又重启了针对大学(研究)生的Gemini付费会员免费提供,以及AI Pro套餐折扣促销活动。而专注于软件工程和智能体任务的3.8 Flash,很可能会成为支撑此类国内智能体服务的底层模型。
同日发布的第二款模型——3.8 Flash Cyber
Google DeepMind当天在官方X账号上 同时宣布了"两款新的Gemini模型"。一款是上文介绍的3.8 Flash, 另一款是3.8 Flash Cyber——一款专门用于发现安全漏洞并自动生成补丁的模型。
谷歌提出的问题是这样的:安全团队目前只能在"庞大、昂贵且缓慢的前沿模型" 和"便宜但无法处理复杂代码修复的小模型"之间二选一,而3.8 Flash Cyber能够 在组织自有的云环境内,几分钟就生成可部署的修复方案。

CyberGym——号称在C/C++漏洞发现上排名第一

| CyberGym Pass@1(C/C++漏洞发现) | 得分 |
|---|---|
| Gemini 3.8 Flash Cyber | 86.2% |
| GPT-5.5-Cyber | 85.6% |
| Mythos 5 | 83.8% |
| GPT-5.6 Sol | 83.6% |
| Gemini 3.5 Flash Cyber | 77.5% |
虽然排名第一,但与第二名GPT-5.5-Cyber(85.6%)的差距仅0.6个百分点。反倒更值得关注的是, 相较上一代3.5 Flash Cyber(77.5%),此次提升了8.7个百分点。
CWE-Bench——准确率相近,价格却只有三分之一

横轴为单次运行的平均成本(越靠右越便宜),纵轴为准确率。
| CWE-Bench Pass@1 | 准确率 | 单次运行成本(约) |
|---|---|---|
| Claude Fable 5 | 47.9% | 约$10.3 |
| Gemini 3.8 Flash Cyber | 47.3% | 约$3.6 |
| GPT-5.6 Sol | 44.3% | 约$2.4 |
| Gemini 3.7 Flash | 44.2% | 约$1.5 |
| Opus 4.8 | 42.2% | 约$2.5 |
| Grok 4.6 | 38.4% | 约$2.0 |
| Hy4 Preview | 33.8% | 约$0.8 |
| DeepSeek V4 Flash | 30.5% | 约$0.2 |
准确率排名第一的是Claude Fable 5(47.9%)。3.8 Flash Cyber以47.3%的成绩低了0.6个百分点, 但成本只有前者的三分之一,谷歌正是用帕累托曲线来展示这一点的。 这张图表想说的不是"表现最好",而是**"用差不多的成本做到接近的效果"**。
除了基准测试,谷歌还给出了一个来自真实代码的数字:据称在Chrome代码库上的测试中, 该模型生成的有效修复(valid fixes)数量是对照模型的2.6倍。至于具体对照的是哪个模型, 公告中并未说明。
并非人人可用——Fairwind计划
3.8 Flash Cyber并非面向公众开放。谷歌表示将通过名为Fairwind计划(Fairwind Program)的 专门渠道,优先向国家网络安全机构以及通信、能源等关键服务运营商提供可信访问权限, 理由是保护核心公共基础设施。
发现漏洞并自动生成补丁的能力,对防御方和攻击方同样适用。 将访问范围限定在国家机构和关键行业,本身也说明谷歌意识到了这种两面性。 与此同时,3.8 Flash(普通版)正通过Google Antigravity和AI Studio API陆续部署上线。
编辑观察
"软件工程"和"智能体型知识工作"这两个词反复出现,并非偶然。同一时期,Gemini通过智能体式视频理解功能将Token消耗降低了多达88%,企业端界面里也在试验聊天与任务模式之间的切换开关。这三个动作指向同一个方向——把重心从"擅长回答问题的聊天机器人",转移到"能代替人完成工作的智能体"。
与上一代模型相比,真正能让人感受到差异的不是数字,而是部署方式。架构、训练数据乃至硬件都原封不动地继承自3.7 Flash,这说明谷歌选择的路径不是每次从零开始重造模型,而是在同一框架内以数周为周期反复调优。把这类小数点版本放到实际工作中检验,得出的结论往往差不多——与其期待大幅度的性能飞跃,不如期待它在特定任务上、这次是编程和智能体任务上的细微改进。
对国内企业而言,与其纠结是否要立即引入这款模型,不如更现实一点:在已经使用的Gemini API管线中,只需重新调整effort level参数,就能重新平衡成本与延迟。由于目前尚未公布对照基准数值,现在判断准确率的提升幅度还为时过早,唯一的办法是放到实际工作负载中直接比较。
未来几周内,随着智能体式处理方式扩展应用到Gemini应用和YouTube的"Ask YouTube"功能,3.8 Flash很可能会作为底层模型出现在这些场景中。既然小数点版本更新的速度已经如此之快,下一个版本不是几周后、而是几天后就发布,也不会让人意外。





评论