
이미지: X — 벤치마크·평가 화면 갈무리
摘要
- 谷歌DeepMind的Gemini 3.7 Flash在Artificial Analysis Intelligence Index的high推理档位下获得56分,比上一代3.6 Flash(52分)提升4分。
- 单任务平均耗时从2.0分钟缩短至1.7分钟,约每秒340个token的输出速度支撑了这一表现,使其跻身"智能与耗时"帕累托前沿。
- 官方定价维持每百万token输入1.50美元、输出7.50美元不变,但年底前适用输入0.50美元、输出3.75美元的折扣价。
- 모델
- Gemini 3.7 Flash (개발: Google DeepMind)
- Intelligence Index
- high 56점 · medium 51점 · low 47점 (전작 3.6 Flash 52점)
- 과제당 시간
- high 1.7분 · medium 1.4분 · low 0.9분 (3.6 Flash는 2.0분)
- 출력 속도
- 초당 약 340토큰
- 가격
- 정가 100만 토큰당 입력 1.50달러 / 출력 7.50달러, 연말까지 할인가 0.50달러 / 3.75달러
- 토큰 사용량
- high 기준 과제당 평균 37k 출력 토큰, 전작 대비 약 40% 증가
- AA-Briefcase
- 1132 Elo, 전작 대비 +169로 MiniMax-M3 바로 위
- AA-AnalystAgent
- pass^5 60%로 1위 (Claude Opus 5 max 54%, Claude Fable 5 49%)
谷歌DeepMind推出的Gemini 3.7 Flash,在基准测试公司Artificial Analysis的测量中,平均1.7分钟完成一项任务。上一代Gemini 3.6 Flash在同一任务组合上耗时2.0分钟。通常模型越聪明速度就越慢,但这一次分数提升的同时用时反而缩短了。

提升4分,缩短18秒
Artificial Analysis Intelligence Index是将多项评测汇总、把模型综合能力换算成单一数值的指标。Gemini 3.7 Flash在high推理强度下获得56分,比3.6 Flash的52分高出4分。带动速度提升的是约每秒340个token的输出速度。结果,该模型在"智能对比任务耗时"图表上,跻身帕累托前沿——即在相同用时的模型中最聪明、或在相同智能水平下最快的那条连线。
不过这并非没有代价。在high推理档位下,3.7 Flash所用的token比上一代多出约40%。单任务平均输出token为37k,与Claude Fable 5或Qwen3.8 Max相近。也就是说,这是一种"思考更久、但把思考结果吐得快得多"的结构。


三档推理强度,如何选择
这款模型可在low、medium、high三档之间调节推理强度。把数字并排放在一起,选择就变得清晰了。
| 设置 | Intelligence Index | 单任务耗时(分钟) | 时间对比 |
|---|---|---|---|
| Gemini 3.7 Flash (low) | 47 | 0.9 | 26 |
| Gemini 3.7 Flash (medium) | 51 | 1.4 | 41 |
| Gemini 3.7 Flash (high) | 56 | 1.7 | 50 |
| Gemini 3.6 Flash | 52 | 2.0 | 59 |
| Claude Opus 5 (max) | 63 | 8.0 | 100 |
仅用low设置就能得到47分。虽不及上一代3.6 Flash(52分),但用时不到一半。相反,处于顶尖水平的Claude Opus 5(63分)单任务耗时8分钟。为了7分之差要多花4.7倍的时间——在实际业务中选择模型的判断,大多在这一点上产生分歧。

官方定价不变,年底前为三分之一
价格政策也值得关注。官方定价为每百万token输入1.50美元、输出7.50美元,与3.6 Flash相同。在此基础上,谷歌在年底前提供输入0.50美元、输出3.75美元的折扣价。Artificial Analysis表示,按此折扣价计算,Intelligence Index每完成一项任务的成本约为0.40美元。
由于该模型多消耗40%的token,按官方定价计算的实际成本比上一代更高。这部分负担目前由年底前的限时折扣来覆盖。

读懂电子表格的能力排名第一
分数差距最大的地方出现在智能体相关评测上。在处理知识型工作任务的Artificial Analysis自有评测AA-Briefcase中,3.7 Flash(high)获得1132 Elo,比上一代高169分,略微领先MiniMax-M3。
在让模型面对电子表格和文档回答复杂问题的新设基准AA-AnalystAgent中,该模型以pass^5标准下60%的成绩位居榜首。同一评测中,Claude Opus 5(max)为54%,Claude Fable 5为49%。也就是说,在综合智能指数上落后Opus 5 7分的模型,在读取Excel文件并找出答案这一特定任务上反而领先。
| 评测 | Gemini 3.7 Flash (high) | 对比模型 |
|---|---|---|
| Intelligence Index | 56 | Claude Opus 5 63 · Grok 4.6 61 |
| AA-Briefcase (Elo) | 1132 | 较上一代+169,紧随MiniMax-M3之后 |
| AA-AnalystAgent (pass^5) | 60% | Claude Opus 5 54% · Fable 5 49% |

三个月三次,Flash的速度战
Artificial Analysis指出,这是谷歌DeepMind三个月内推出的第三款全新Flash模型。Flash系列在谷歌Gemini产品线中扮演着比顶级模型更轻、更便宜、更快的"主力工作模型"角色。它的舞台是大批量处理和智能体反复调用这类场景,这里重要的不是一次性的天才表现,而是每秒的处理量。
近来这一市场的竞争重心,正从分数本身转向"每分数所需的时间与成本"。我们此前于8月12日报道过,xAI的Grok 4.6拿到61分的智能指数,同时维持与上一代相同的价格;蚂蚁集团的Ling 3.0 Tiny以13亿激活参数拿到25分,推动了"更小更便宜"这条前沿线。而3.7 Flash则处于两者之间,在中等价位段主攻时间轴这一维度。

那么,改变了什么
对于接入智能体、实际运行业务的团队来说,等待时间就是成本。如果每天要运行数百次汇总二十份文档或翻查电子表格找答案这类任务,单任务0.3分钟的差异会直接转化为处理量的差异。3.7 Flash在这一点上,用数字给出了替代上一代的依据。
选择的诀窍也相对变得简单:如果是以准确率为关键的分析类工作,选high;如果是分类、提取这类重复多、难度低的工作,则可降到low档,节省时间和token。不过,以上数值均为第三方评测机构Artificial Analysis的测量结果,在实际业务数据中的表现仍需亲自测试确认。折扣价仅持续到年底这一点,也是决定引入时机时需要一并纳入考量的变量。



