
摘要
- Google DeepMind的Gemini 3.7 Flash在Artificial Analysis Intelligence Index的high推理档位下获得56分,比前代3.6 Flash(52分)高出4分。
- 每任务平均耗时从2.0分钟缩短至1.7分钟,每秒约340个token的输出速度支撑了这一提升,使其登上"智能与耗时"帕累托前沿。
- 官方定价维持每百万token输入1.50美元、输出7.50美元不变,但年底前将适用输入0.50美元、输出3.75美元的折扣价。
Google DeepMind推出的Gemini 3.7 Flash,在基准测试公司Artificial Analysis的测算中平均每个任务耗时1.7分钟。前代Gemini 3.6 Flash处理同一批任务用时2.0分钟。通常模型越聪明速度越慢,但这次分数提升的同时耗时反而减少。

提升4分,缩短18秒
Artificial Analysis Intelligence Index是将多项评测综合折算为单一数值、衡量模型综合能力的指标。Gemini 3.7 Flash在high推理强度下获得56分,比3.6 Flash的52分高出4分。带动速度提升的是每秒约340个token的输出速度。结果是该模型登上了"智能与任务耗时"图表中的帕累托前沿——即在相同耗时的模型中最聪明、或在相同智能水平下最快的连线。
不过这并非没有代价。在high推理档位下,3.7 Flash使用的token量比前代多出约40%。每任务平均输出token为37k,与Claude Fable 5或Qwen3.8 Max相近。也就是说,思考时间更长,但吐出结果的速度快得多。

三档推理强度,该怎么选
此次模型可在low、medium、high三档推理强度之间调节。将数字并列对比后,选择变得清晰。
| 设置 | Intelligence Index | 每任务耗时(分钟) | 耗时对比 |
|---|---|---|---|
| Gemini 3.7 Flash (low) | 47 | 0.9 | 26 |
| Gemini 3.7 Flash (medium) | 51 | 1.4 | 41 |
| Gemini 3.7 Flash (high) | 56 | 1.7 | 50 |
| Gemini 3.6 Flash | 52 | 2.0 | 59 |
| Claude Opus 5 (max) | 63 | 8.0 | 100 |
仅用low设置就能拿到47分,虽不及前代3.6 Flash(52分),但耗时不到一半。相反,顶级选手Claude Opus 5(63分)每个任务要花8分钟。为了7分之差要多花4.7倍时间——实际业务中选择模型的判断,大多在这一点上分道扬镳。

官方定价不变,年底前是三分之一
价格政策也值得关注。官方定价为每百万token输入1.50美元、输出7.50美元,与3.6 Flash相同。在此基础上,Google将年底前适用输入0.50美元、输出3.75美元的折扣价。Artificial Analysis表示,按此折扣价计算,Intelligence Index每项任务的成本约为0.40美元。
由于该模型多消耗40%的token,按官方定价计算的实际成本高于前代。这一负担目前被年底前的限时折扣所掩盖。

电子表格阅读能力位居第一
分差最大的是智能体系列评测。在面向知识型工作任务的Artificial Analysis自研评测AA-Briefcase中,3.7 Flash(high)取得1132 Elo,比前代高169分,略微领先MiniMax-M3。
在针对电子表格和文档进行复杂问答的新设基准AA-AnalystAgent中,该模型以pass^5标准的60%位居榜首。同一评测中,Claude Opus 5(max)为54%,Claude Fable 5为49%。也就是说,在综合智能指数上落后Opus 5 7分的模型,在阅读Excel文件并找出答案这一特定任务上却反超对方。
| 评测 | Gemini 3.7 Flash (high) | 对比模型 |
|---|---|---|
| Intelligence Index | 56 | Claude Opus 5 63 · Grok 4.6 61 |
| AA-Briefcase (Elo) | 1132 | 较前代 +169,紧邻MiniMax-M3之上 |
| AA-AnalystAgent (pass^5) | 60% | Claude Opus 5 54% · Fable 5 49% |

三个月三款,Flash的速度竞赛
Artificial Analysis指出,这是Google DeepMind三个月内推出的第三款全新Flash模型。Flash系列在Google Gemini产品线中承担着比顶级模型更轻、更便宜、更快的"主力工作"角色。大批量处理、智能体反复调用等场景中,每秒吞吐量比单次的灵光一现更重要。
近来这一市场的竞争重心正从分数本身转向"每分/每美元耗时"。本刊8月12日报道的xAI Grok 4.6在保持与前代相同价格的同时拿下61分的智能指数,而蚂蚁集团Ling 3.0 Tiny则以13亿激活参数拿到25分,推动了"更小更便宜"一端的前沿。3.7 Flash正是在两者之间,以中等价位主攻耗时这一维度的模型。

这意味着什么
对于接入智能体运行实际业务的团队而言,等待时间就是成本。若每天要处理数百次总结数十份文档、或翻查电子表格找答案的任务,每任务0.3分钟的差异会直接转化为吞吐量的差异。3.7 Flash在这一点上,以数据为替代前代提供了依据。
选择方式也相对变得简单:若是以准确度为关键的分析工作选high,若是分类、提取等重复多、难度低的工作则可降至low以节省时间和token。不过这些数字均为第三方评测机构Artificial Analysis的测算值,在实际业务数据中的表现仍需亲自运行验证。折扣价仅到年底为止,这一点在选择引入时机时也需纳入考量。





评论