METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

Gemini 3.7 Flash,智能提升4分同时缩短用时

Artificial Analysis测得智能指数56分、每任务耗时1.7分钟,三个月内第三款Flash模型

Gemini 3.7 Flash,智能提升4分同时缩短用时

摘要

  • Google DeepMind的Gemini 3.7 Flash在Artificial Analysis Intelligence Index的high推理档位下获得56分,比前代3.6 Flash(52分)高出4分。
  • 每任务平均耗时从2.0分钟缩短至1.7分钟,每秒约340个token的输出速度支撑了这一提升,使其登上"智能与耗时"帕累托前沿。
  • 官方定价维持每百万token输入1.50美元、输出7.50美元不变,但年底前将适用输入0.50美元、输出3.75美元的折扣价。

Google DeepMind推出的Gemini 3.7 Flash,在基准测试公司Artificial Analysis的测算中平均每个任务耗时1.7分钟。前代Gemini 3.6 Flash处理同一批任务用时2.0分钟。通常模型越聪明速度越慢,但这次分数提升的同时耗时反而减少。

인공지능 모델별 작업당 시간과 지능 지수 비교 그래프와 산점도 차트
이미지: @ArtificialAnlys (X)

提升4分,缩短18秒

Artificial Analysis Intelligence Index是将多项评测综合折算为单一数值、衡量模型综合能力的指标。Gemini 3.7 Flash在high推理强度下获得56分,比3.6 Flash的52分高出4分。带动速度提升的是每秒约340个token的输出速度。结果是该模型登上了"智能与任务耗时"图表中的帕累托前沿——即在相同耗时的模型中最聪明、或在相同智能水平下最快的连线。

不过这并非没有代价。在high推理档位下,3.7 Flash使用的token量比前代多出约40%。每任务平均输出token为37k,与Claude Fable 5或Qwen3.8 Max相近。也就是说,思考时间更长,但吐出结果的速度快得多。

인공지능 모델별 작업당 비용과 지능 지수 비교 그래프와 비용 세부 내역 막대그래프
이미지: @ArtificialAnlys (X)

三档推理强度,该怎么选

此次模型可在low、medium、high三档推理强度之间调节。将数字并列对比后,选择变得清晰。

设置Intelligence Index每任务耗时(分钟)耗时对比
Gemini 3.7 Flash (low)470.926
Gemini 3.7 Flash (medium)511.441
Gemini 3.7 Flash (high)561.750
Gemini 3.6 Flash522.059
Claude Opus 5 (max)638.0100

仅用low设置就能拿到47分,虽不及前代3.6 Flash(52分),但耗时不到一半。相反,顶级选手Claude Opus 5(63分)每个任务要花8分钟。为了7分之差要多花4.7倍时间——实际业务中选择模型的判断,大多在这一点上分道扬镳。

인공지능 모델별 작업당 출력 토큰 수를 나타낸 막대그래프
이미지: @ArtificialAnlys (X)

官方定价不变,年底前是三分之一

价格政策也值得关注。官方定价为每百万token输入1.50美元、输出7.50美元,与3.6 Flash相同。在此基础上,Google将年底前适用输入0.50美元、输出3.75美元的折扣价。Artificial Analysis表示,按此折扣价计算,Intelligence Index每项任务的成本约为0.40美元。

由于该模型多消耗40%的token,按官方定价计算的实际成本高于前代。这一负担目前被年底前的限时折扣所掩盖。

AA-Briefcase Elo와 GDPval-AA v2 지능 평가 점수 막대그래프
이미지: @ArtificialAnlys (X)

电子表格阅读能力位居第一

分差最大的是智能体系列评测。在面向知识型工作任务的Artificial Analysis自研评测AA-Briefcase中,3.7 Flash(high)取得1132 Elo,比前代高169分,略微领先MiniMax-M3。

在针对电子表格和文档进行复杂问答的新设基准AA-AnalystAgent中,该模型以pass^5标准的60%位居榜首。同一评测中,Claude Opus 5(max)为54%,Claude Fable 5为49%。也就是说,在综合智能指数上落后Opus 5 7分的模型,在阅读Excel文件并找出答案这一特定任务上却反超对方。

评测Gemini 3.7 Flash (high)对比模型
Intelligence Index56Claude Opus 5 63 · Grok 4.6 61
AA-Briefcase (Elo)1132较前代 +169,紧邻MiniMax-M3之上
AA-AnalystAgent (pass^5)60%Claude Opus 5 54% · Fable 5 49%
AA-Analyst Agent와 AutomationBench-AA 점수 비교 막대그래프
이미지: @ArtificialAnlys (X)

三个月三款,Flash的速度竞赛

Artificial Analysis指出,这是Google DeepMind三个月内推出的第三款全新Flash模型。Flash系列在Google Gemini产品线中承担着比顶级模型更轻、更便宜、更快的"主力工作"角色。大批量处理、智能体反复调用等场景中,每秒吞吐量比单次的灵光一现更重要。

近来这一市场的竞争重心正从分数本身转向"每分/每美元耗时"。本刊8月12日报道的xAI Grok 4.6在保持与前代相同价格的同时拿下61分的智能指数,而蚂蚁集团Ling 3.0 Tiny则以13亿激活参数拿到25分,推动了"更小更便宜"一端的前沿。3.7 Flash正是在两者之间,以中等价位主攻耗时这一维度的模型。

여러 지능 평가 항목별 인공지능 모델 점수 막대그래프 모음
이미지: @ArtificialAnlys (X)

这意味着什么

对于接入智能体运行实际业务的团队而言,等待时间就是成本。若每天要处理数百次总结数十份文档、或翻查电子表格找答案的任务,每任务0.3分钟的差异会直接转化为吞吐量的差异。3.7 Flash在这一点上,以数据为替代前代提供了依据。

选择方式也相对变得简单:若是以准确度为关键的分析工作选high,若是分类、提取等重复多、难度低的工作则可降至low以节省时间和token。不过这些数字均为第三方评测机构Artificial Analysis的测算值,在实际业务数据中的表现仍需亲自运行验证。折扣价仅到年底为止,这一点在选择引入时机时也需纳入考量。

评论