
图片:METAL
摘要
- 微软发布了面向GitHub Copilot的代码模型MAI Code 1.1 Flash,宣称其相较前代token效率提升25%、成本降至四分之一水平
- 该模型在Terminal Bench 2.1测试中得分62.9%,远低于DeepSeek V4 Flash-0731的82.7%,价格也更贵
- 外界解读认为,微软近期在Copilot中将OpenAI、Anthropic模型替换为自家MAI模型,此举延续了其以削减成本为优先的策略
从数字上看似乎赢了
微软于12日发布了面向GitHub Copilot的代码生成模型"MAI Code 1.1 Flash"。该公司表示,相较于今年6月推出的前代产品MAI-Code-1-Flash,新模型的token效率提高了25%,成本降至原来的四分之一。公司还表示,开发者实际采用该模型生成代码的比例也提升了4个百分点。
训练方式也值得关注。微软表示,该模型是"利用GitHub Copilot内数十万个强化学习环境"训练而成——强化学习是一种模型自行编写代码、并根据结果(是否通过测试等)获得评分从而不断改进的学习方法。这意味着来自真实开发环境的反馈被用作了训练素材。
但打开基准测试表格,情况就变了
问题出在对比对象上。微软公布的基准测试表中,只并列列出了前代产品以及Anthropic、OpenAI的轻量级模型。在这个范围内,MAI Code 1.1 Flash略微领先。但如果把DeepSeek的开源模型DeepSeek-V4-Flash-0731放在同一张表旁边,差距就骤然拉大。
| 基准测试 | MAI Code 1.1 Flash | MAI Code 1-Flash(前代) | Claude Haiku 4.5 | GPT-5.4 mini | DeepSeek V4 Flash-0731 |
|---|---|---|---|---|---|
| SWE-bench Verified | 72.6% | 71.6% | 69.8% | 69.2% | 未公开 |
| Terminal Bench 2.1 | 62.9% | 51.7% | 49.4% | 60.7% | 82.7% |
Terminal Bench 2.1是衡量模型在实际终端环境中执行命令、完成任务能力的指标。在这一项目上,DeepSeek领先近20个百分点。
价格也处于下风
不仅是性能。按每token计价,微软的模型也更贵。有分析指出,如果再考虑用量对应的效率,实际差距可能比表中数字显示的更大。
| 模型 | 输入(每百万token) | 缓存输入 | 输出 |
|---|---|---|---|
| DeepSeek V4 Flash | $0.14 | $0.0028 | $0.28 |
| MAI Code 1.1 Flash | $0.20 | $0.02 | $1.20 |
| Claude Haiku 4.5 | $1.00 | $0.10 | $5.00 |
外媒The Decoder指出,微软在官方发布中回避了这类直接对比,只强调了"代码存活率提升4%、回访率增长9%"之类含糊的改进指标,原始基准测试数据则被埋在了模型卡片深处。
一边称赞开源,一边却不用开源
DeepSeek V4 Flash是一款于今年4月22日发布的开放权重模型。任何人都可以下载其权重,在自有服务器上运行,或在Together AI等平台上通过监督学习、偏好优化等方式直接进行微调。
Together AI 开始支持DeepSeek V4 Flash 0731微调
微软近期多次发出看似支持OpenAI生态系统的信号,但实际行动却背道而驰。此前微软就曾在Copilot中削减OpenAI、Anthropic模型的比重,将自家MAI模型设为默认选项——这是一项即便牺牲性能也要削减成本的决定。The Decoder认为,此次推出的MAI Code 1.1 Flash延续的正是同一逻辑:即便自家模型在性能和价格上都处于劣势,微软仍将资源投入其中,归根结底是出于利润率管理的考量。
那么这会带来什么变化
对Copilot用户而言,目前应用内仍保留多模型可选的结构。但大多数用户会直接使用默认设置。如果微软将自家模型固定为默认选项,就可能形成一种局面:性能和价格均处劣势的模型却占据了市场份额。在开放权重模型的性价比已被基准测试证明的当下,大型科技公司力推闭源模型的算盘究竟能打多久,还需观察此后Copilot定价政策及默认模型设置的变化才能判断。





评论