
이미지: METAL LAB 생성
摘要
- 微软发布了面向GitHub Copilot的代码模型MAI Code 1.1 Flash,宣称相比前代模型令牌效率提升25%、成本降至四分之一
- 该模型在Terminal Bench 2.1上得分62.9%,远低于DeepSeek V4 Flash-0731的82.7%,且价格更高
- 业界解读认为,微软近期在Copilot中将OpenAI、Anthropic的模型替换为自家MAI模型,此举延续了以削减成本为优先的战略
- 신모델
- MAI Code 1.1 Flash (마이크로소프트, 깃허브 코파일럿용)
- 개선점
- 전작 대비 토큰 효율 25% 향상, 비용은 4분의 1 수준
- SWE-bench Verified
- 72.6% (전작 71.6%, 클로드 하이쿠 4.5 69.8%, GPT-5.4 미니 69.2%)
- Terminal Bench 2.1
- 62.9% — 딥시크 V4 플래시-0731(82.7%)에 크게 못 미침
- 출력 토큰 가격(백만 토큰당)
- MAI 1.20달러 vs 딥시크 V4 플래시 0.28달러
- 개발자 코드 수용률
- 전작보다 4%p 상승, 재방문율 9% 증가(마이크로소프트 발표 기준)
从数字上看似乎赢了
微软于12日推出了面向GitHub Copilot的代码生成模型"MAI Code 1.1 Flash"。该公司表示,与今年6月发布的前代模型MAI-Code-1-Flash相比,令牌效率提升了25%,成本降至四分之一水平。微软还表示,开发者实际采纳该模型生成代码的比例也提高了4个百分点。
其训练方式也颇为引人注目。微软表示,该模型是"在GitHub Copilot内部利用数十万个强化学习环境"训练而成的。强化学习——是一种模型通过自行编写代码、并根据结果(是否通过测试等)获得评分从而不断改进的学习方法。这意味着模型是以真实开发环境中产生的反馈作为训练素材的。
打开基准测试表格 情况就不一样了
问题在于对比对象。微软公布的基准测试表格中,只并列列出了前代模型以及Anthropic、OpenAI的轻量级模型。在这个范围内,MAI Code 1.1 Flash略占优势。但如果在同一表格中加入DeepSeek的开源模型DeepSeek-V4-Flash-0731进行对比,差距就会明显拉大。
| 基准测试 | MAI Code 1.1 Flash | MAI Code 1-Flash(前代) | Claude Haiku 4.5 | GPT-5.4 mini | DeepSeek V4 Flash-0731 |
|---|---|---|---|---|---|
| SWE-bench Verified | 72.6% | 71.6% | 69.8% | 69.2% | 未公开 |
| Terminal Bench 2.1 | 62.9% | 51.7% | 49.4% | 60.7% | 82.7% |
Terminal Bench 2.1是衡量模型在真实终端环境中执行命令完成任务能力的指标。在这一项上,DeepSeek领先近20个百分点。
价格也处于劣势
不仅是性能。在每令牌价格上,微软的模型也更贵。有人指出,若再考虑使用效率,实际差距可能比表格数字显示的更大。
| 模型 | 输入(每百万令牌) | 缓存输入 | 输出 |
|---|---|---|---|
| DeepSeek V4 Flash | $0.14 | $0.0028 | $0.28 |
| MAI Code 1.1 Flash | $0.20 | $0.02 | $1.20 |
| Claude Haiku 4.5 | $1.00 | $0.10 | $5.00 |
外媒The Decoder指出,微软在官方发布文中回避了这类直接对比,只强调了"代码存活率提升4%、复访率增加9%"之类含糊的改进指标。据称,基准测试原始数据被埋在模型卡片深处,不易察觉。
一边称赞开源 一边却不用开源
DeepSeek V4 Flash是今年4月22日发布的开放权重模型。任何人都可以下载其权重在自有服务器上运行,或在Together AI等平台上通过监督学习、偏好优化等方式直接进行微调。
Together AI 开始支持DeepSeek V4 Flash 0731微调
微软近期多次发出看似支持开放AI生态的信号。但实际行动却恰恰相反。此前,微软已在Copilot中降低了OpenAI、Anthropic模型的占比,转而将自家MAI模型设为默认选项,这是一项即便牺牲性能也优先削减成本的决定。The Decoder认为,此次推出的MAI Code 1.1 Flash同样延续了这一路线。有分析指出,将资源投入到性能和价格均落后的自研模型上,归根结底是出于利润管理的考虑。
那么会有什么变化
对Copilot用户而言,目前应用内仍保留可在多个模型中自由选择的结构。但大多数用户会直接使用默认设置。一旦微软将自家模型固定为默认选项,就可能形成这样一种结构:性能和价格均处于劣势的模型,反而能够原样获得市场份额。在开放权重模型的性价比已经通过基准测试得到证明的当下,大型科技公司执意推广封闭模型的算盘究竟能行得通到什么程度,还需观察此后Copilot的定价政策以及默认模型设置的变化才能判断。



