METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

微软新款编程模型,价格性能均不敌DeepSeek

MAI Code 1.1 Flash较前代有所提升,但仍不及开源模型DeepSeek V4 Flash

微软新款编程模型,价格性能均不敌DeepSeek

图片:METAL

摘要

  • 微软发布了面向GitHub Copilot的代码模型MAI Code 1.1 Flash,宣称其相较前代token效率提升25%、成本降至四分之一水平
  • 该模型在Terminal Bench 2.1测试中得分62.9%,远低于DeepSeek V4 Flash-0731的82.7%,价格也更贵
  • 外界解读认为,微软近期在Copilot中将OpenAI、Anthropic模型替换为自家MAI模型,此举延续了其以削减成本为优先的策略

从数字上看似乎赢了

微软于12日发布了面向GitHub Copilot的代码生成模型"MAI Code 1.1 Flash"。该公司表示,相较于今年6月推出的前代产品MAI-Code-1-Flash,新模型的token效率提高了25%,成本降至原来的四分之一。公司还表示,开发者实际采用该模型生成代码的比例也提升了4个百分点。

训练方式也值得关注。微软表示,该模型是"利用GitHub Copilot内数十万个强化学习环境"训练而成——强化学习是一种模型自行编写代码、并根据结果(是否通过测试等)获得评分从而不断改进的学习方法。这意味着来自真实开发环境的反馈被用作了训练素材。

但打开基准测试表格,情况就变了

问题出在对比对象上。微软公布的基准测试表中,只并列列出了前代产品以及Anthropic、OpenAI的轻量级模型。在这个范围内,MAI Code 1.1 Flash略微领先。但如果把DeepSeek的开源模型DeepSeek-V4-Flash-0731放在同一张表旁边,差距就骤然拉大。

基准测试MAI Code 1.1 FlashMAI Code 1-Flash(前代)Claude Haiku 4.5GPT-5.4 miniDeepSeek V4 Flash-0731
SWE-bench Verified72.6%71.6%69.8%69.2%未公开
Terminal Bench 2.162.9%51.7%49.4%60.7%82.7%

Terminal Bench 2.1是衡量模型在实际终端环境中执行命令、完成任务能力的指标。在这一项目上,DeepSeek领先近20个百分点。

价格也处于下风

不仅是性能。按每token计价,微软的模型也更贵。有分析指出,如果再考虑用量对应的效率,实际差距可能比表中数字显示的更大。

模型输入(每百万token)缓存输入输出
DeepSeek V4 Flash$0.14$0.0028$0.28
MAI Code 1.1 Flash$0.20$0.02$1.20
Claude Haiku 4.5$1.00$0.10$5.00

外媒The Decoder指出,微软在官方发布中回避了这类直接对比,只强调了"代码存活率提升4%、回访率增长9%"之类含糊的改进指标,原始基准测试数据则被埋在了模型卡片深处。

一边称赞开源,一边却不用开源

DeepSeek V4 Flash是一款于今年4月22日发布的开放权重模型。任何人都可以下载其权重,在自有服务器上运行,或在Together AI等平台上通过监督学习、偏好优化等方式直接进行微调。

Together AI 开始支持DeepSeek V4 Flash 0731微调

微软近期多次发出看似支持OpenAI生态系统的信号,但实际行动却背道而驰。此前微软就曾在Copilot中削减OpenAI、Anthropic模型的比重,将自家MAI模型设为默认选项——这是一项即便牺牲性能也要削减成本的决定。The Decoder认为,此次推出的MAI Code 1.1 Flash延续的正是同一逻辑:即便自家模型在性能和价格上都处于劣势,微软仍将资源投入其中,归根结底是出于利润率管理的考量。

那么这会带来什么变化

对Copilot用户而言,目前应用内仍保留多模型可选的结构。但大多数用户会直接使用默认设置。如果微软将自家模型固定为默认选项,就可能形成一种局面:性能和价格均处劣势的模型却占据了市场份额。在开放权重模型的性价比已被基准测试证明的当下,大型科技公司力推闭源模型的算盘究竟能打多久,还需观察此后Copilot定价政策及默认模型设置的变化才能判断。

评论