每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Together AI公布DeepSeek与GPT-5.6 Luna级联测试结果

在DeepSWE基准测试中,DeepSeek优先级联方案解决的任务数量超过Luna单独运行

이미지: X — 인프라·칩

摘要

  • Together AI通过DeepSWE基准测试对DeepSeek V4 Flash和GPT-5.6 Luna进行了比较分析
  • 采用测试套件验证的DeepSeek优先级联方案解决的任务数量超过Luna单独运行
  • 据悉该级联方式将每个任务的成本降低了37%
原文视频
발표 주체
Together AI
비교 대상
DeepSeek V4 Flash vs GPT-5.6 Luna
벤치마크
DeepSWE
비용 절감
과제당 37% 낮음
발행일
2026-08-08

Together AI公布了在DeepSWE基准测试中对DeepSeek V4 Flash与GPT-5.6 Luna进行比较分析的结果。据该公司称,结合测试套件验证的"DeepSeek优先级联"方式所解决的任务数量,超过了单独使用GPT-5.6 Luna时的表现。

测试内容

Together AI在同一个软件工程任务基准测试DeepSWE上对两款模型进行了测试。该方案并未简单地只使用单一模型,而是采用了级联结构:先由DeepSeek V4 Flash生成答案,再通过测试套件验证结果,必要时转交给GPT-5.6 Luna处理。

意味着什么

结果显示,与单独运行Luna相比,该级联方式在解决更多任务的同时,每个任务的成本还降低了37%。Together AI表示:"DeepSeek优先级联方案……以低37%的成本解决了比Luna单独运行更多的任务。"不过,具体的任务解决率或绝对成本数字尚未公开,仍有待进一步确认。