
이미지: X — 인프라·칩
摘要
- Together AI通过DeepSWE基准测试对DeepSeek V4 Flash和GPT-5.6 Luna进行了比较分析
- 采用测试套件验证的DeepSeek优先级联方案解决的任务数量超过Luna单独运行
- 据悉该级联方式将每个任务的成本降低了37%
- 발표 주체
- Together AI
- 비교 대상
- DeepSeek V4 Flash vs GPT-5.6 Luna
- 벤치마크
- DeepSWE
- 비용 절감
- 과제당 37% 낮음
- 발행일
- 2026-08-08
Together AI公布了在DeepSWE基准测试中对DeepSeek V4 Flash与GPT-5.6 Luna进行比较分析的结果。据该公司称,结合测试套件验证的"DeepSeek优先级联"方式所解决的任务数量,超过了单独使用GPT-5.6 Luna时的表现。
测试内容
Together AI在同一个软件工程任务基准测试DeepSWE上对两款模型进行了测试。该方案并未简单地只使用单一模型,而是采用了级联结构:先由DeepSeek V4 Flash生成答案,再通过测试套件验证结果,必要时转交给GPT-5.6 Luna处理。
意味着什么
结果显示,与单独运行Luna相比,该级联方式在解决更多任务的同时,每个任务的成本还降低了37%。Together AI表示:"DeepSeek优先级联方案……以低37%的成本解决了比Luna单独运行更多的任务。"不过,具体的任务解决率或绝对成本数字尚未公开,仍有待进一步确认。



