
요약
- Together AI가 DeepSeek V4 Flash와 GPT-5.6 Luna를 DeepSWE 벤치마크로 비교 분석했다
- 테스트 스위트 검증을 적용한 DeepSeek 우선 캐스케이드가 Luna 단독 실행보다 더 많은 과제를 해결했다
- 이 캐스케이드 방식은 과제당 비용을 37% 낮췄다고 알려졌다
- 발표 주체
- Together AI
- 비교 대상
- DeepSeek V4 Flash vs GPT-5.6 Luna
- 벤치마크
- DeepSWE
- 비용 절감
- 과제당 37% 낮음
- 발행일
- 2026-08-08
Together AI가 DeepSeek V4 Flash와 GPT-5.6 Luna를 DeepSWE 벤치마크에서 비교 분석한 결과를 공개했다. 회사에 따르면 테스트 스위트 검증을 결합한 'DeepSeek 우선 캐스케이드' 방식이 GPT-5.6 Luna를 단독으로 사용했을 때보다 더 많은 과제를 해결한 것으로 나타났다.
무엇이 나왔나
Together AI는 두 모델을 동일한 소프트웨어 엔지니어링 과제 벤치마크인 DeepSWE에서 테스트했다. 단순히 하나의 모델만 쓰는 대신, DeepSeek V4 Flash로 먼저 답을 생성한 뒤 테스트 스위트로 결과를 검증하고 필요시 GPT-5.6 Luna로 넘기는 캐스케이드 구조를 적용했다.
무엇이 달라지는가
이 캐스케이드 방식은 Luna 단독 실행 대비 더 많은 과제를 해결하면서도 과제당 비용은 37% 낮은 것으로 확인됐다. Together AI는 "A DeepSeek-first cascade... solved MORE tasks than Luna alone at 37% lower cost"라고 밝혔다. 구체적인 해결률이나 절대 비용 수치는 공개되지 않아 추가 확인이 필요하다.





댓글