
이미지: METAL
요약
- 마이크로소프트가 깃허브 코파일럿용 코드 모델 MAI Code 1.1 Flash를 출시, 전작보다 토큰 효율 25% 개선·비용 4분의 1 수준을 내세웠다
- Terminal Bench 2.1에서 62.9%를 기록했지만 딥시크 V4 플래시-0731의 82.7%에 크게 못 미쳤고 가격도 더 비쌌다
- 마이크로소프트는 최근 코파일럿에서 오픈AI·앤스로픽 모델을 자사 MAI 모델로 교체하며 비용 절감을 우선한 전략을 이어가는 것으로 풀이된다
- 신모델
- MAI Code 1.1 Flash (마이크로소프트, 깃허브 코파일럿용)
- 개선점
- 전작 대비 토큰 효율 25% 향상, 비용은 4분의 1 수준
- SWE-bench Verified
- 72.6% (전작 71.6%, 클로드 하이쿠 4.5 69.8%, GPT-5.4 미니 69.2%)
- Terminal Bench 2.1
- 62.9% — 딥시크 V4 플래시-0731(82.7%)에 크게 못 미침
- 출력 토큰 가격(백만 토큰당)
- MAI 1.20달러 vs 딥시크 V4 플래시 0.28달러
- 개발자 코드 수용률
- 전작보다 4%p 상승, 재방문율 9% 증가(마이크로소프트 발표 기준)
숫자로 보면 이긴 것 같은데
마이크로소프트가 12일 깃허브 코파일럿용 코드 생성 모델 'MAI Code 1.1 Flash'를 내놨다. 전작인 MAI-Code-1-Flash(지난 6월 출시)보다 토큰 효율이 25% 높아졌고 비용은 4분의 1 수준으로 줄었다고 밝혔다. 개발자들이 이 모델이 생성한 코드를 실제로 채택한 비율도 4%포인트 올랐다고 회사는 설명했다.
학습 방식도 눈에 띈다. 마이크로소프트는 "깃허브 코파일럿 안에서 수십만 개의 강화학습 환경"을 활용해 이 모델을 훈련했다고 밝혔다. 강화학습 — 모델이 스스로 코드를 짜보고 결과(테스트 통과 여부 등)에 따라 점수를 받아가며 개선하는 학습법이다. 실제 개발 환경에서 나온 피드백을 훈련 재료로 삼았다는 뜻이다.
벤치마크 표를 펼쳐보면 얘기가 달라진다
문제는 비교 대상이다. 마이크로소프트가 공개한 벤치마크 표에는 전작과 앤스로픽·오픈AI의 경량 모델만 나란히 놓여 있다. 그 안에서는 MAI Code 1.1 Flash가 근소하게 앞선다. 하지만 같은 표 옆에 딥시크의 오픈소스 모델 DeepSeek-V4-Flash-0731을 놓으면 격차가 확 벌어진다.
| 벤치마크 | MAI Code 1.1 Flash | MAI Code 1-Flash(전작) | 클로드 하이쿠 4.5 | GPT-5.4 미니 | 딥시크 V4 플래시-0731 |
|---|---|---|---|---|---|
| SWE-bench Verified | 72.6% | 71.6% | 69.8% | 69.2% | 미공개 |
| Terminal Bench 2.1 | 62.9% | 51.7% | 49.4% | 60.7% | 82.7% |
Terminal Bench 2.1은 모델이 실제 터미널 환경에서 명령을 실행해 작업을 끝내는 능력을 재는 지표다. 이 항목에서 딥시크가 20%포인트 가까이 앞섰다.
가격도 밀린다
성능만이 아니다. 토큰당 가격에서도 마이크로소프트 모델이 더 비싸다. 사용량 대비 효율까지 따지면 실제 격차는 표에 나온 숫자보다 더 클 수 있다는 지적도 나온다.
| 모델 | 입력(백만 토큰당) | 캐시 입력 | 출력 |
|---|---|---|---|
| 딥시크 V4 플래시 | $0.14 | $0.0028 | $0.28 |
| MAI Code 1.1 Flash | $0.20 | $0.02 | $1.20 |
| 클로드 하이쿠 4.5 | $1.00 | $0.10 | $5.00 |
외신 더디코더는 마이크로소프트가 공식 발표문에서 이런 직접 비교를 피하고 "코드 생존율 4% 상승, 재방문율 9% 증가" 같은 모호한 개선 지표만 강조했다고 지적했다. 벤치마크 원자료는 모델 카드 안쪽에 묻혀 있었다는 설명이다.
오픈소스를 칭찬하면서 왜 오픈소스를 안 쓸까
딥시크 V4 플래시는 지난 4월 22일 공개된 오픈 웨이트 모델이다. 누구나 가중치를 내려받아 자체 서버에서 돌리거나, Together AI 같은 플랫폼에서 지도학습·선호도 최적화 방식으로 직접 파인튜닝할 수 있다.
Together AI, DeepSeek V4 Flash 0731 파인튜닝 지원 시작
마이크로소프트는 최근 오픈AI 생태계를 지지하는 듯한 메시지를 여러 차례 내놨다. 하지만 실제 행동은 반대로 간다. 앞서 코파일럿에서 오픈AI·앤스로픽 모델 비중을 줄이고 자체 MAI 모델을 기본값으로 넣는 개편을 진행한 바 있는데, 성능을 낮추더라도 비용을 줄이는 쪽을 택한 결정이었다. 이번 MAI Code 1.1 Flash도 같은 흐름 위에 있다는 게 더디코더의 시각이다. 성능과 가격 모두 뒤처지는 자체 모델에 자원을 쏟는 이유는 결국 마진 관리라는 지적이다.
그래서 무엇이 달라지나
코파일럿 사용자 입장에서는 당장 앱 안에서 여러 모델 중 하나를 고를 수 있는 구조가 유지된다. 하지만 대부분의 사용자는 기본값을 그대로 쓴다. 마이크로소프트가 자사 모델을 기본값으로 굳히면, 성능과 가격에서 밀리는 모델이 시장 점유율을 그대로 가져가는 구조가 만들어질 수 있다. 오픈 웨이트 모델의 가성비가 이미 벤치마크로 증명되는 시점에서, 폐쇄형 모델을 밀어붙이는 빅테크의 셈법이 어디까지 통할지는 이후 코파일럿 가격 정책과 기본 모델 설정 변화를 지켜봐야 가늠할 수 있다.





댓글