METAL

태그

벤치마크

AI

텐센트 훈위안, EvolveScaler 논문 공개

텐센트 훈위안 팀이 9월 15일 정보 진화 데이터 프레임워크 EvolveScaler 논문과 프로젝트 페이지를 공개했어요. 상태를 코드로 먼저 정의하고 자연어로 렌더링해 만든 데이터로 모델 14개를 재니, 가장 긴 단계에서 avg@5 중앙값이 11.3 까지 떨어졌어요.

By 김현국

00

AI

스페시픽, 기업 코드 벤치마크 Real-SWE 공개

스페시픽이 9월 12일 실제 기업의 비공개 코드베이스로 AI 코딩 모델을 재는 Real-SWE 결과를 공개했어요. 1위 Fable 5.1도 해결률이 38.8%에 그쳤고, 열 과제 중 하나는 여덟 조합이 64번 시도해 전부 실패했어요.

By 김현국

30

AI

사카나AI, 모델 고르는 모델 두 개 냈다

일본 사카나AI가 9월 11일 여러 모델을 대신 골라 주는 조율 모델 두 종을 내놨어요. 싼 쪽은 출력 요금을 경쟁 모델보다 40에서 60% 낮췄고, 센 쪽은 Fable 5.1도 GPT-6 Astra도 풀에 넣지 않은 채 최고 점수를 냈어요.

By 김현국

20

AI

AI 설계 단백질, 예측과 실험이 갈렸다

클로드가 설계한 바인더 1,320개 가운데 354개가 붙었고, 표적 15개 중 14개를 뚫었어요. 사람 대회 적중률 3.7%짜리 표적에서 40%가 나왔는데, 정작 만들기 전에 고르는 일은 여전히 어려워요.

By 김현국

170