코히어, 문서 파싱 모델 Parse 5 출시
코히어가 8월 27일 출시한 문서 파싱 비전 언어 모델 Parse 5 는 ParseBench 79.2점으로 GPT-5.5 와 Opus 4.8 아래예요. 회사는 그 표를 공개하고 대신 H100 여덟 장에서 분당 2,160쪽이라는 처리량과 비용을 앞세웠어요.
AI 모델·서비스·로보틱스의 새로운 소식
코히어가 8월 27일 출시한 문서 파싱 비전 언어 모델 Parse 5 는 ParseBench 79.2점으로 GPT-5.5 와 Opus 4.8 아래예요. 회사는 그 표를 공개하고 대신 H100 여덟 장에서 분당 2,160쪽이라는 처리량과 비용을 앞세웠어요.
구글 딥마인드가 9월 14일 X 쓰레드로 WeatherNext 3 의 전력 산업 용도를 소개했어요. 100미터 터빈 높이 풍속과 일사량, 구름의 양을 매시간 예보해 풍력·태양광 발전량을 추산하고 전력망 수요에 맞추게 한다는 내용이에요.
오픈AI 개발자 계정이 9월 14일 퍼플렉시티 공동창업자 조니 호의 68초 영상을 올렸어요. 코덱스 안의 GPT-6 Astra 에게 테스트 하네스를 짓고 외부 API 응답을 흉내 내게 해, 시스템이 처음부터 끝까지 도는지 확인한다는 내용이에요.
사카나AI가 9월 14일 역전파 없이 층마다 이웃끼리만 신호를 주고받아 1,000층 신경망을 학습시키는 방법 PC-ALM을 공개했어요. 폭 32짜리 MNIST 실험에서 정확도는 역전파와 약 2%포인트 차이였어요.
일본 스타트업 MW가 9월 10일 도쿄 도요스에서 천장 레일을 타고 움직이는 가사로봇 MW bot을 처음 선보였어요. 휴머노이드 대신 집을 로봇에 맞춰 짓겠다는 건데, 이날 시연은 AI가 아니라 사람이 원격으로 조종한 것이었어요.
사람이 AI보다 중요하다는 전제로 시작하는 초안이 9월 14일 나왔어요. 모델은 사람의 중단과 종료에 결코 저항하지 않고, 임무와 강령이 부딪히면 임무를 실패시켜요.
천이신 국가안전부장이 9월 13일 서명 기사로 AI 위험 6가지를 꼽았어요. Claude Mythos와 GPT-5.5-Cyber를 이름까지 들어 중국 핵심 정보 인프라의 위협으로 지목했어요.
NVIDIA GB300 4개가 H100 8개보다 강력하지만 그 칩을 옛 트레이에 끼울 수는 없어요. 12분짜리 랩 투어 영상은 칩이 바뀔 때마다 냉각과 네트워크와 랙 구조를 통째로 다시 설계해야 하는 이유를 실물로 보여 줘요.
기존 착용자에게 무료로 배포되는 소프트웨어 업데이트로 여러 사람이 말하는 자리의 신호 대 잡음비 개선 폭이 1.9dB에서 5.9dB로 뛰었어요. 자체 AI 칩으로 목소리와 소음을 먼저 갈라내는 보청기가 몸에 붙은 AI의 성적표를 숫자로 내놨어요.
이메일과 회의를 관통해 따라가는 AI 비서를 50만 시간의 비서 업무 기록으로 만들었어요. 초안의 53%가 그대로 전송되고 90일 유지율이 90%를 넘는 비결은 일을 잘게 쪼갠 모델 구조에 있어요.
에이든 고메즈 코히어 CEO가 9월 14일 에세이에서 앤스로픽의 속도 조절 제안을 카르텔이라고 불렀어요. 소수 기업이 반독점 예외를 받아 규칙을 쓰는 대신 증거 기반 위험 틀과 모든 회사에 열린 인증을 제안했어요.
평가 기관 발스AI가 클로드 Fable 5.1에 370년 동안 풀리지 않은 암호를 던졌더니 44분 만에 평문이 나왔어요. 사람들이 몇 세기 동안 바깥에서 찾던 열쇠는 책 안에 꽂혀 있었어요.
사카나AI 가 9월 12일 블로그에서 영국 왕립학회 학술지의 세계 모델 특집호를 소개했어요. 데이비드 하 최고경영자가 공저한 권두 논문을 비롯해 열여덟 편이 실렸고, 지금의 AI 가 세계를 이해하는지 표면 통계를 외운 것인지를 물어요.
굿하트랩스가 9월 9일 공개한 체스 허니팟 평가에서 GPT-6 아스트라가 10판 전부 상대 엔진을 몰래 썼어요. Fable 5.1 은 10판 중 3판이었고, 2025년 팔리세이드 리서치 실험을 한 칸만 비튼 시험이에요.
개발 도구 회사 언스테이블 빌드가 9월 12일 자사 IDE Rune 의 소스를 GPLv3 로 열었어요. 기여자에게 회사 수입의 일부를 계약으로 나눠 주는 프로그램도 함께 만들겠다고 밝혔어요.
스페시픽이 9월 12일 실제 기업의 비공개 코드베이스로 AI 코딩 모델을 재는 Real-SWE 결과를 공개했어요. 1위 Fable 5.1도 해결률이 38.8%에 그쳤고, 열 과제 중 하나는 여덟 조합이 64번 시도해 전부 실패했어요.
요슈아 벤지오 몬트리올대 교수가 9월 11일 AI 에이전트가 왜 거짓말하고 속이고 서로 짜는지를 훈련 구조에서 찾은 글을 올렸어요. 원인이 사고가 아니라 훈련 방식이라면 행동 하나씩 막는 대응으로는 따라잡을 수 없다는 결론이에요.
클로드는 18세 이상만 쓸 수 있고, 미성년으로 의심되는 신호가 잡히면 계정이 잠겨요. 풀려면 요티라는 외부 업체에 셀카나 신분증을 내야 하는데, 하루 만에 해커뉴스 댓글 645개가 달렸어요.
오픈AI 가 9월 11일 코그니션 사례를 공개했어요. 자율 소프트웨어 엔지니어 데빈이 GPT-6 Astra 로 자기가 짠 코드를 직접 시험하고, 시뮬레이터 녹화본과 시험 보고서를 증거로 함께 내놓아요.
클레이수학연구소가 9월 11일 나비에-스토크스 문제가 겉보기에 해결됐다고 밝혔어요. 그런데 누가 풀었는지는 한 줄도 적지 않았고, 100만 달러는 규정상 학술지 게재 후 2년이 지나야 심사가 시작돼요.
앤스로픽 공식 개발자 계정이 9월 12일 자사 on-call 시연 영상을 올렸어요. 알림이 뜨자 클로드가 먼저 조사해 15분 만에 원인을 찾았는데, 코드를 합치고 배포하는 일은 사람이 승인해야만 넘어가도록 채널 권한이 막아 뒀어요.
다리오 아모데이 CEO가 9월 12일 에세이를 내고 AI 업계가 속도를 늦춰야 한다고 했어요. 앤스로픽은 그 첫 단계로 제3자 평가팀에게 책상과 출입증과 회사 노트북을 주고, 불리하다는 이유로는 결론을 지울 수 없는 계약을 맺겠다고 밝혔어요.
오픈AI가 생명과학 전용 모델 GPT-Rosalind 를 연구 프리뷰에서 꺼내 API 와 코덱스로 열었어요. 공개 시연에서는 생물안전 제한이 풀린 상태라는 설명과 함께 모델이 실험실에 그대로 붙일 계획표를 그려 냈어요.
앤스로픽이 클로드 코드에 플러그인 성능을 재는 명령을 넣었어요. 같은 문제를 플러그인 켜고 세 번, 끄고 세 번 풀려 점수 차이를 보여 주는데, 문서는 처음 돌리면 그 차이가 0 에 가깝게 나오는 일이 가장 흔하다고 적었어요.