젬마 4 E2B
Gemma 4 E2B
구글 딥마인드가 만든 소형 비전언어모델로, 이미지와 텍스트를 함께 이해한다.
쉽게 말하면
젬마 4 E2B는 구글 딥마인드가 만든 작은 몸집의 이미지 이해 모델이다. 사진이나 스캔한 문서를 보고 그 안의 내용을 글로 설명하거나 질문에 답할 수 있게 만들어졌다.
덩치가 작다는 건 이 모델의 특징이다. 큰 트럭 대신 자전거를 생각하면 된다. 짐을 아주 많이 실을 순 없지만 가볍고 빠르게 움직일 수 있어서, 성능이 낮은 컴퓨터에서도 돌려볼 수 있다는 장점이 있다.
다만 몸집이 작은 만큼 잘하는 일과 못하는 일이 뚜렷하게 나뉜다. 여러 언어로 된 이미지를 이해하는 일은 비교적 잘하는 편이지만, 사진 속에서 특정 물체를 정확히 짚어내거나 차트를 세밀하게 읽어내는 일은 상대적으로 약한 편으로 나타났다.
기사에서 이렇게 나와요
기사는 코히어의 North Micro Vision을 소개하며 젬마 4 E2B를 비교 대상 중 하나로 함께 표에 올렸다. 문서 이해나 물체 짚어내기 항목에서는 North Micro Vision에 뒤졌지만, 다국어 이미지 이해 항목(MMMB)에서는 오히려 더 높은 점수를 받았다. 이 대목에서 오해하기 쉬운 점은 하나의 비교표만 보고 '젬마 4 E2B가 전반적으로 약하다'고 단정하는 것인데, 실제로는 항목별로 강약이 갈렸다는 게 기사의 핵심이다.