월~금 오전 7시, 일요일 오전 8시 — AI 뉴스와 용어를 보내드립니다메일로 받아보기

METAL LAB

liustack/modlens

3,616이번 주 +809TypeScript

텍스트만 읽는 DeepSeek 같은 AI 모델이 이미지를 붙여넣으면 그 내용을 구조화된 텍스트로 바꿔 '보게' 해주는 플러그인

ModLens는 DeepSeek, GLM처럼 이미지를 읽지 못하는 텍스트 전용 채팅 모델에게 이미지 이해 능력을 붙여주는 플러그인이다. 사용자가 이미지를 붙여넣으면 별도의 비전(영상 인식) 엔진이 이를 분석해 텍스트 전사, 레이아웃, 개체 정보가 담긴 JSON 데이터로 바꿔 모델에게 넘겨준다. 설치는 플러그인 하나 또는 스킬 폴더 하나만 추가하면 되고, 유료 비전 API 없이도 이미 로그인된 다른 도구의 계정을 재사용할 수 있다.

무엇을 하는 레포인가

  1. 무엇을 했나: DeepSeek나 GLM 같은 텍스트 전용 모델은 이미지를 직접 읽지 못하는데, ModLens는 붙여넣은 이미지를 가로채 비전 엔진에 보낸 뒤 원본 픽셀이 아니라 전체 텍스트 전사, 읽는 순서대로 정리된 레이아웃 영역, 개체·관계 목록이 담긴 구조화된 JSON 형태로 모델에 돌려준다.
  2. 어떻게 했나: 총 10가지 비전 소스를 지원하는데, 여기에는 여섯 개의 내장 제공자(Gemini API, OpenAI 호환 엔드포인트, Anthropic, 무료 Antigravity CLI, Claude Code, Kimi Code)와 사용자가 이미 로그인해 둔 다른 로컬 에이전트 CLI 네 개(Codex, OpenCode, Pi, Grok)의 재사용이 포함되며, 하나가 실패하면 다음 것을 자동으로 시도하는 방식으로 연결되고 모든 시도 내역은 'meta.attempts'에 기록된다.
  3. 설치가 매우 가볍다: DeepSeek Harness에서는 명령줄 한 줄로 플러그인을 설치하고, Claude Code, Codex, OpenCode, Pi 같은 다른 도구에서는 스킬 폴더 하나만 추가하면 되며 기존 설정을 바꾸지 않고, 삭제도 그 폴더만 지우면 된다.
  4. 결과로 보여준 사례: 텍스트 전용 DeepSeek-V4-Flash 모델로 시연했을 때, 트윗 스크린샷에서 조회수 540만, 답글 1600개, 리포스트 5700개, 좋아요 11만6000개 같은 정확한 참여 지표를 읽어냈고, 128개 AI 모델을 비교한 복잡한 산점도에서도 축, 로그 스케일, 강조 영역까지 정확히 해석했다.
  5. 속도와 비용은 소스에 따라 다르다: 내장 API 제공자는 응답에 약 5~10초가 걸리고, 재사용하는 에이전트 CLI는 약 15~45초가 걸리며, 추천되는 무료 시작 방법은 Gemini API 키를 발급받는 것이다.

왜 중요한가

코딩·채팅에 널리 쓰이는 많은 AI 모델이 텍스트만 처리하기 때문에 스크린샷이나 차트, UI 시안을 붙여넣어도 원래는 아무 답도 받지 못한다. 이 플러그인은 모델을 바꾸거나 기존 에이전트 환경을 다시 구축하지 않고도 이 한계를 없애 주며, 스타 3616개라는 인기는 값싸고 손쉬운 비전 기능에 대한 실제 수요를 보여준다.

이 레포의 용어

  • 비전 엔진 · 이미지를 실제로 분석하고 이해할 수 있는 AI 서비스나 모델
  • OCR · 이미지 속 글자를 인식해 텍스트로 뽑아내는 기술
  • 페일오버 체인 · 하나가 실패하면 다음 대체 수단을 자동으로 시도하는 순서
  • OpenAI 호환 엔드포인트 · OpenAI의 요청 형식을 그대로 따르는 API 서버로, OpenAI용으로 만든 도구를 그대로 연결할 수 있음
  • 스킬/플러그인 폴더 · 기존 설정을 건드리지 않고 AI 에이전트 도구에 새 기능을 추가하는 독립된 파일 묶음

레포 원문 소개 (영문)

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得结构化 JSON 证据(OCR、版面、语义)。

GitHub에서 보기

주목받는 레포

레포 전체 보기 →

METAL LAB 최신 기사