coredot.today
블로그로 돌아가기

#VLM

3개의 포스트

페이지가 아니라 토큰을 고른다 — 멀티모달 문서 RAG의 다음 단계, Doc-REFRAG와 HAM-RAG (RAG 특집 6편)
특집RAG멀티모달 RAG
2026.09.25

페이지가 아니라 토큰을 고른다 — 멀티모달 문서 RAG의 다음 단계, Doc-REFRAG와 HAM-RAG (RAG 특집 6편)

실제 문서 RAG에서 질문 하나에 검색되는 페이지 이미지는 평균 37.4장이다. 한 장이 2,304 시각 토큰인 모델이라면 8만 6천 토큰 — 32K 컨텍스트에는 14장도 안 들어간다. 그래서 다들 상위 5장만 넣고, 정확도는 46.6%에서 멈춘다. EMNLP 2026에 채택된 Doc-REFRAG는 질문을 뒤집는다. ‘어떤 페이지가 관련 있나’가 아니라 ‘검색된 수십 장 중 어떤 영역의 어떤 토큰만 VLM에 넘길 것인가’. 페이지를 108개 청크로 접고 질문이 가리키는 20%만 다시 펴서, 페이지당 150 토큰으로 20장을 다 넣고도 57.5%를 6.1초에 낸다. 같은 달 나온 HAM-RAG는 반대편 문제를 짚는다 — 그림과 텍스트를 낱개로 흩어 놓으면 ‘같은 페이지’라는 이유로 엉뚱한 문장이 붙는다. 문서 계층을 보존하자 이미지 배치 정확도가 24.2% 올랐다. 이 글은 두 연구와 Qwen3-VL 검색 모델을 따라가며, 텍스트 인덱스와 시각 인덱스를 어떻게 한 쌍으로 묶어야 하는지까지 위젯 5종으로 만져 본다.

코어닷투데이45
멀티모달 AI 완전 가이드: 텍스트·이미지·음성·영상을 동시에 이해하는 AI의 모든 것
기술멀티모달 AICLIP
2026.03.19

멀티모달 AI 완전 가이드: 텍스트·이미지·음성·영상을 동시에 이해하는 AI의 모든 것

CLIP이 이미지와 텍스트를 하나의 공간에 넣었고, GPT-4V가 LLM에 눈을 달았고, RT-2가 로봇에게 손을 줬다. 2026년, AI는 인간처럼 보고 듣고 말하고 행동한다 — 멀티모달 AI의 역사, 원리, 그리고 현재.

코어닷투데이22
Molmo & PixMo 완전 해부: GPT-4o에 도전한 '진짜 오픈소스' 비전-언어 모델의 모든 것
기술MolmoPixMo
2026.02.16

Molmo & PixMo 완전 해부: GPT-4o에 도전한 '진짜 오픈소스' 비전-언어 모델의 모든 것

대부분의 오픈소스 비전-언어 모델은 GPT-4V가 생성한 합성 데이터로 훈련된다 — 결국 비공개 AI에 종속되는 셈이다. Allen AI의 Molmo는 사람이 직접 '말로 설명한' 71만 장의 이미지 데이터로 GPT-4o 바로 아래까지 올라갔다. 포인팅, 카운팅, 시계 읽기까지 — 진짜 오픈소스 VLM의 설계 원리를 풀어본다.

코어닷투데이44