블로그로 돌아가기


#멀티모달
3개의 포스트

특집인터랙션 모델Thinking Machines
2026.08.12인터랙션 모델: AI가 드디어 '말하면서 듣기' 시작했다
2026년 5월, Thinking Machines Lab이 '인터랙션 모델'을 공개했다. 200ms 마이크로턴, 인코더 없는 조기 융합, 그리고 2,760억 파라미터. 왜 지금까지의 AI는 대화를 못했는지, 무엇이 바뀌었는지, 그리고 이 변화가 2026년 우리에게 무엇을 의미하는지 — 논문과 계보를 따라 끝까지 파헤친다.
코어닷투데이73분

기술멀티모달Qwen2.5-VL
2026.02.22Qwen2.5-VL 해부: 문서도, 영상도, 스마트폰도 '보는' AI의 구조
GPT-4o와 동급의 시각 이해, OCR에서는 압도적 1위, 그리고 몇 시간짜리 영상까지 이해한다. 알리바바의 Qwen2.5-VL이 3B부터 72B까지 세 가지 크기로 내놓은 '보는 AI'의 설계도를 완전 해부한다.
코어닷투데이33분

기술MolmoPixMo
2026.02.16Molmo & PixMo 완전 해부: GPT-4o에 도전한 '진짜 오픈소스' 비전-언어 모델의 모든 것
대부분의 오픈소스 비전-언어 모델은 GPT-4V가 생성한 합성 데이터로 훈련된다 — 결국 비공개 AI에 종속되는 셈이다. Allen AI의 Molmo는 사람이 직접 '말로 설명한' 71만 장의 이미지 데이터로 GPT-4o 바로 아래까지 올라갔다. 포인팅, 카운팅, 시계 읽기까지 — 진짜 오픈소스 VLM의 설계 원리를 풀어본다.
코어닷투데이44분