#CLIP
4개의 포스트

글·사진·소리·영상을 하나의 좌표로 — 내 폰 안에서 도는 740M 임베딩 모델, EmbeddingGemma 2 특집
2026년 10월 6일 구글 딥마인드가 공개한 EmbeddingGemma 2는 텍스트·코드·이미지·비디오·오디오를 하나의 768차원 공간에 놓는 7억 4천만 파라미터짜리 공개 임베딩 모델입니다. 텍스트만 쓰면 191MB, 전부 켜도 567MB로 스마트폰 안에서 돌고, 음성 메모로 영상을 찾고 사진으로 문서를 찾는 일이 서버 없이 가능해집니다. 이 글은 '단어는 친구를 보면 안다'는 1950년대 가설에서 word2vec의 왕−남자+여자=여왕, SBERT의 65시간→5초, CLIP의 N×N 행렬, ImageBind와 Gemini Embedding 2까지 임베딩이 걸어온 길을 되짚고, EmbeddingGemma 2의 모듈 구조·토큰 예산·마트료시카 절단·양자화를 논문 그림과 표로 뜯어봅니다. 구글이 비교하지 않은 경쟁 모델, 해커뉴스의 반론, 한국의 망분리·KURE, 그리고 단일 벡터의 이론적 한계까지 함께 다룹니다. 위젯 5개와 일러스트 9장.

플라토닉 표현 가설: 모든 AI는 결국 같은 세계를 본다
GPT, CLIP, DINOv2 — 구조도 다르고 학습 데이터도 다른 AI 모델들이 왜 점점 비슷한 표현을 학습할까? MIT 연구팀이 제안한 '플라토닉 표현 가설'을 플라톤의 동굴 비유부터 2026년 AI 산업 전망까지, 풍부한 사례와 인터랙티브 시각화로 해부한다.

멀티모달 AI 완전 가이드: 텍스트·이미지·음성·영상을 동시에 이해하는 AI의 모든 것
CLIP이 이미지와 텍스트를 하나의 공간에 넣었고, GPT-4V가 LLM에 눈을 달았고, RT-2가 로봇에게 손을 줬다. 2026년, AI는 인간처럼 보고 듣고 말하고 행동한다 — 멀티모달 AI의 역사, 원리, 그리고 현재.

CLIP 논문 해부: 이미지와 언어를 잇는 다리를 놓다
4억 장의 이미지-텍스트 쌍으로 학습하고, 한 번도 본 적 없는 ImageNet을 76.2% 정확도로 분류한 모델. DALL-E, Stable Diffusion, Midjourney — 모든 이미지 생성 AI의 눈이 된 CLIP 논문을 해부한다.