#논문 리뷰
10개의 포스트

글·사진·소리·영상을 하나의 좌표로 — 내 폰 안에서 도는 740M 임베딩 모델, EmbeddingGemma 2 특집
2026년 10월 6일 구글 딥마인드가 공개한 EmbeddingGemma 2는 텍스트·코드·이미지·비디오·오디오를 하나의 768차원 공간에 놓는 7억 4천만 파라미터짜리 공개 임베딩 모델입니다. 텍스트만 쓰면 191MB, 전부 켜도 567MB로 스마트폰 안에서 돌고, 음성 메모로 영상을 찾고 사진으로 문서를 찾는 일이 서버 없이 가능해집니다. 이 글은 '단어는 친구를 보면 안다'는 1950년대 가설에서 word2vec의 왕−남자+여자=여왕, SBERT의 65시간→5초, CLIP의 N×N 행렬, ImageBind와 Gemini Embedding 2까지 임베딩이 걸어온 길을 되짚고, EmbeddingGemma 2의 모듈 구조·토큰 예산·마트료시카 절단·양자화를 논문 그림과 표로 뜯어봅니다. 구글이 비교하지 않은 경쟁 모델, 해커뉴스의 반론, 한국의 망분리·KURE, 그리고 단일 벡터의 이론적 한계까지 함께 다룹니다. 위젯 5개와 일러스트 9장.

읽기는 병렬로, 추론은 깊게 — 896K 토큰 문서를 4B 모델이 읽어 내는 법, PARSER 논문 특집
100만 토큰짜리 창을 가진 모델도 긴 문서 앞에서는 정확도가 수십 점씩 떨어집니다. 홍콩중문대 연구진이 2026년 9월에 내놓은 PARSER는 '문서를 읽는 순서는 문서가 정하지만, 질문을 푸는 순서는 질문이 정해야 한다'는 한 문장에서 출발합니다. 문서를 보지 않는 리드 에이전트가 질문을 쪼개 수천 개의 청크 담당 서브에이전트에게 동시에 흩뿌리고, 돌아온 증거로 다음 질문을 다듬습니다. 4B 모델이 896K 토큰에서 순차 메모리 에이전트를 12점 앞서고, 9B 모델이 DeepSeek-V4-Pro를 6.3점 앞섰으며, 지연은 11배 줄었습니다. 이 글은 Transformer의 어텐션 창에서 시작해 'Lost in the Middle'과 Context Rot, MemAgent의 순차 메모리까지 이 논문이 서 있는 자리를 되짚고, 흩뿌리기-모으기 구조와 리드 에이전트만 강화학습하는 설계, 세 가지 통제 실험, 실패 사례와 한계, 그리고 2026년 멀티 에이전트 지형에서의 의미를 사례와 함께 풀어 씁니다. 시뮬레이터·결과 탐색기·접근법 가이드 위젯 3개.

AI 동료가 셋 이상 앉으면 회의의 결론이 바뀐다 — 인간·AI 혼합 집단의 합의 형성 실험
2026년 9월 2일, 칭화대·노스이스턴대·상하이 AI 랩 연구진이 arXiv에 올린 논문 「AI agents reshape consensus formation in human groups」를 특집으로 읽는다. 24명이 40라운드 동안 같은 그림을 한 문장으로 설명하며 합의를 만드는 게임에 LLM 에이전트를 12.5%, 33.3%, 50%, 75% 섞었더니 세 개의 전혀 다른 세계가 나타났다. 소수의 AI는 사람의 합의를 촉진하고, 중간 비율은 합의를 무너뜨리고, 다수의 AI는 강한 합의를 되살리되 그 내용을 '토끼가 앉아 뒤를 본다'에서 '삼각형이 사각형을 둘러싼 비대칭 패턴'으로 바꿔 놓는다. 셰리프와 애쉬의 순응 실험부터 센톨라의 이름 짓기 게임, 2026년 AI 스웜 논쟁까지 배경을 훑고, 논문의 원본 그림과 세 개의 인터랙티브 위젯으로 핵심 개념을 짚는다.

EdgeCrafter 완전 이해: 작은 ViT의 반란 — 태스크 특화 증류로 엣지에서 검출·분할·포즈를 동시에
범용 사전학습이 소형 ViT에게는 독이 된다? — DINOv3를 태스크 특화 교사로 변환하여 10M 파라미터 ViT가 검출 51.7%, 분할 43.0%, 포즈 68.9% AP를 달성한 EdgeCrafter의 이야기.

DEIMv2 완전 이해: DINOv3와 만난 실시간 검출 — 0.5M에서 50M까지, 하나의 프레임워크
0.49M 파라미터의 초소형 Atto부터 57.8% AP의 거대 X까지 — DINOv3의 강력한 표현력을 STA로 실시간에 녹여낸 DEIMv2가 8개 스케일로 GPU, 엣지, 모바일을 동시에 정복한 이야기.

AutoHarness 논문 해설 — AI가 스스로 '규칙 위반 방지 코드'를 만든다
Gemini-2.5-Flash 체스 대회 패배의 78%가 '반칙'이었다. Google DeepMind의 AutoHarness 논문은 LLM이 스스로 규칙 검증 코드를 작성해 이 문제를 해결한다. 작은 모델이 큰 모델을 이기는 역전극의 비밀.

RT-DETRv4 완전 이해: 거인의 지혜를 빌리다 — 비전 파운데이션 모델이 실시간 검출을 바꾸는 법
추론 비용 0으로 DINOv3의 지혜를 실시간 검출기에 주입하다 — Deep Semantic Injector와 Gradient-guided Adaptive Modulation으로 YOLO13, D-FINE, DEIM을 모두 넘어선 RT-DETRv4의 이야기.

D-FINE 완전 이해: 바운딩 박스를 '확률 분포'로 다듬다 — 실시간 검출의 새로운 경지
고정된 좌표 대신 확률 분포를 반복 정제하고, 깊은 층의 지혜를 얕은 층에 전수하는 자기 증류까지 — D-FINE이 YOLO와 RT-DETR를 모두 넘어서며 실시간 객체 검출의 새로운 기준을 세운 이야기.

RT-DETR 완전 이해: DETR가 YOLO를 이긴 날 — 실시간 트랜스포머 검출의 혁명
NMS 없이 실시간으로 — YOLO의 왕좌에 도전한 최초의 실시간 엔드투엔드 트랜스포머 검출기 RT-DETR가 어떻게 탄생했고, 왜 객체 검출의 패러다임을 바꾸고 있는지를 두 편의 논문과 함께 풀어본다.

YOLO 완전 이해: 한 번만 봐! — 실시간 객체 검출의 혁명
'느리지만 정확하게'가 아니라 '한 번에 전부' — 객체 검출을 회귀 문제로 재정의하여 실시간 처리를 가능하게 한 YOLO가 어떻게 탄생했고, 왜 10년이 지난 지금도 세상을 바꾸고 있는지를 논문과 사례로 풀어본다.