coredot.today
블로그로 돌아가기

#양자화

9개의 포스트

글·사진·소리·영상을 하나의 좌표로 — 내 폰 안에서 도는 740M 임베딩 모델, EmbeddingGemma 2 특집
특집EmbeddingGemma 2임베딩
2026.10.08

글·사진·소리·영상을 하나의 좌표로 — 내 폰 안에서 도는 740M 임베딩 모델, EmbeddingGemma 2 특집

2026년 10월 6일 구글 딥마인드가 공개한 EmbeddingGemma 2는 텍스트·코드·이미지·비디오·오디오를 하나의 768차원 공간에 놓는 7억 4천만 파라미터짜리 공개 임베딩 모델입니다. 텍스트만 쓰면 191MB, 전부 켜도 567MB로 스마트폰 안에서 돌고, 음성 메모로 영상을 찾고 사진으로 문서를 찾는 일이 서버 없이 가능해집니다. 이 글은 '단어는 친구를 보면 안다'는 1950년대 가설에서 word2vec의 왕−남자+여자=여왕, SBERT의 65시간→5초, CLIP의 N×N 행렬, ImageBind와 Gemini Embedding 2까지 임베딩이 걸어온 길을 되짚고, EmbeddingGemma 2의 모듈 구조·토큰 예산·마트료시카 절단·양자화를 논문 그림과 표로 뜯어봅니다. 구글이 비교하지 않은 경쟁 모델, 해커뉴스의 반론, 한국의 망분리·KURE, 그리고 단일 벡터의 이론적 한계까지 함께 다룹니다. 위젯 5개와 일러스트 9장.

코어닷투데이76분
마트료시카 임베딩 — 벡터를 앞에서부터 잘라도 되는 이유와, 잘랐을 때 실제로 남는 것 (한국어 검색 스택 3편)
튜토리얼마트료시카 임베딩Matryoshka Representation Learning
2026.10.03

마트료시카 임베딩 — 벡터를 앞에서부터 잘라도 되는 이유와, 잘랐을 때 실제로 남는 것 (한국어 검색 스택 3편)

Qwen3-Embedding-8B의 벡터는 숫자 4,096개입니다. 5,000만 청크를 float32로 저장하면 벡터만 819GB입니다. 그런데 이 벡터의 앞 256개만 남기고 나머지를 버려도 검색 품질의 93%가 남는다면? 그것이 마트료시카 임베딩입니다. 2022년 논문 「Matryoshka Representation Learning」이 제안하고 OpenAI text-embedding-3, Nomic v2, Qwen3 Embedding이 채택한 이 기법은 '중요한 정보를 벡터의 앞쪽에 몰아넣도록' 학습해, 러시아 인형처럼 큰 벡터 안에 작은 벡터가 들어 있게 만듭니다. 이 글은 원리를 장난감 모형으로 손에 잡히게 설명하고, 같은 한국어 코퍼스로 Qwen3 4B·8B와 Nomic v2를 32차원까지 잘라 가며 잰 실측 곡선, 저장 비용 계산기, 그리고 '짧게 걸러서 길게 고르는' 두 단계 적응형 검색이 전체 차원의 품질을 얼마나 되찾는지를 보여 줍니다. 인터랙티브 4개와 삽화 7장.

코어닷투데이21분
모델 서빙 설계 가이드 2026 — 요청 하나의 여정으로 배우는 구조와 노하우
기술모델 서빙LLM 서빙
2026.10.03

모델 서빙 설계 가이드 2026 — 요청 하나의 여정으로 배우는 구조와 노하우

2026년 10월의 모델 서빙에서 엔진은 사실상 정해졌습니다(vLLM, SGLang). 설계의 승부는 엔진 바깥에서 납니다. 이 글은 요청 하나가 들어와 답이 나가기까지의 여정을 식당 운영에 빗대어 따라가며, 지금 통하는 설계와 그 근거를 정리합니다. 응답 시간을 대기·읽기·쓰기로 나눠 재는 법, 최대 처리량이 아니라 굿풋으로 용량을 세는 법, 엔진의 기본값(동시 처리 1,024개, 대기열 무제한)을 그대로 쓰면 안 되는 이유, 같은 대화를 같은 서버로 보내는 것만으로 처리량이 두 배가 되는 라우팅, 받을 수 없는 요청을 거절하는 입장 제어, GPU 사용률이 아닌 확장 신호, 수십 GB 모델의 콜드 스타트를 줄이는 방법, 세대별 양자화 선택, 그리고 규모별 구성까지. vLLM 0.30과 llm-d 0.10의 문서, 그리고 Together·Modal·Baseten·토스·네이버 등이 올해 공개한 운영 사례의 수치를 근거로 삼았습니다. 직접 움직여 보는 위젯 6개가 들어 있습니다.

코어닷투데이57분
로컬 AI는 '열등한 Opus'가 아니다: 내 컴퓨터 속 모델은 완전히 다른 연장이다
특집로컬 AI오픈웨이트
2026.06.20

로컬 AI는 '열등한 Opus'가 아니다: 내 컴퓨터 속 모델은 완전히 다른 연장이다

1만 2천 달러짜리 GPU를 사서 자기 사무실에 AI를 들인 한 엔지니어가 던진 한 문장이 화제가 됐다. '로컬 Qwen은 더 싼 Opus가 아니라, 아예 다른 연장이다.' 대장장이가 칼을 담금질하듯 한순간도 눈을 뗄 수 없는 이 모델은 왜 어떤 일에서는 무너지고 어떤 일에서는 클라우드를 압도할까. 오픈웨이트 AI의 역사부터 트랜스포머·MoE·양자화·투기적 디코딩 같은 핵심 아키텍처, 벤치마크의 함정, 그리고 2026년 데이터 주권의 시대에 로컬 모델이 차지하는 진짜 자리까지 — 쉽고 자세하게 풀어본다.

코어닷투데이46분
Apple의 역(逆)베팅: 데이터센터 대신 당신의 주머니 — 온디바이스 AI 완전 해부
특집온디바이스 AI엣지 AI
2026.06.03

Apple의 역(逆)베팅: 데이터센터 대신 당신의 주머니 — 온디바이스 AI 완전 해부

전 세계 빅테크가 데이터센터에 한 해 $725B를 쏟아붓는 동안, Apple은 정반대로 베팅했다 — 이미 사용자 주머니 속에 있는 수십억 대 기기. 2026년 6월 WWDC를 앞두고 Apple은 15년간 쌓은 자체 실리콘 경험을 무기로 "클라우드 대신 기기에서" AI를 돌리는 온디바이스 전략을 전면에 내세운다. 메인프레임→PC→클라우드→엣지로 도는 컴퓨팅의 진자, A11(0.6 TOPS)에서 M4(38 TOPS)까지 63배 커진 Neural Engine, 통합 메모리로 671B 모델을 Mac에 통째로 올리는 법, Apple Intelligence의 영광과 BBC 헤드라인 참사·Siri 연기·$250M 합의, Private Cloud Compute의 5대 프라이버시 보장, 2026년 Google Gemini 딜과 Nvidia 컨피덴셜 컴퓨트, 증류·양자화·LoRA로 모델을 다이어트시키는 원리, "사용자가 사준 컴퓨팅" $50B 논리, 그리고 개발자·기업을 위한 온디바이스 vs 클라우드 실무 의사결정까지. 인터랙티브 시뮬레이터 3종 포함.

코어닷투데이47분
70B 모델을 스마트폰에서 돌린다 — AI 추론 최적화의 모든 것
기술AI 추론양자화
2026.02.15

70B 모델을 스마트폰에서 돌린다 — AI 추론 최적화의 모든 것

GPT급 거대 모델을 실시간으로, 저비용으로, 심지어 스마트폰에서도 돌리려면? 양자화, 프루닝, 지식 증류, 컴파일러 최적화까지 — AI 추론 최적화의 핵심 기법들을 실전 사례와 함께 총정리한다.

코어닷투데이58분
LoRA / QLoRA 특집: 1,750억 개 파라미터를 35MB로 길들이는 마법
인사이트LoRAQLoRA
2025.12.21

LoRA / QLoRA 특집: 1,750억 개 파라미터를 35MB로 길들이는 마법

GPT-3 175B를 파인튜닝하려면 1.2TB GPU 메모리가 필요하다. LoRA는 학습 파라미터를 1만 배 줄이고, QLoRA는 65B 모델을 단일 48GB GPU에서 학습 가능하게 만들었다. 저랭크 분해의 수학부터 2026년 모든 오픈소스 모델의 표준이 된 여정까지, 두 논문을 낱낱이 해부한다.

코어닷투데이44분
8-bit Adam 특집: 옵티마이저 메모리를 75% 줄인 블록별 양자화의 비밀
기술8-bit Adambitsandbytes
2025.11.15

8-bit Adam 특집: 옵티마이저 메모리를 75% 줄인 블록별 양자화의 비밀

Adam 옵티마이저의 상태만 84GB — 모델보다 6배 크다. 2021년, Tim Dettmers는 옵티마이저 상태를 8비트로 압축해 75%를 절약하면서도 32비트와 동일한 학습 품질을 유지하는 방법을 발견했다. 블록별 양자화와 동적 트리 양자화의 원리를 파헤친다.

코어닷투데이20분
양자화(Quantization) 완전 해부: 70B 모델을 내 노트북에서 돌리는 마법의 원리
기술양자화Quantization
2025.10.20

양자화(Quantization) 완전 해부: 70B 모델을 내 노트북에서 돌리는 마법의 원리

280GB짜리 AI 모델을 35GB로 줄이면서 성능은 97%를 유지한다. 어떻게? FP32에서 INT4까지, BinaryConnect에서 BitNet까지 — 양자화의 역사, 원리, 실전 기법, 그리고 안전성 문제까지 총정리.

코어닷투데이24분