블로그로 돌아가기


#KV 캐시
3개의 포스트

인사이트프롬프트 캐싱KV 캐시
2026.08.30AI가 단골을 알아보는 법 — 프롬프트 캐시 작동 원리, 일러스트로 이해하기
카페 단골은 '늘 마시던 걸로'라는 한마디면 된다. 그런데 AI는 왜 매번 대화 전체를 처음부터 다시 읽을까 — 그리고 프롬프트 캐시는 어떻게 그 낭비를 10분의 1 가격으로 줄일까? 독서 노트, 도미노, 냉장고, 기차 네 가지 비유와 일러스트로 KV 캐시의 원리를 바닥부터 그려 본다. 왜 '접두사'만 적중하는지, 왜 캐시 쓰기는 비싸고 읽기는 싼지, 왜 1시간이 지나면 증발하는지 — 그림으로 이해하면 /rewind와 /compact 중 뭘 눌러야 할지가 저절로 보인다.
코어닷투데이21분

특집LingBot-Map3D 재구성
2026.08.131만 프레임을 잊지 않는 법 — LingBot-Map과 기하 컨텍스트 어텐션
2026년 4월, 앤트그룹의 로봇 자회사가 카메라 영상만으로 1만 프레임 이상을 20 FPS로 3차원 복원하는 모델을 오픈소스로 공개했다. 핵심은 '무엇을 기억하고 무엇을 버릴지'를 어텐션 마스크로 학습시킨 것. 40년 된 SLAM의 지혜가 트랜스포머 안으로 들어온 순간을, 논문과 코드를 끝까지 따라가며 해부한다.
코어닷투데이118분

기술vLLMNVIDIA Triton
2026.07.29넷플릭스는 왜 LLM을 직접 서빙하는가 (2부): vLLM과 Triton, 서빙 엔진을 해부하다
1부에서 '왜'를 봤다면 2부는 '어떻게'다. 넷플릭스 서빙 스택의 심장인 vLLM과 Triton을 뜯어본다. KV 캐시가 왜 메모리를 잡아먹는지, PagedAttention이 어떻게 그걸 운영체제의 페이징으로 해결했는지, 연속 배칭이 왜 처리량을 몇 배로 끌어올리는지 — 생소한 용어를 하나씩 그림으로 풀고, 넷플릭스가 TensorRT-LLM에서 vLLM으로 갈아탄 진짜 이유까지 따라간다.
코어닷투데이33분