블로그로 돌아가기

#KV 캐시
2개의 포스트

특집LingBot-Map3D 재구성
2026.08.131만 프레임을 잊지 않는 법 — LingBot-Map과 기하 컨텍스트 어텐션
2026년 4월, 앤트그룹의 로봇 자회사가 카메라 영상만으로 1만 프레임 이상을 20 FPS로 3차원 복원하는 모델을 오픈소스로 공개했다. 핵심은 '무엇을 기억하고 무엇을 버릴지'를 어텐션 마스크로 학습시킨 것. 40년 된 SLAM의 지혜가 트랜스포머 안으로 들어온 순간을, 논문과 코드를 끝까지 따라가며 해부한다.
코어닷투데이118분

기술vLLMNVIDIA Triton
2026.07.29넷플릭스는 왜 LLM을 직접 서빙하는가 (2부): vLLM과 Triton, 서빙 엔진을 해부하다
1부에서 '왜'를 봤다면 2부는 '어떻게'다. 넷플릭스 서빙 스택의 심장인 vLLM과 Triton을 뜯어본다. KV 캐시가 왜 메모리를 잡아먹는지, PagedAttention이 어떻게 그걸 운영체제의 페이징으로 해결했는지, 연속 배칭이 왜 처리량을 몇 배로 끌어올리는지 — 생소한 용어를 하나씩 그림으로 풀고, 넷플릭스가 TensorRT-LLM에서 vLLM으로 갈아탄 진짜 이유까지 따라간다.
코어닷투데이33분