coredot.today
블로그로 돌아가기

#vLLM

3개의 포스트

넷플릭스는 왜 LLM을 직접 서빙하는가 (2부): vLLM과 Triton, 서빙 엔진을 해부하다
기술vLLMNVIDIA Triton
2026.07.29

넷플릭스는 왜 LLM을 직접 서빙하는가 (2부): vLLM과 Triton, 서빙 엔진을 해부하다

1부에서 '왜'를 봤다면 2부는 '어떻게'다. 넷플릭스 서빙 스택의 심장인 vLLM과 Triton을 뜯어본다. KV 캐시가 왜 메모리를 잡아먹는지, PagedAttention이 어떻게 그걸 운영체제의 페이징으로 해결했는지, 연속 배칭이 왜 처리량을 몇 배로 끌어올리는지 — 생소한 용어를 하나씩 그림으로 풀고, 넷플릭스가 TensorRT-LLM에서 vLLM으로 갈아탄 진짜 이유까지 따라간다.

코어닷투데이33
넷플릭스는 왜 LLM을 직접 서빙하는가 (1부): '그냥 API 쓰면 되잖아'에 대한 대답
기술넷플릭스LLM 서빙
2026.07.28

넷플릭스는 왜 LLM을 직접 서빙하는가 (1부): '그냥 API 쓰면 되잖아'에 대한 대답

2026년 7월, 넷플릭스가 자사 LLM 서빙 스택을 공개했다. 요약하면 '우리는 OpenAI API를 쓰지 않는다. 모델 배포부터 추론까지 전 과정을 우리 손으로 굴린다'이다. 대부분의 회사가 API 한 줄로 끝내는 시대에, 넷플릭스는 왜 굳이 인프라를 통째로 짊어졌을까? 이 특집 1부는 그 '왜'를 추천 시스템의 역사부터 2026년 인퍼런스 경제학까지 따라가며 답한다.

코어닷투데이23
추측 디코딩 완전 정복 — EAGLE-3, SSD, 그리고 LLM 추론 가속의 최전선
인사이트추측 디코딩Speculative Decoding
2025.12.27

추측 디코딩 완전 정복 — EAGLE-3, SSD, 그리고 LLM 추론 가속의 최전선

LLM은 왜 느린가? 98%의 시간을 메모리 전송에 낭비하기 때문이다. 추측 디코딩은 '작은 모델이 초안을 쓰고 큰 모델이 한꺼번에 검증'하여 출력 품질 손실 없이 2~6배 속도를 달성한다. EAGLE-3, Mirror-SD, Saguaro까지 — 2026년 LLM 추론 가속의 모든 것.

코어닷투데이26