coredot.today
블로그로 돌아가기

#KServe

2개의 포스트

AI 플랫폼은 모델 바깥에서 만들어진다 — 2026년 일곱 층의 노하우와 서빙 플랫폼 지도
특집AI 플랫폼LLM 서빙
2026.10.03

AI 플랫폼은 모델 바깥에서 만들어진다 — 2026년 일곱 층의 노하우와 서빙 플랫폼 지도

2026년에 AI 플랫폼을 만든다는 것은 모델을 만드는 일이 아니라 모델 둘레의 일곱 층을 짓는 일입니다. 서빙, 게이트웨이, 컨텍스트·캐시, 에이전트 런타임, 도구·프로토콜, 평가·관측, 보안·거버넌스. 이 글은 10월 3일 기준의 가격표·저장소·사양·엔지니어링 블로그를 직접 확인해, 층마다 무엇을 사고 무엇을 지을지 정리했습니다. 특히 서빙은 '빌려 쓰기 대 직접 돌리기'가 아니라 일곱 단짜리 사다리로 풀었습니다. 같은 모델의 입력 단가가 호스트에 따라 23배 벌어지는 이유, GPU 임대료가 2년 만에 반등한 지금의 손익분기, 서버를 늘리면 오히려 느려지는 캐시 문제, 한 해 사이 주인이 바뀐 게이트웨이·관측 도구들, 그리고 서울 리전에서 최신 프런티어 모델을 '국내 처리'로 쓸 수 없는 현실까지 다룹니다. 계산기와 시뮬레이터 7개를 직접 움직여 볼 수 있습니다.

코어닷투데이86분
모델 서빙 설계 가이드 2026 — 요청 하나의 여정으로 배우는 구조와 노하우
기술모델 서빙LLM 서빙
2026.10.03

모델 서빙 설계 가이드 2026 — 요청 하나의 여정으로 배우는 구조와 노하우

2026년 10월의 모델 서빙에서 엔진은 사실상 정해졌습니다(vLLM, SGLang). 설계의 승부는 엔진 바깥에서 납니다. 이 글은 요청 하나가 들어와 답이 나가기까지의 여정을 식당 운영에 빗대어 따라가며, 지금 통하는 설계와 그 근거를 정리합니다. 응답 시간을 대기·읽기·쓰기로 나눠 재는 법, 최대 처리량이 아니라 굿풋으로 용량을 세는 법, 엔진의 기본값(동시 처리 1,024개, 대기열 무제한)을 그대로 쓰면 안 되는 이유, 같은 대화를 같은 서버로 보내는 것만으로 처리량이 두 배가 되는 라우팅, 받을 수 없는 요청을 거절하는 입장 제어, GPU 사용률이 아닌 확장 신호, 수십 GB 모델의 콜드 스타트를 줄이는 방법, 세대별 양자화 선택, 그리고 규모별 구성까지. vLLM 0.30과 llm-d 0.10의 문서, 그리고 Together·Modal·Baseten·토스·네이버 등이 올해 공개한 운영 사례의 수치를 근거로 삼았습니다. 직접 움직여 보는 위젯 6개가 들어 있습니다.

코어닷투데이57분