coredot.today
AI 플랫폼은 모델 바깥에서 만들어진다 — 2026년 일곱 층의 노하우와 서빙 플랫폼 지도
블로그로 돌아가기
AI 플랫폼LLM 서빙추론 플랫폼vLLMSGLangllm-dKServeAI 게이트웨이프롬프트 캐시에이전트 런타임MCP지속 실행샌드박스EvalsLLM 관측GPU 임대손익분기AI 기본법소버린 AI플랫폼 엔지니어링특집

AI 플랫폼은 모델 바깥에서 만들어진다 — 2026년 일곱 층의 노하우와 서빙 플랫폼 지도

2026년에 AI 플랫폼을 만든다는 것은 모델을 만드는 일이 아니라 모델 둘레의 일곱 층을 짓는 일입니다. 서빙, 게이트웨이, 컨텍스트·캐시, 에이전트 런타임, 도구·프로토콜, 평가·관측, 보안·거버넌스. 이 글은 10월 3일 기준의 가격표·저장소·사양·엔지니어링 블로그를 직접 확인해, 층마다 무엇을 사고 무엇을 지을지 정리했습니다. 특히 서빙은 '빌려 쓰기 대 직접 돌리기'가 아니라 일곱 단짜리 사다리로 풀었습니다. 같은 모델의 입력 단가가 호스트에 따라 23배 벌어지는 이유, GPU 임대료가 2년 만에 반등한 지금의 손익분기, 서버를 늘리면 오히려 느려지는 캐시 문제, 한 해 사이 주인이 바뀐 게이트웨이·관측 도구들, 그리고 서울 리전에서 최신 프런티어 모델을 '국내 처리'로 쓸 수 없는 현실까지 다룹니다. 계산기와 시뮬레이터 7개를 직접 움직여 볼 수 있습니다.

코어닷투데이2026-10-0386분

AI 플랫폼 개발 2026 — 맨 아래 엔진실부터 배선실, 서고, 유리방 속 로봇, 공구실, 검토실, 경비실까지 일곱 층으로 이뤄진 건물의 단면도크게 보기

들어가며: 모델은 빌리고, 플랫폼은 짓는다

2026년 가을, AI 제품을 만드는 팀의 고민은 "어떤 모델을 쓸까"에서 "모델 둘레를 어떻게 지을까"로 옮겨 갔습니다. 데이터독이 4월에 낸 보고서를 보면 기업 열 곳 중 일곱 곳(69%)이 모델을 세 개 이상 함께 씁니다. 모델 하나를 골라 붙이면 끝나던 시절은 지났고, 여러 모델을 갈아 끼우면서도 서비스가 흔들리지 않게 하는 구조가 필요해졌습니다. 그 구조가 이 글에서 말하는 AI 플랫폼입니다.

이번 기획은 그 플랫폼을 실제로 짓는 사람의 눈으로 정리했습니다. 올해 나온 엔지니어링 블로그와 사양 문서, 가격표, 저장소 상태를 2026년 10월 3일 기준으로 직접 확인했고, 직접 확인하지 못한 수치는 '보도'나 '사업자 발표'라고 적었습니다. 전사 업무용 AIP 제품 비교는 AIP 경쟁 시대에서, 서빙 엔진의 내부 동작은 넷플릭스 LLM 서빙 3부작에서 이미 다뤘으니, 이 글은 짓는 순서와 판단 기준에 집중합니다.

✅
먼저 결론 열 가지.
① AI 플랫폼은 모델 바깥의 일곱 층입니다. 대부분은 사서 쓰고, 평가 세트와 하니스만 직접 가져갑니다.
② 서빙은 둘 중 하나가 아니라 일곱 단 사다리입니다. 작업마다 다른 단에 섭니다.
③ 같은 모델도 호스트에 따라 입력 단가가 23배, 속도가 4배 다릅니다. 모델 선택과 공급자 선택은 별개입니다.
④ 전용 GPU의 값은 임대료가 아니라 사용률이 정합니다. 그리고 GPU 임대료는 2026년에 다시 올랐습니다.
⑤ 직접 서빙하면 라우팅이 성능을 정합니다. 캐시를 모르는 부하 분산은 서버를 늘릴수록 느려집니다.
⑥ 게이트웨이는 첫날부터 둡니다. 요청의 약 5%는 실패하고, 이름난 게이트웨이·관측 도구 여럿이 1년 사이 주인이 바뀌었습니다.
⑦ 에이전트 비용은 캐시 적중률이 정합니다. 최신 모델은 캐시 읽기가 정가의 40분의 1입니다.
⑧ 에이전트 런타임은 두뇌·손·기록을 분리합니다. 과금 단위는 '일한 시간'으로 모이고 있습니다.
⑨ 평가는 대시보드가 아니라 실패 사례를 읽는 데서 시작합니다. 채점하는 AI도 보정해야 합니다.
⑩ 한국에서는 '국내 리전에서 처리'가 요건인 순간 선택지가 크게 줄어듭니다. 설계 첫날 확인할 항목입니다.

1. 지도: 모델 바깥의 일곱 층

AI 플랫폼을 건물에 비유하면, 파운데이션 모델은 땅속의 발전기입니다. 대부분의 회사는 발전기를 직접 만들지 않습니다. 빌리거나(API), 받아 와서 돌립니다(오픈 웨이트). 회사가 실제로 짓는 것은 그 위의 일곱 층입니다.

층을 나누는 이유는 층마다 사서 쓸지 지을지의 답이 다르기 때문입니다. 올해 공개된 사내 플랫폼 사례들을 겹쳐 보면 공통점이 보입니다.

회사규모플랫폼에서 배운 것
그랩(LLM-Kit)사내 서비스 500개 이상, MCP 서버 50개 이상, 모든 모델 호출이 게이트웨이 하나를 통과"추론 루프는 오후 한나절이면 됐다. 운영용 포장에 2주가 걸렸다." 그래서 포장을 템플릿으로 만들어 첫날 배선을 한 시간으로 줄였고, 평가 엔드포인트를 템플릿에 처음부터 넣었습니다.
스트라이프(Minions)주당 1,000건 넘는 병합 PR, MCP 도구 400개 이상에이전트 루프 사이사이에 결정적인 코드를 끼워 넣고, CI는 최대 두 번까지만 돌립니다. 무한 재시도를 구조로 막았습니다.
쇼피파이(River)30일간 세션 5만 9,918개, 병합 PR 8건 중 1건을 에이전트와 공동 작성두뇌(하니스)와 손(샌드박스)을 분리하고, 에이전트의 작업을 기본적으로 사내에 공개합니다.
깃허브(Copilot 코드 리뷰)—여러 에이전트가 함께 쓰는 범용 도구로 바꿨더니 더 비싸고 나빠졌습니다. 도구 설명을 리뷰어의 작업 순서에 맞춰 다시 쓰자 같은 품질에 비용이 약 20% 줄었습니다.
우아한형제들(AI플랫폼 2.0)LLM 사용자 중 비개발 직군 비중 5% 미만 → 38.3%게이트웨이·프롬프트 스튜디오·개인정보 자동 필터를 한 플랫폼으로 묶자 사용자 층이 넓어졌습니다.

다섯 회사 모두 모델 자체에 대한 이야기는 거의 하지 않습니다. 이야기의 중심은 게이트웨이, 템플릿, 샌드박스, 도구 설명문, 평가 엔드포인트입니다. 그랩의 한 문장이 이 글 전체의 요약입니다. 에이전트의 '생각하는 부분'은 반나절이면 만들고, 나머지 2주가 플랫폼입니다.

이제 가장 아래층, 서빙부터 올라가겠습니다. 이번 기획에서 가장 공을 들인 부분입니다.


2. 서빙 ①: '빌릴까 직접 돌릴까'가 아니라 일곱 단 사다리

넓은 계단의 맨 아래에서는 한 사람이 벽 콘센트에 스탠드를 꽂고, 중간 단에서는 바퀴 달린 발전기를 끌고 올라가며, 맨 위에서는 안전모를 쓴 팀이 자기 발전소 앞에서 땀을 닦는 장면크게 보기

서빙(serving)은 학습이 끝난 모델을 실제 요청에 응답하게 만드는 일입니다. 흔히 "API를 쓸까, 직접 서빙할까"로 묻지만, 2026년의 시장은 그 사이에 다섯 단이 더 있습니다. 전기에 비유하면 콘센트에 꽂아 쓰는 것과 발전소를 짓는 것 사이에 발전기 대여, 전용 회선, 자가 발전 같은 선택지가 있는 것과 같습니다.

단방식대표 사업자과금 단위내가 맡는 일
①모델사 직접 APIAnthropic, OpenAI, Google토큰프롬프트와 캐시 설계
②클라우드 모델 플랫폼Amazon Bedrock, Microsoft Foundry, Gemini Enterprise Agent Platform(옛 Vertex AI)토큰 + 등급리전·할당량·등급 선택
③오픈 모델 토큰 과금Fireworks, Together, DeepInfra, Novita, Groq, Cerebras토큰공급자 선택, 품질 확인
④전용 엔드포인트Fireworks, Baseten, Together의 전용 상품GPU 시간용량 계획, 사용률
⑤서버리스 GPUModal, RunPod, Cerebrium, Cloud Run GPUGPU 초컨테이너, 콜드 스타트
⑥GPU 임대 + 직접 운영Lambda, Crusoe, Nebius, CoreWeave, AWSGPU 시간엔진·라우팅·관측·장애 대응 전부
⑦온프레미스·전용 구역자체 GPU·NPU 서버장비 + 전력 + 사람하드웨어 수명 주기까지

위로 올라갈수록 토큰당 단가는 내려갈 수 있지만 맡는 일이 늘어납니다. 아래 위젯에서 조건을 바꿔 보면 추천되는 단이 어떻게 움직이는지 볼 수 있습니다.

이 시장에 돈이 얼마나 몰렸는지도 짚어 둘 만합니다. Fireworks는 7월에 15억 달러 넘는 시리즈 D를 마쳤고(기업가치 175억 달러), 웨이퍼 크기 칩으로 추론 속도를 내세운 Cerebras는 5월에 나스닥에 상장했습니다. 엔비디아는 2025년 말 Groq의 기술을 약 200억 달러 규모로 알려진 계약으로 라이선스하고 핵심 인력을 데려갔고, vLLM과 SGLang을 만든 사람들은 각자 회사를 세워 투자를 받았다고 보도됐습니다. Cloudflare는 Replicate를 인수하겠다고 발표했고, Nebius는 10월 1일에 콜드 스타트 전문 스타트업을 인수했습니다. 2026년의 AI 인프라 투자는 학습이 아니라 추론, 곧 서빙으로 향하고 있습니다.

💡
사다리는 한 단만 고르는 것이 아닙니다. 잘 지은 플랫폼은 작업마다 다른 단을 씁니다. 어려운 추론과 코딩은 ①에서, 대량 분류와 요약은 ③에서, 미세조정한 임베딩·리랭킹 모델은 ⑤에서 돌립니다. 그 앞에 게이트웨이 하나를 두어 애플리케이션이 단의 차이를 모르게 합니다. 서빙 전략은 '어디에 설까'가 아니라 '어떤 작업을 어느 단에 배정할까'입니다.

3. 서빙 ②: 같은 모델, 23배 다른 값

시장 골목의 다섯 가판대가 모두 똑같은 청록색 상자를 팔지만 가격표 크기가 제각각이고, 가판대 옆에는 달팽이 수레·자전거·스쿠터·승합차·로켓이 서 있어 손님이 머리를 긁적이는 장면크게 보기

③번 단, 오픈 모델 토큰 과금 시장에는 독특한 성질이 있습니다. 같은 모델을 수십 곳이 팔고, 값과 속도가 제각각입니다. 10월 3일 OpenRouter의 엔드포인트 목록에서 GLM-5.3 하나를 조회하면 엔드포인트 40개가 나옵니다. 100만 토큰당 입력 단가는 최저 0.12달러에서 최고 2.80달러로 23배 차이가 납니다.

호스트(양자화 표기)입력출력입력:출력 3:1일 때 혼합 단가입력:출력 100:1일 때 혼합 단가
Relace · InferenceNet$0.12$4.00$1.09$0.16
Novita (fp8)$0.42$1.32$0.65$0.43
DeepInfra (fp4)$0.56$2.50$1.05$0.58
정가 그룹 14곳 안팎 (Z.ai, Fireworks, Together, Baseten 등)$1.40$4.40$2.15$1.43
Baseten 고속 등급 (fp8)$2.10$6.60$3.23$2.14

표 오른쪽 두 열은 이 글에서 직접 계산한 값입니다. 여기서 중요한 사실이 하나 드러납니다. 가장 싼 호스트는 작업의 모양에 따라 바뀝니다. 입력과 출력이 3대 1인 일반 대화에서는 Novita가 가장 싸지만, 입력이 출력의 100배쯤 되는 에이전트 작업에서는 입력을 0.12달러에 파는 호스트가 Novita보다 2.7배 쌉니다. 출력 단가가 4달러로 높아도, 출력이 워낙 적어 문제가 되지 않습니다. 단가표를 볼 때는 우리 서비스의 입력 대 출력 비를 먼저 재야 합니다(프롬프트 캐시 할인은 이 계산에서 뺐습니다).

속도도 값만큼 벌어집니다. Artificial Analysis가 같은 날 집계한 GLM-5.3의 초당 출력 토큰입니다.

Z.ai (모델을 만든 곳)
68 토큰/초
Novita
75
DeepInfra
137
Baseten (기본)
140
Fireworks
219
Baseten (고속 등급)
285

모델을 만든 회사의 API가 가장 느리고, 같은 정가를 받는 Fireworks가 세 배 넘게 빠릅니다. 전용 칩 진영은 한 단계 더 나아가서, gpt-oss-120b 기준으로 Cerebras가 초당 약 1,780토큰, SambaNova 709토큰, Groq 471토큰을 냅니다.

여기서 플랫폼 설계자가 가져갈 것은 세 가지입니다.

첫째, 양자화가 다르면 같은 모델이 아닙니다. 표의 괄호에 적힌 fp4, fp8은 가중치를 몇 비트로 줄였는지를 뜻합니다. 목록 40개 가운데 상당수는 양자화 방식을 밝히지 않았습니다. 싼 호스트로 옮길 때는 값만 보지 말고 우리 평가 세트를 그 호스트에서 다시 돌려야 합니다.

둘째, 속도는 이제 돈으로 사는 등급입니다. 주요 사업자가 모두 같은 모델을 여러 속도·가격으로 팝니다.

사업자빠른 등급기본느려도 되는 등급
AnthropicFast mode: Opus 5.5 기준 2배($8/$40)$4/$20배치 50% 할인 (캐시 할인과 중복 적용)
OpenAIFast mode 2배정가Flex·배치 50% 할인
GooglePriority +80%정가Flex·배치 50% 할인
Amazon BedrockPriority +75%정가Flex·배치 50% 할인

가장 빠른 등급과 가장 느린 등급의 가격 차는 같은 모델 안에서 3.5~4배입니다. 사람이 기다리는 요청과 밤에 돌려도 되는 요청을 구분해 등급을 나눠 보내는 것만으로, 모델을 바꾸지 않고 비용 구조를 바꿀 수 있습니다. 이 구분을 하는 곳이 뒤에서 다룰 게이트웨이입니다.

셋째, 클라우드의 경계가 흐려졌습니다. 7월부터 OpenAI 모델이 Amazon Bedrock에서 제공되고, Claude는 Bedrock·Google Cloud·Microsoft Foundry에 모두 올라가 있습니다. 어느 클라우드를 쓰느냐가 어느 모델을 쓰느냐를 결정하던 구도가 풀렸습니다. 대신 같은 모델이라도 경로에 따라 운영 주체와 기능이 다릅니다. 예를 들어 Anthropic의 Fast mode는 자사 API에서만 제공됩니다. '어느 모델'만큼 '어느 경로'가 중요한 선택이 됐습니다.


4. 서빙 ③: 토큰으로 살까, GPU를 빌릴까

왼쪽 낮 장면에서는 서버 앞에 편지 봉투 모양 요청들이 길게 줄을 서 엔지니어가 뛰어다니고, 오른쪽 밤 장면에서는 같은 서버가 할 일 없이 서 있는데 택시 미터기가 계속 돌며 동전이 하수구로 떨어지고 엔지니어는 졸고 있는 장면크게 보기

사다리의 ③에서 ④ 이상으로 올라가는 결정, 곧 토큰 과금에서 GPU 시간 과금으로 넘어가는 결정은 계산으로 풀 수 있습니다. 먼저 10월 3일 각 사 가격표의 GPU 한 장 시간당 온디맨드 가격입니다.

구분사업자H100H200B200
⑥ GPU 임대RunPod (보안 클라우드)$2.89~3.49$4.59$6.79
⑥ GPU 임대Crusoe$3.90$4.29문의
⑥ GPU 임대Lambda$3.99~4.29—$6.69~6.99
⑥ GPU 임대Nebius (10월 1일 인상 후)$4.50$5.40$8.50
⑥ GPU 임대CoreWeave (8장 노드 ÷ 8)$6.16$6.31$8.60
⑤ 서버리스 GPUCerebrium (초 단위)$3.40—$6.01
⑤ 서버리스 GPUModal (초 단위)$3.95$4.54$6.25
④ 전용 엔드포인트Together$5.49—$8.99
④ 전용 엔드포인트Baseten (분 단위)$6.50—$9.98
④ 전용 엔드포인트Fireworks$8.00$8.00$13.00

같은 H100이 시간당 2.89달러에서 8달러까지 있습니다. 차이는 무엇이 포함돼 있느냐입니다. ⑥은 기계만 줍니다. ④는 최적화된 엔진, 자동 확장, 장애 대응까지 포함한 값입니다. 두 배 가까운 차이는 운영 인력의 값이라고 읽으면 됩니다.

그리고 올해의 반전이 있습니다. GPU 임대료가 올랐습니다. SemiAnalysis의 H100 1년 약정 지수는 2025년 10월 1.70달러에서 2026년 3월 2.35달러로 약 40% 올랐고, Nebius는 10월 1일에 H100 정가를 3.85달러에서 4.50달러로 올렸습니다. 2년 동안 내리기만 하던 값이 반등한 것입니다. 에이전트가 토큰 수요를 끌어올렸기 때문입니다(제번스의 역설과 추론 경제학 참고). "GPU는 계속 싸지니 기다리면 된다"는 전제로 세운 계획은 다시 계산해야 합니다.

이제 손익분기를 직접 셈해 보겠습니다.

기본값으로 셈하면 이렇습니다. H100 한 장을 시간당 4달러에 빌리면 한 달 2,920달러입니다. 이 GPU가 초당 3,000토큰을 처리한다고 가정하면 하루 최대 2억 5,900만 토큰, 한 달 약 79억 토큰입니다. 같은 양을 100만 토큰당 0.60달러에 사면 4,730달러입니다. 그러므로 GPU를 62% 이상 채워야 본전입니다. 여기에 이중화용 두 번째 GPU와 운영 인건비를 넣으면 문턱은 더 올라갑니다.

문제는 사용률입니다. 업무 시간에만 쓰는 사내 서비스는 하루 24시간 중 8시간만 붐비고, 피크에 맞춰 GPU를 잡아 두면 평균 사용률은 10~20%에 머뭅니다. 이 구간에서는 토큰 과금이 이깁니다.

💡
사용률을 올리는 세 가지 방법.
밤을 채웁니다. 낮에는 대화, 밤에는 문서 요약·색인·평가 같은 배치를 같은 GPU에 돌립니다.
기본 부하만 전용으로 받습니다. 늘 깔려 있는 양만 전용 GPU로 받고, 넘치는 피크는 게이트웨이가 토큰 과금으로 넘깁니다. 피크 배수가 1에 가까워집니다.
0대까지 줄입니다. 가끔 쓰는 미세조정 모델은 ⑤ 서버리스 GPU에 올립니다. 다만 콜드 스타트가 숙제입니다. 수십~수백 GB짜리 가중치를 올리는 시간이 걸리기 때문입니다. 올해 이 구간에 개선이 몰렸습니다. vLLM 0.30은 GPU별 가중치 캐시로 H200에서 엔진 초기화를 28.9초에서 8.2초로 줄였고, Cloud Run GPU는 인스턴스 시작을 약 5초로 안내합니다.

비용 말고 사다리를 오르는 이유가 둘 더 있습니다. 하나는 통제입니다. 직접 미세조정한 모델, 여러 LoRA 어댑터, 형식을 강제하는 제약 디코딩처럼 엔진 설정을 건드려야 하는 경우입니다. 다른 하나는 데이터입니다. 이 부분은 11장에서 따로 다룹니다.


5. 서빙 ④: 직접 돌린다면 — 엔진은 정해졌고, 승부는 라우팅에서 난다

⑥번 단 이상으로 올라가기로 했다면 무엇으로 돌릴지 정해야 합니다. 2026년 가을의 지형은 한 해 전보다 훨씬 단순합니다.

엔진10월 3일 상태자리
vLLMv0.30.0(9월 22일), 별 9.3만, 약 2주마다 릴리스GPU 서빙의 기본값. 대부분의 관리형 서비스와 쿠버네티스 도구가 이것을 전제로 합니다.
SGLangv0.5.21(10월 2일), 별 3.7만접두사가 긴 작업과 프리필·디코드 분리에 강합니다.
Hugging Face TGI저장소 보관 처리, 마지막 릴리스 2025년 12월README가 vLLM·SGLang·llama.cpp·MLX를 대신 권합니다. 신규 도입 대상이 아닙니다.
TensorRT-LLM안정판 v1.2.1, v1.3은 후보판엔비디아 하드웨어에서 최고 성능을 노릴 때. 독립 벤치마크(InferenceX)에서는 vLLM과 비슷한 수준까지 좁혀졌습니다.
llama.cpp · Ollama별 13만 · 18만개발자 노트북, CPU, 엣지. 동시 접속이 많은 서비스용은 아닙니다.
NVIDIA Dynamo · LMCachev1.5.0 · v0.5.5엔진 위에 얹는 분산 라우팅과 KV 캐시 계층화.

2년 전 표준이던 TGI가 보관 처리됐다는 사실이 이 층의 속도를 보여 줍니다. 엔진은 vLLM과 SGLang으로 모였고, 쿠버네티스 위에서 여러 대를 묶는 층은 llm-d로 모이고 있습니다. llm-d는 Red Hat, Google Cloud, IBM Research, CoreWeave, NVIDIA가 함께 시작해 3월에 CNCF 샌드박스 프로젝트가 됐습니다. 쿠버네티스 공식 확장인 Gateway API Inference Extension은 8월부터 표준 API(InferencePool)와 가벼운 기본 구현만 남기고 핵심 라우팅 로직을 llm-d로 넘겼고, KServe의 새 LLM 서비스 자원도 vLLM과 llm-d를 바탕으로 합니다. 쿠버네티스가 처음이라면 쿠버네티스 첫걸음 시리즈부터 보셔도 좋습니다.

서버를 늘렸는데 느려지는 이유

민원실 접수원이 다시 찾아온 손님을, 그 손님의 서류철을 이미 펼쳐 놓고 기다리는 담당자에게 안내하고, 옆 책상에서는 아무에게나 배정된 담당자가 두꺼운 서류철을 첫 장부터 넘기며 한숨 쉬는 장면크게 보기

엔진이 정해졌다면 성능을 가르는 것은 요청을 어느 서버로 보내느냐입니다. 일반 웹 서버는 어느 서버가 받아도 결과가 같으니 순서대로 돌리면(라운드로빈) 됩니다. LLM 서버는 다릅니다. 대화의 앞부분을 이미 읽어 둔 서버에는 그 계산 결과(KV 캐시)가 남아 있어, 같은 대화의 다음 턴을 그 서버가 받으면 새로 붙은 부분만 읽으면 됩니다. 다른 서버로 가면 수천~수만 토큰을 처음부터 다시 읽습니다.

위젯에서 서버 수를 늘려 보면 라운드로빈의 첫 토큰 시간이 오히려 길어지는 것을 볼 수 있습니다. 이것은 장난감 모델만의 현상이 아닙니다. 올해 공개된 실측이 같은 방향을 가리킵니다.

사례바꾼 것결과
네이버클라우드 OmniServe (4월)vLLM 위에 llm-d 기반 접두사 인지 라우팅처리량 2.1배, KV 캐시 활용도 25~45% → 90% 이상
테슬라 + Red Hat (4월)라운드로빈 → 접두사 캐시 인지 라우팅 (Llama 3.1 70B)출력 토큰/초 3배, 첫 토큰 시간 절반
Cloudflare (4월)세션 고정 헤더 도입, 프리필·디코드 분리피크 캐시 적중 60% → 80%, p90 토큰 간 지연 약 100ms → 20~30ms
Google Vertex AI (3월)지연 예측 모델로 배정첫 토큰 시간 p50 70% 감소

벤치마크도 이 현실을 따라왔습니다. SemiAnalysis의 공개 벤치마크 InferenceX는 8월부터 캐시 적중률 95% 이상인 다중 턴 에이전트 기록으로 엔진을 잽니다. 캐시가 듣는 상태가 표준 조건이 된 것입니다.

직접 서빙하는 팀이 올해 적어 둔 것들

1
확장 신호는 GPU 사용률이 아닙니다. GPU 사용률은 요청이 하나만 있어도 100%에 가깝게 찍힙니다. llm-d는 대기열 길이, 처리 중인 요청 수, KV 캐시 압박을 신호로 씁니다.
2
LLM 서버는 조용히 실패합니다. Akamai의 실험에서 KV 캐시가 바닥나자 첫 토큰 시간이 55초 안팎까지 늘었는데 응답 코드는 계속 200이었습니다. 엔진 안의 대기열은 끝없이 자라므로, 동시 처리 수와 컨텍스트 길이에 상한을 걸고 넘치는 요청은 엔진 바깥(게이트웨이)에서 줄 세우거나 거절합니다.
3
프리필·디코드 분리는 만능이 아닙니다. 프롬프트를 읽는 서버와 답을 쓰는 서버를 나누면 처리량이 오르지만(AWS 발표 기준 최대 70%), 두 서버 사이로 KV 캐시를 옮겨야 합니다. IBM의 측정으로는 70B 모델의 1만 토큰짜리 프롬프트가 약 3GB이고, GPU 간 직접 전송이 안 되는 환경에서는 전송에 1.3초가 더 걸렸습니다.
4
선행 지표를 봅니다. DaoCloud는 투기적 디코딩의 수락률에 경보를 걸라고 권합니다. 토큰당 시간이 나빠지기 전에 이 수치가 먼저 떨어지기 때문입니다. 메모리 누수는 긴 부하 시험에서만 드러났다고도 적었습니다.
5
모든 것이 LLM일 필요는 없습니다. LY(라인야후)의 이미지 검수 시스템은 전통적인 분류 모델이 90% 이상을 걸러 내고 나머지 약 10%만 멀티모달 LLM으로 넘깁니다. 가장 싼 추론은 하지 않는 추론입니다.

6. 게이트웨이: 모든 호출이 지나는 문 하나

선로 분기점의 관제실에서 역무원이 레버를 당겨, 차단봉과 경고등으로 막힌 선로 대신 다른 구름 역으로 가는 선로로 편지 화물차를 돌리는 장면. 관제실에는 예산 계기판과 열쇠 꾸러미, 운행 일지가 있다크게 보기

서빙 위의 2층은 게이트웨이입니다. 애플리케이션이 모델 공급자를 직접 부르지 않고, 사내의 문 하나를 거쳐 부르게 하는 구조입니다. 그랩, 우버, 도어대시, 우아한형제들이 공개한 사내 플랫폼에는 예외 없이 이 층이 있습니다.

이유는 숫자가 말해 줍니다. 데이터독 보고서에 따르면 운영 환경에서 AI 모델 요청의 약 5%가 실패하고, 그중 60% 가까이가 용량 제한 때문입니다. Vercel은 자사 게이트웨이를 지난 요청의 3.5%가 자동 폴백으로 구제됐다고 밝혔습니다(사업자 발표). 장애도 드물지 않습니다. Anthropic의 상태 페이지에는 7월 25일부터 10월 1일까지 사건 50건이 기록돼 있고 그중 19건이 중대, 2건이 치명 등급입니다. OpenAI의 상태 페이지는 7~10월 API 가용성을 99.96%로 표시합니다.

게이트웨이가 맡는 일을 정리하면 다음과 같습니다.

기능하는 일놓치기 쉬운 점
폴백·재시도공급자 장애와 용량 제한 때 다른 경로로폴백 모델의 품질도 평가해 둬야 합니다. 같은 클라우드의 두 경로는 함께 죽습니다.
키 보관공급자 키를 한곳에 두고 애플리케이션에는 사내 키만모든 키가 모이는 곳이므로 가장 먼저 지켜야 할 자산이 됩니다.
예산·속도 제한팀·사용자·작업별 한도에이전트가 밤새 돌며 한도를 태우지 않도록 작업 단위 상한을 둡니다.
등급 배정급한 요청은 빠른 등급, 배치는 50% 할인 등급으로3장의 가격 차를 실제 절감으로 바꾸는 지점입니다.
비용 귀속·기록누가 어떤 모델을 얼마나 썼는지첫날부터 사용자·팀·작업 식별자를 남깁니다. 나중에 붙이기 어렵습니다.
정책개인정보 가리기, 허용 모델 목록우아한형제들은 개인정보 자동 필터를 게이트웨이에 넣었습니다.

올해 이 층에서 벌어진 일: 사고와 인수

게이트웨이를 고를 때 알아야 할 올해의 사건이 둘 있습니다.

첫째, 공급망 사고입니다. 가장 널리 쓰이는 오픈소스 프록시 LiteLLM의 악성 버전 두 개(1.82.7, 1.82.8)가 3월 24일 PyPI에 올라왔습니다. LiteLLM의 공식 설명에 따르면 CI에서 쓰던 보안 스캐너가 먼저 뚫려 배포 자격 증명이 탈취됐고, 악성 버전은 파이썬이 시작될 때마다 환경 변수, SSH 키, 클라우드·쿠버네티스 자격 증명을 외부로 보냈습니다. 게이트웨이는 회사의 모든 모델 키가 지나가는 곳입니다. 이후에도 LiteLLM의 취약점 세 건이 미국 CISA의 '실제 악용된 취약점' 목록에 올랐습니다. 프로젝트는 지금도 활발히 개발되고 있지만(별 약 6만), 교훈은 분명합니다. 게이트웨이는 버전을 고정하고, 새 버전은 하루 이상 늦게 받고, 인터넷에 직접 노출하지 않습니다.

둘째, 주인이 바뀌었습니다. 지난 1년 사이 이 층의 이름난 도구 상당수가 인수되거나 멈췄습니다.

도구2026년에 일어난 일
Langfuse (관측)1월 ClickHouse가 인수. 오픈소스와 자체 호스팅 유지
Helicone (게이트웨이·관측)3월 Mintlify가 인수, 유지보수 모드
Portkey (게이트웨이)5월 Palo Alto Networks가 인수 완료, 보안 제품군에 편입
TensorZero (게이트웨이)6월 저장소 보관 처리, 유지보수 종료
Envoy AI Gateway6월 1.0 출시 뒤 리눅스 재단 산하 Agentic AI Foundation으로 옮겨 'Agent Router'로 개명
Hugging Face TGI (서빙)저장소 보관 처리
⚠️
얇게 묶이세요. 2층과 6층의 도구는 반년 뒤에도 같은 주인 아래 있으리라고 가정하기 어렵습니다. 애플리케이션은 OpenAI 호환 형식 같은 사실상의 표준으로 게이트웨이를 부르고, 트레이스는 내보낼 수 있는 형식으로 쌓고, 도구 고유 기능에 깊이 기대는 코드는 한곳에 모아 두세요. 도구를 바꾸는 비용이 하루로 끝나게 만드는 것이 이 층의 설계 목표입니다.

똑똑한 라우터의 한계

게이트웨이에 '질문을 보고 가장 싼 모델을 골라 주는 학습형 라우터'를 넣고 싶어집니다. 올해 연구는 이 기대에 찬물을 끼얹었습니다. 40만 건 넘는 사례로 라우터들을 비교한 LLMRouterBench(1월)는 상용 라우터를 포함한 여러 최신 라우터가 단순한 기준선을 안정적으로 넘지 못했다고 보고했습니다. 2월의 다른 논문은 예산을 늘릴수록 라우터가 가장 비싼 모델만 고르게 되는 현상을 보였습니다.

현장의 답은 더 단순합니다. Amplify Partners의 2026년 조사(1,048명)에서 응답자의 87%가 여러 모델을 쓰고, 가장 흔한 방식은 작업 유형에 따라 모델을 미리 정해 두는 것이었습니다. 저희가 검색 스택 실험에서 얻은 결론도 같았습니다. 정규식으로 만든 규칙 라우터가 모델 기반 라우터보다 나았습니다(적재적소 라우팅 실측). 라우팅은 요청마다 추측하기보다 작업 종류마다 표로 정해 두는 편이 낫습니다.


7. 컨텍스트와 캐시: 에이전트의 값은 여기서 정해진다

3층은 눈에 잘 띄지 않지만 비용의 대부분이 결정되는 곳입니다. 에이전트는 턴마다 지금까지의 대화 전체를 다시 모델에 넣습니다. 그래서 Manus 팀이 밝힌 대로 입력과 출력의 비가 100대 1쯤 되고, Anthropic의 측정으로는 에이전트가 일반 대화의 약 4배, 다중 에이전트 시스템은 약 15배의 토큰을 씁니다.

이 구조에서 값을 정하는 것이 프롬프트 캐시입니다. 앞부분이 직전 요청과 같으면 그 부분은 훨씬 싸게 읽습니다. 그리고 그 할인 폭이 모델 세대가 바뀔 때마다 깊어지고 있습니다.

10배
Sonnet 5.5
입력 $2 → 캐시 읽기 $0.20
20배
Opus 5.5
입력 $4 → 캐시 읽기 $0.20
40배
Fable 5.1
입력 $10 → 캐시 읽기 $0.25

가장 비싼 모델의 캐시 읽기 값이 가장 싼 모델의 정가 입력보다 쌉니다. 뒤집어 말하면 캐시가 깨지는 순간 같은 요청의 입력 비용이 최대 40배가 됩니다. OpenAI도 GPT-5.6부터 캐시 쓰기에 1.25배를 받고 읽기는 0.1배(일부 모델 0.05배)로 내리는, 같은 구조로 옮겨 갔습니다. Manus가 "운영 단계 에이전트에서 가장 중요한 지표 하나는 KV 캐시 적중률"이라고 쓴 것이 2025년 7월인데, 2026년의 가격표는 그 말을 더 강하게 만들었습니다. 캐시의 원리는 프롬프트 캐시는 어떻게 동작하는가에 정리해 두었습니다.

캐시 적중률을 지키는 규칙은 단순하지만 어기기 쉽습니다.

규칙흔한 위반고치는 법
고정된 것을 앞에, 바뀌는 것을 뒤에시스템 프롬프트 첫 줄에 현재 시각·사용자 이름바뀌는 정보는 대화의 맨 뒤 메시지에 붙입니다
도구 목록의 순서를 고정요청마다 도구 순서가 섞임이름순으로 정렬해 직렬화합니다
도구를 중간에 넣었다 빼지 않기단계마다 도구 정의를 추가·삭제정의는 그대로 두고 선택만 제한하거나, 도구 검색으로 필요할 때 불러옵니다
지난 기록을 고쳐 쓰지 않기앞선 도구 결과를 요약본으로 바꿔치기덧붙이기만 하고, 압축은 정해진 시점에 한 번에 합니다

두 번째 줄은 이제 프로토콜 차원의 권고가 됐습니다. 7월 28일에 나온 MCP 새 사양은 서버가 도구 목록을 정해진 순서로 돌려주라고 권하면서 그 이유를 'LLM 프롬프트 캐시 적중률 향상'이라고 명시했습니다. 통신 규약이 캐시를 위해 설계를 바꾼 것입니다.

캐시와 함께 볼 것이 컨텍스트에 처음부터 덜 넣는 기술입니다. Anthropic의 측정으로 MCP 서버 다섯 개의 도구 정의만 약 5만 5천 토큰을 차지했는데, 도구를 필요할 때 검색해 올리는 방식으로 바꾸자 토큰이 85% 줄고 정확도는 오히려 올랐습니다. Cursor는 도구 출력을 파일로 빼 두고 필요할 때 읽게 하는 방식으로 에이전트 총 토큰을 46.9% 줄였다고 밝혔습니다. 공통 원리는 하나입니다. 컨텍스트 창은 작업대이지 창고가 아닙니다. 창고는 파일 시스템에 둡니다. 더 깊은 내용은 컨텍스트 엔지니어링 가이드를 참고하세요.


8. 에이전트 런타임: 몇 시간짜리 작업이 죽지 않게

유리방 안에서 작은 파란 로봇이 작업대에서 조립을 하고 바닥에는 저장 지점 깃발이 줄지어 있으며, 유리방 밖에서는 사람이 커다란 승인 버튼 위에 손을 올린 채 지켜보는 장면크게 보기

4층과 5층은 에이전트가 실제로 일하는 곳입니다. 챗봇은 요청 하나에 응답 하나로 끝나지만 에이전트는 몇 분에서 몇 시간 동안 도구를 부르고 코드를 돌리고 사람의 승인을 기다립니다. Anthropic의 집계로 Claude Code에서 가장 긴 축에 드는 작업(상위 0.1%)의 한 턴은 2025년 10월 25분 미만에서 2026년 1월 45분 이상으로 늘었습니다. 이렇게 긴 작업은 웹 요청처럼 다룰 수 없습니다.

두뇌, 손, 기록을 나눈다

올해 가장 영향력 있었던 설계 원칙은 Anthropic이 Managed Agents를 만들며 공개한 것입니다. 첫 설계에서는 에이전트 루프와 실행 환경이 한 컨테이너에 있어, 컨테이너가 죽으면 세션도 같이 사라졌습니다. 서버를 애완동물처럼 돌봐야 하는 구조였습니다. 이를 세 부분으로 나눴습니다.

두뇌 — 하니스
모델을 부르고 다음 행동을 정하는 루프. 상태를 갖지 않아 언제든 다시 띄울 수 있습니다.
손 — 샌드박스
코드를 실행하고 파일을 만지는 격리 환경. 자격 증명은 이 안에서 닿을 수 없게 둡니다.
기록 — 세션 로그
무슨 일이 있었는지를 컨텍스트 창 바깥에 덧붙여 쌓는 저장소. 재개와 감사의 근거입니다.

이렇게 나누자 첫 토큰까지의 시간이 중앙값 약 60%, p95는 90% 넘게 줄었다고 합니다. 쇼피파이도 같은 결론("두뇌와 손을 분리하라")을 독립적으로 적었고, OpenAI가 9월에 공개 베타로 낸 Agents API와 AWS가 9월에 고친 AgentCore 런타임도 같은 모양입니다. OpenAI는 8월 26일 Assistants API를 종료했습니다. 관리형 에이전트 런타임의 구조가 한 방향으로 수렴하고 있습니다.

과금 단위가 '일한 시간'으로 모인다

이 층에서 눈여겨볼 변화는 과금 단위입니다.

런타임과금 (10월 3일 가격표)기다리는 시간
Claude Managed Agents토큰 + 세션 시간당 $0.08실행 중일 때만 계량, 대기는 무료
Bedrock AgentCore RuntimevCPU 시간당 $0.0895 + 메모리입출력 대기는 무료
Gemini Enterprise Agent Platform 런타임vCPU 시간당 $0.085 + 메모리—
Vercel Sandbox활성 CPU 시간당 $0.128 + 메모리입출력 대기는 무료

에이전트는 대부분의 시간을 모델 응답이나 사람의 승인을 기다리며 보냅니다. 그 시간에 돈을 받지 않는 방식이 표준이 됐습니다. 플랫폼을 직접 짓는 쪽에서도 같은 기준이 필요합니다. 사람 승인을 기다리는 세션이 서버를 붙잡고 있지 않도록, 멈췄다가 이어서 도는 구조가 있어야 합니다.

그 구조를 지속 실행(durable execution)이라고 부릅니다. 단계마다 결과를 기록해 두었다가, 프로세스가 죽거나 배포가 새로 나가도 마지막 단계부터 이어서 도는 방식입니다. 이 분야의 대표 주자 Temporal은 9월에 기업가치 125억 5천만 달러로 5억 5천만 달러를 투자받았고, 8월 한 달 실행량이 1조 9천억 건이라고 밝혔습니다. 9월 30일에 투자를 받은 Restate의 창업자는 "에이전트를 위해 만든 것이 아닌데 마침 딱 맞았다"고 말했습니다. Vercel Workflow, Cloudflare Workflows, DBOS, LangGraph도 같은 문제를 풉니다.

MCP가 세션을 버린 이유

5층의 표준인 MCP는 7월 28일 사양에서 큰 결정을 했습니다. 연결 시작 때의 초기화 절차와 세션을 프로토콜에서 없애고, 요청 하나하나가 독립적으로 처리되게 했습니다. 서버 쪽에서 먼저 요청을 보내던 기능은 '추가 입력이 필요하다'는 응답으로 대체됐고, 게이트웨이가 본문을 열지 않고도 라우팅할 수 있도록 표준 헤더가 생겼습니다. 출시 2년이 채 안 된 프로토콜이 세션을 버린 것은, 상태를 가진 서버를 수평으로 늘리는 일이 그만큼 어려웠기 때문입니다. 이 변화는 MCP 2026-07-28 사양 해설에서 자세히 다뤘습니다.

플랫폼을 짓는 입장에서는 좋은 소식입니다. 사내 MCP 서버를 일반 웹 서비스처럼 부하 분산 뒤에 둘 수 있게 됐습니다. 에이전트 사이 통신은 A2A 1.0이, 절차 지식은 Agent Skills가 맡는 구도도 자리를 잡았습니다. 아직 정리되지 않은 것은 에이전트가 화면을 그리는 층(AG-UI, A2UI, MCP Apps가 겹쳐 있음)과 MCP 서버를 어디까지 믿을지의 문제입니다.

다중 에이전트: 열 달 만에 뒤집힌 권고

2025년 6월 Cognition은 "다중 에이전트를 만들지 말라"고 썼습니다. 2026년 4월에는 그 글을 고쳐 썼습니다. 지금 통하는 방식은 쓰기는 한 줄기로, 읽기와 검토는 여러 에이전트로 하는 것이라고 합니다. 깨끗한 컨텍스트로 시작한 검토 에이전트가 PR당 평균 2개의 버그를 찾았다는 수치도 함께 내놨습니다. Cursor도 대등한 에이전트들의 협업은 실패했고 계획자와 작업자의 위계가 통했다고 적었습니다.

하니스에 대한 가장 중요한 문장은 Anthropic의 3월 글에 있습니다. 하니스의 모든 부품은 "모델이 혼자서는 못 한다"는 가정을 담고 있다는 것입니다. 모델이 좋아지면 그 가정이 틀려지고, 부품은 짐이 됩니다. 같은 글에서 혼자 돌린 에이전트는 20분에 9달러, 계획·생성·평가로 나눈 하니스는 6시간에 200달러가 들었습니다. 하니스는 쌓는 것만큼 덜어내는 것이 일입니다. 관련 실증은 코딩 에이전트 하니스 설계 실증 연구에 정리했습니다.


9. 평가와 관측: 대시보드보다 실패 사례

두 엔지니어가 탁자 가득 펼친 긴 대화 기록 두루마리를 돋보기로 읽으며 문제 지점에 색 쪽지를 붙여 색깔별 상자에 분류하고, 뒤쪽 벽에는 아무도 보지 않는 초록색 계기판 화면에 먼지와 거미줄이 앉은 장면크게 보기

6층은 사서 쓸 수 있는 부분과 살 수 없는 부분이 가장 뚜렷하게 갈리는 층입니다.

LangChain의 조사(1,340명)를 보면 에이전트를 운영 중인 조직의 89%가 관측 도구를 갖췄지만, 오프라인 평가를 돌리는 곳은 52.4%, 운영 중 평가는 37.3%입니다. Amplify의 조사에서도 평가는 가장 많이 꼽힌 어려움이었고, 가장 흔한 방법은 여전히 "눈으로 대충 보기"였습니다. 도구는 깔았는데 재지는 않는 상태입니다.

평가 실무에서 가장 많이 인용되는 하멜 후세인과 슈레야 샹카의 권고는 순서가 분명합니다.

1
실제 기록 100건쯤을 직접 읽습니다. 일반 지표를 붙이기 전에 무엇이 어떻게 틀리는지 메모합니다. 두 사람은 개발 시간의 60~80%를 이 오류 분석과 평가에 썼다고 말합니다.
2
메모를 실패 유형으로 묶습니다. '날짜를 틀림', '없는 정책을 지어냄'처럼 우리 서비스에 고유한 유형이 나옵니다. 범용 지표는 이 유형을 모릅니다.
3
유형마다 합격·불합격 판정을 만듭니다. 5점 척도 대신 둘 중 하나로. 코드로 검사할 수 있는 것은 코드로, 나머지는 LLM 판정기로.
4
판정기를 사람의 채점과 맞춰 봅니다. 합격을 합격으로, 불합격을 불합격으로 맞히는 비율을 각각 잽니다.

Anthropic의 1월 글도 같은 방향입니다. 실제 실패에서 뽑은 과제 20~50개로 시작하고, 경로가 아니라 결과를 채점하고, 고객 대면 서비스라면 k번 모두 성공하는 비율(pass^k)을 보라고 권합니다. 노션은 평가를 세 층으로 나눕니다. CI에서 도는 회귀 평가, 출시 기준인 80~90% 합격선의 평가, 그리고 일부러 30%쯤만 통과하게 만든 '여유 공간' 평가입니다. 마지막 것은 다음 모델이 나왔을 때 얼마나 나아졌는지 알아보기 위한 것입니다.

채점하는 AI를 채점하기

4단계가 왜 필요한지는 직접 보는 편이 빠릅니다.

판정기가 부정확하면 합격률이 실제보다 높거나 낮게 찍힐 뿐 아니라, 버전 사이의 차이가 줄어들어 보입니다. 기본값에서 실제 6%p 개선은 3.6%p로 보이고, 표본 200건으로는 그 차이를 우연과 구분하지 못합니다. 개선했는데 지표가 꿈쩍하지 않거나, 반대로 우연을 개선으로 읽게 되는 이유입니다. 국내 사례로 하이퍼커넥트는 판정기를 '한 번에 하나의 기준, 합격·불합격'으로 단순화했을 때 사람과의 일치율이 약 84%였고, 전문가끼리의 일치율이 80~90%였다고 공개했습니다. 판정기가 도달할 수 있는 천장은 사람끼리의 합의 수준입니다. Anthropic의 표현으로는, 좋은 과제란 두 전문가가 따로 봐도 같은 판정을 내리는 과제입니다.

관측 도구를 고를 때

트레이스 수집과 평가 실행 도구는 Langfuse, Braintrust(2월 8천만 달러 투자 유치), LangSmith, Arize Phoenix, W&B Weave 등 선택지가 많습니다. 다만 표준은 아직 굳지 않았습니다. OpenTelemetry의 GenAI 규약은 6월에 별도 저장소로 옮겨졌고, 10월 3일 현재 안정판이 없습니다. 6장의 조언이 여기에도 적용됩니다. 트레이스를 내보낼 수 있는지 먼저 확인하고, 평가 세트와 판정 기준은 도구 안이 아니라 저장소에 코드로 둡니다. 모델을 바꿀 때도, 도구를 바꿀 때도, 호스트를 바꿀 때도 남는 것은 그 평가 세트입니다.


10. 보안·거버넌스: 마지막 방어선은 권한이다

7층에서 올해 가장 많이 인용된 사고는 4월의 PocketOS 건입니다. 스테이징 환경에서 작업하던 코딩 에이전트가 범위가 넓은 클라우드 토큰을 발견해 운영 데이터베이스 볼륨과 볼륨 단위 백업을 약 9초 만에 지웠고, 서비스가 30시간 넘게 멈췄습니다. 2025년 12월 AWS에서 있었던 13시간 장애도 에이전트가 환경을 '지우고 다시 만들기'로 결정한 데서 시작됐다고 보도됐는데, 아마존은 이를 사용자 접근 통제 문제라고 설명했습니다.

두 사건의 공통점은 모델이 틀려서가 아니라 권한이 넓어서 커졌다는 것입니다. OWASP가 9월에 낸 2026년판 LLM 애플리케이션 10대 위험도 '과도한 권한 위임'의 순위를 올렸습니다. Amplify 조사에서 쓰기 권한을 가진 에이전트의 비율은 1년 사이 52%에서 89%로 늘었습니다. 에이전트가 할 수 있는 일이 늘어난 속도를 통제가 따라가야 합니다.

통제구체적으로
에이전트마다 별도 신원사람의 계정을 빌려 쓰지 않습니다. 주요 클라우드가 에이전트 전용 ID를 내놨고(Microsoft Entra Agent ID, Google Agent Identity, AgentCore Identity), MCP도 기업 인증 서버가 권한을 중앙에서 내주는 방식을 6월에 안정화했습니다.
범위가 좁은 단기 토큰작업에 필요한 자원에만, 짧은 수명으로. 스테이징 작업에 운영 권한이 딸려 오지 않게 합니다.
자격 증명을 샌드박스 밖에에이전트가 코드를 돌리는 환경에서는 비밀 값에 닿을 수 없게 하고, 바깥의 프록시가 대신 붙여 줍니다.
파괴적 동작 앞의 승인삭제·결제·외부 발송은 사람의 확인을 거칩니다. 승인 대기 중에는 세션이 멈춰 있어야 하므로 8장의 지속 실행과 한 쌍입니다.
백업을 다른 폭발 반경에PocketOS는 백업이 같은 볼륨 권한 아래 있었습니다. 에이전트가 닿는 권한으로는 백업을 지울 수 없어야 합니다.
나가는 길 통제프롬프트 주입을 완전히 막는 방법은 아직 없습니다. 그래서 주입이 성공해도 데이터를 내보낼 경로가 없게 만드는 쪽이 현실적입니다. 샌드박스의 외부 접속을 허용 목록으로 제한합니다.

공급망도 이 층의 일입니다. 6장의 LiteLLM 사고처럼, AI 플랫폼의 부품은 대개 자격 증명 가까이에서 돕니다. MCP 서버와 스킬도 마찬가지로 남이 만든 코드와 지시문을 에이전트의 권한으로 실행하는 것입니다. 사내 레지스트리에 검토한 것만 올리고, 버전을 고정하세요.


11. 한국에서 짓는다는 것

담장으로 둘러싸인 마당 안에 작은 데이터센터 건물이 있고, 담장 밖에는 관으로 이어진 구름들이 떠 있으며, 하나뿐인 출입문에서 경비원이 컨베이어 위의 데이터 꾸러미를 검사해 일부만 구름으로 내보내고 나머지는 안으로 돌려보내는 장면크게 보기

여기까지는 어느 나라에서나 통하는 이야기입니다. 한국에서 플랫폼을 지을 때는 세 가지가 더 붙습니다.

'국내 리전에서 처리'가 요건이면 최신 프런티어 모델은 쓸 수 없다

가장 먼저 확인해야 하고, 가장 자주 뒤늦게 발견되는 사실입니다. 10월 3일 각 클라우드의 리전별 지원 문서를 확인한 결과입니다.

경로서울 리전 안에서 처리되는 모델서울에서 부를 수는 있지만 다른 나라에서 처리될 수 있는 모델
Amazon Bedrock (ap-northeast-2)Claude Opus 5, Sonnet 5 (한 세대 전)Opus 5.5, Sonnet 5.5, Fable 5.1, GPT-6 Astra, GPT-5.6 등은 글로벌 교차 리전 추론만
Google Cloud (asia-northeast3)Gemini 2.5 Flash, 임베딩Gemini 3.x와 Claude는 서울 리전에 없음 (일부는 도쿄)
Azure (koreacentral)종량제는 임베딩 모델만. 용량을 미리 사는 방식으로 gpt-5.4까지최신 모델은 '데이터 존'(아시아·태평양 어느 나라든) 단위
OpenAI 직접저장 데이터의 국내 보관만 제공추론 위치 보장은 계획 단계

정리하면, "데이터가 국내에서 처리돼야 한다"는 요건이 붙는 순간 선택지는 한 세대 전 프런티어 모델이거나 오픈 웨이트 모델의 자체 서빙입니다. 반대로 그 요건이 '국내 저장'이나 '계약상 통제' 수준이라면 선택지가 훨씬 넓습니다. 요건의 정확한 문구를 법무·보안 담당자와 설계 첫 주에 확정해야 하는 이유입니다. 공공 부문은 국가 망 보안체계(N2SF)가 데이터를 기밀(C)·민감(S)·공개(O)로 나눠, 공개 등급은 상용 클라우드를 논리적 분리로 쓸 수 있고 민감 등급은 국내 전용 장비를 요구합니다. 등급별로 다른 사다리 단에 서는 설계가 필요합니다.

자체 서빙할 수 있는 한국어 모델이 늘었다

다행히 사다리 ⑥⑦에서 돌릴 수 있는 국산 오픈 웨이트 모델이 올해 크게 늘었습니다. 정부의 '독자 AI 파운데이션 모델' 사업에 참여한 회사들이 모델을 잇달아 공개한 덕입니다. 다만 라이선스가 제각각이라 상업 이용 전에 반드시 원문을 확인해야 합니다. 허깅페이스 모델 카드 기준입니다.

모델라이선스 (10월 3일 허깅페이스 표기)상업 이용
LG K-EXAONE 2.0 (약 750B)Apache-2.0가능
SKT A.X-K2 (약 690B) · A.X-K1Apache-2.0가능
KT 믿:음 2.0 Base·MiniMIT가능
업스테이지 Solar-Open2-250BUpstage Solar License가능, 파생 모델에 'Solar' 표기 조건
네이버 HyperCLOVA X SEED (8B~32B)자체 라이선스가능, 월 사용자 1천만 초과나 네이버와 경쟁하는 서비스는 예외
카카오 Kanana-2 (30B)Kanana License가능, 월 사용자 1천만 초과 시 별도 계약
LG EXAONE 4.5 (33B, 비전)EXAONE NC불가(비상업)

큰 모델은 수백 B 규모라 GPU 여러 장이 필요합니다(업스테이지는 Solar Open 2가 B200 두 장에서 돈다고 밝혔습니다). 작은 팀이라면 8B~32B급 모델을 ⑤ 서버리스 GPU나 GPU 한 장에 올리는 구성이 현실적입니다. 토큰 과금으로 쓰려면 업스테이지 API(Solar Pro 4: 100만 토큰당 입력 0.30달러, 출력 1.20달러)가 있습니다.

GPU 수급에서는 정부가 추경으로 확보한 1만 3천 장(네이버클라우드·NHN클라우드·카카오 운영)과, 8월 3일 해남에서 착공한 국가AI컴퓨팅센터(2028년까지 1만 5천 장 목표)가 변수입니다. 국산 AI 반도체도 서빙 쪽에서 움직이고 있습니다. 리벨리온은 7월에 서버 한 대로 SKT의 519B 모델을 구동했다고 발표했고, 퓨리오사AI는 180W급 RNGD의 양산을 늘리고 있습니다. 다만 두 회사 모두 초당 토큰 같은 서빙 지표를 제3자가 잰 공개 자료는 아직 드뭅니다. 도입을 검토한다면 우리 모델과 우리 트래픽으로 직접 재야 합니다.

AI 기본법: 지금은 계도기간, 그래도 기록은 지금부터

AI 기본법은 2026년 1월 22일 시행됐고, 최소 1년의 계도기간이 운영 중입니다. 플랫폼을 운영하는 입장에서 미리 구조에 넣어 둘 것은 세 가지입니다. 생성물이라는 사실을 알리는 표시(딥페이크는 눈에 보이는 표시, 그 밖의 생성물은 비가시 워터마크도 허용), 고영향 영역에 해당하는지의 판단과 문서 보관(5년), 그리고 그 근거가 될 사용 기록입니다. 의무는 모델을 만든 쪽뿐 아니라 가져다 서비스하는 쪽에도 걸립니다. 6장에서 게이트웨이에 남기라고 한 '누가, 어떤 모델을, 무엇에 썼는지'의 기록이 규제 대응의 바탕이 됩니다. 세부 기준은 시행령과 가이드라인으로 계속 구체화되고 있으니 법무 검토를 거치세요.


12. 방향성: 앞으로 1년을 보는 일곱 가지 관점

조사한 것을 겹쳐 놓고 보면 방향이 몇 갈래로 모입니다.

① 모델은 교체 부품이 되고, 평가 세트가 자산이 됩니다. 올해에만 주요 모델 세대가 여러 번 바뀌었고, 같은 모델이 여러 클라우드와 수십 개 호스트에서 팔립니다. 새 모델이 나온 날 우리 서비스에 써도 되는지 하루 만에 답할 수 있는 팀과 몇 주가 걸리는 팀의 차이는 평가 세트에서 납니다.

② 캐시가 아키텍처를 정합니다. 가격표(읽기 40분의 1), 프로토콜(MCP의 도구 순서 고정), 라우팅(접두사 인지), 벤치마크(캐시 적중 95% 조건)가 모두 같은 쪽을 가리킵니다. 앞으로의 설계 검토에서 "이 변경이 접두사를 흔드는가"는 "이 변경이 인덱스를 타는가"만큼 기본 질문이 됩니다.

③ 서빙은 포트폴리오입니다. 한 단에 올인하지 않고, 작업별로 단을 배정하고, 기본 부하는 전용으로 피크는 토큰 과금으로 받습니다. GPU 임대료 반등은 이 유연성의 값을 올렸습니다.

④ 하니스는 덜어내는 방향으로 진화합니다. 모델이 좋아질 때마다 스캐폴딩의 일부가 짐이 됩니다. 분기마다 "이 단계를 빼도 평가가 유지되는가"를 실험하는 팀이 비용과 속도에서 앞서갑니다.

⑤ 과금은 토큰에서 '일'로 옮겨 갑니다. 인프라 층은 실제로 일한 CPU 시간과 세션 시간으로, 애플리케이션 층은 대화·해결 건당 과금으로 실험이 이어지고 있습니다. 어느 쪽이든 작업 단위로 원가를 아는 플랫폼만 가격을 정할 수 있습니다. 미터링은 나중에 붙이는 기능이 아닙니다.

⑥ 도구 시장은 계속 합쳐집니다. 이 글의 표에 적은 것만 1년 사이 인수·중단이 여섯 건입니다. 표준(OpenAI 호환 API, MCP, OpenTelemetry)에 기대고 고유 기능에는 얇게 기대는 편이 안전합니다.

⑦ 자율이 길어질수록 권한이 설계의 중심이 됩니다. METR의 측정으로 모델이 50% 확률로 끝내는 작업의 길이는 2023년 이후 약 129일마다 두 배가 됐고, 최상위 모델은 이미 이 벤치마크가 믿을 만하게 잴 수 있는 범위(16시간)를 넘어섰습니다. 몇 시간씩 혼자 일하는 에이전트를 받아들일 플랫폼의 기본기는 지능이 아니라 신원, 권한, 승인, 기록입니다.


마치며: 이번 분기에 해 볼 것

층이번 분기에 해 볼 것
서빙작업 종류별로 입력 대 출력 비와 하루 토큰량을 재고, 사다리의 어느 단이 맞는지 표로 정리합니다. 전용 GPU가 있다면 평균 사용률을 재 봅니다.
서빙(직접 운영)부하 분산이 라운드로빈인지 확인합니다. 캐시 적중률과 첫 토큰 시간을 서버 수별로 재고, 엔진에 동시 처리 상한을 겁니다.
게이트웨이모든 모델 호출이 문 하나를 지나게 합니다. 사용자·팀·작업 식별자를 기록하고, 폴백 경로의 모델도 평가 세트를 통과시킵니다. 게이트웨이 패키지 버전을 고정합니다.
컨텍스트·캐시캐시 적중률을 대시보드 첫 줄에 올립니다. 시스템 프롬프트 앞부분에 시각·사용자 정보가 있는지, 도구 순서가 고정인지 점검합니다.
런타임가장 긴 에이전트 작업이 배포 중에 죽으면 어떻게 되는지 실험합니다. 사람 승인을 기다리는 세션이 자원을 붙잡고 있는지 봅니다.
평가·관측실제 기록 100건을 읽고 실패 유형 다섯 개를 뽑습니다. LLM 판정기가 있다면 사람이 채점한 100건으로 TPR과 TNR을 잽니다.
보안·거버넌스에이전트가 쓰는 토큰의 권한 범위를 목록으로 만들고, 그 권한으로 백업을 지울 수 있는지 확인합니다.
한국 요건'국내 처리'인지 '국내 저장'인지 요건 문구를 확정하고, 쓰려는 모델이 서울 리전 안에서 처리되는지 문서로 확인합니다.

그랩의 문장으로 돌아가면, 에이전트의 생각하는 부분은 오후 한나절이면 만듭니다. 나머지 2주, 곧 서빙 단을 고르고, 문을 세우고, 캐시를 지키고, 죽지 않게 하고, 재고, 권한을 좁히는 일이 2026년의 AI 플랫폼 개발입니다. 그리고 그 2주를 한 시간으로 줄여 주는 것이 잘 지은 플랫폼입니다.

함께 읽으면 좋은 글: 넷플릭스는 왜 LLM을 직접 서빙하는가 (1부) · 제번스의 역설과 추론 경제학 · AIP 경쟁 시대 · MCP 2026-07-28 사양 해설 · 프롬프트 캐시는 어떻게 동작하는가

참고한 자료 (가격·버전·상태는 2026년 10월 3일 확인)