GPUNVIDIAA100H100H200L40SL4B200B300GB300RTX PRO 6000DGXHGXAmpereHopperAda LovelaceBlackwellRubinNVLinkMIGHBMVRAMGPU 선택AI 인프라
GPU 고르는 법 2026 — A100·H100·L40S·B200, 이름만 봐도 아는 엔비디아 GPU 가이드
"H100이 좋다던데 우리도 그걸 사면 되나요?" GPU 상담에서 가장 많이 듣는 질문입니다. 이 글은 엔비디아 GPU를 차 고르듯 고를 수 있게 정리했습니다. A100의 A, H100의 H, L40S의 L이 무엇의 약자인지(과학자 이름입니다), 연산용 혈통과 그래픽 겸용 혈통이 어떻게 다른지, 제원표에서 봐야 할 숫자 네 개(메모리·대역폭·연결·전력)가 각각 무엇을 정하는지, 그리고 Ampere·Hopper·Ada Lovelace·Blackwell·Rubin 세대의 대표 제품을 언제 고르고 언제 피해야 하는지를 다룹니다. DGX가 GPU 이름이 아니라는 것, 서버를 사 놓고 놓을 자리가 없어지는 이유, 살지 빌릴지의 기준까지. 직접 눌러 보는 이름 해독기, 메모리 계산기, 전력 계산기, GPU 추천기 등 위젯 6개가 들어 있습니다.
GPU 도입을 상담하다 보면 대화가 대개 이렇게 시작됩니다. "H100이 좋다던데, 저희도 그걸로 하면 되나요?" 그러면 저희는 되묻습니다. 무엇을 돌리실 건가요, 몇 명이 쓰나요, 그리고 어디에 놓으실 건가요.
차를 살 때 "제일 좋은 차 주세요"라고 하지 않는 것과 같습니다. 동네 배달에는 스쿠터가, 가족 나들이에는 SUV가, 이삿짐에는 트럭이, 컨테이너 수백 개에는 화물열차가 맞습니다. 화물열차는 가장 많이 싣지만 선로가 깔린 곳에서만 달립니다. GPU도 그렇습니다. 가장 비싼 GPU는 가장 많은 일을 하지만, 전기와 냉각이라는 선로가 필요합니다.
이 글은 엔비디아 서버용 GPU를 이름 읽는 법부터 고르는 법까지 순서대로 설명합니다. 제원과 가격은 2026년 10월 3일 기준으로 엔비디아 사양서와 각 클라우드 가격표를 확인했습니다.
✅
바쁜 분을 위한 요약.
① 이름의 첫 글자는 세대입니다. A는 Ampere(2020), H는 Hopper(2022), L은 Ada Lovelace(2022~23), B는 Blackwell(2024~25). 모두 과학자 이름입니다.
② 엔비디아 GPU에는 두 혈통이 있습니다. 연산 전용(A100·H100·B200)과 그래픽 겸용(L4·L40S·RTX PRO 6000). 메모리 종류, 형태, 가격이 여기서 갈립니다.
③ 제원표에서 볼 숫자는 넷입니다. 메모리(들어가느냐), 메모리 대역폭(빠르냐), 연결(여러 장이 한 팀이 되느냐), 전력(놓을 수 있느냐).
④ 작은 모델과 영상은 L4, 범용은 L40S·RTX PRO 6000, 큰 모델과 학습은 H100·H200·B200, 초대형은 랙 단위(GB300 NVL72)입니다.
⑤ DGX는 GPU가 아니라 엔비디아가 직접 만든 완제품 서버의 이름입니다.
⑥ 8장짜리 연산용 서버는 한 대가 10kW를 넘습니다. 사기 전에 놓을 자리부터 확인합니다.
⑦ 최신이 항상 정답은 아닙니다. 단종된 A100이 지금도 팔리듯, 일에 맞는 등급이 정답입니다.
A100, H100, L40S, B200. 암호처럼 보이지만 규칙이 있습니다. 엔비디아는 GPU 설계가 크게 바뀔 때마다, 곧 세대(아키텍처)마다 과학자의 이름을 붙입니다. 그리고 제품명의 첫 글자가 그 과학자의 머리글자입니다.
이름에 얽힌 이야기 둘만 짚겠습니다.
그레이스 호퍼는 사람이 읽을 수 있는 말로 프로그램을 짜는 길을 연 컴파일러의 개척자입니다. 엔비디아는 이 세대에서 GPU에 호퍼(Hopper)라는 이름을, 함께 내놓은 CPU에 그레이스(Grace)라는 이름을 붙였습니다. 둘을 한 모듈로 합친 제품은 그래서 '그레이스 호퍼'가 됩니다. 2026년 세대도 같은 방식입니다. CPU가 베라(Vera), GPU가 루빈(Rubin)이고, 합치면 암흑 물질의 증거를 찾아낸 천문학자 베라 루빈입니다.
이름 뒤의 숫자와 글자에도 규칙이 있습니다.
자리
뜻
예
첫 글자
세대(아키텍처)
T = Turing, A = Ampere, H = Hopper, L = Ada Lovelace, B = Blackwell
숫자
세대 안의 등급. 한 자리는 저전력 소형, 두 자리는 카드형 중간 등급, 세 자리는 최상위 연산용
L4 < L40S, A10 < A100, H100 < H200
앞의 G
엔비디아 CPU(Grace)와 한 몸
GB200 = Grace CPU + B200 GPU 2개
뒤의 S
서버용 강화판
L40S = L40을 데이터센터 AI 용도로 다듬은 판
NVL72
NVLink로 묶은 GPU 72장짜리 랙
GB300 NVL72
DGX · HGX
GPU가 아니라 서버(시스템)의 이름
DGX B200 = B200 8장이 든 엔비디아 완제품 서버
아래 해독기에 아무 이름이나 넣어 보세요.
⚠️
숫자를 세대 너머로 비교하면 안 됩니다. A100과 H100은 둘 다 100이지만 한 세대 차이가 납니다. L40S의 40은 "100의 40% 성능"이 아니라 "카드형 중간 등급"이라는 뜻입니다. 숫자는 같은 글자 안에서만 크기를 비교할 수 있습니다.
족보에서 눈여겨볼 대목이 있습니다. Hopper(H)와 Ada Lovelace(L)는 차례로 나온 세대가 아니라 같은 시기에 나온 두 갈래입니다. 엔비디아의 서버용 GPU는 출발점이 다른 두 혈통으로 나뉩니다.
구분
연산 전용 혈통
그래픽 겸용 혈통
대표 제품
A100, H100, H200, B200, B300
T4, L4, A10, L40S, RTX PRO 6000 Blackwell
출발점
처음부터 데이터센터 계산용
그래픽 카드를 서버용으로 다듬음
메모리 종류
HBM. 메모리 칩을 층층이 쌓아 통로를 넓힌 고대역폭 메모리
GDDR. 그래픽 카드에 쓰는 메모리
형태
전용 기판에 얹는 모듈(SXM)이 주력. 8장이 한 묶음
일반 서버 슬롯에 꽂는 카드(PCIe)
GPU끼리 직통 연결(NVLink)
있음
없음
화면 출력·레이트레이싱·영상 인코딩
주 용도가 아님
잘함
전력
장당 400~1,200W (Rubin은 2,000W 이상)
장당 70~600W
들어가는 서버
DGX·HGX 같은 전용 서버, 고밀도 랙
델·HPE·레노버 등의 일반 서버
탈것으로 치면
짐만 싣는 대형 트럭과 화물열차
사람도 짐도 싣는 경차와 SUV
이 구분 하나로 많은 질문이 풀립니다. "L40S는 H100의 저가형인가요?" 아닙니다. 혈통이 다릅니다. L40S는 3D 렌더링과 영상 인코딩까지 하는 다목적 카드이고, H100은 계산만 하는 대신 메모리가 훨씬 빠르고 여러 장을 한 몸처럼 묶을 수 있습니다. SUV와 트럭 중 어느 쪽이 더 좋으냐는 질문에 답이 없는 것과 같습니다. 무엇을 싣느냐에 달렸습니다.
💡
HBM은 한국이 만드는 부품입니다. 연산 전용 혈통의 성능을 가르는 HBM(고대역폭 메모리)은 SK하이닉스와 삼성전자, 미국 마이크론 세 곳이 만듭니다. A100의 HBM2e, H100의 HBM3, H200과 B200의 HBM3e, Rubin의 HBM4로 세대가 올라갈 때마다 GPU의 '메모리 대역폭'이 뜁니다. GPU 세대 교체는 절반쯤 메모리 세대 교체입니다.
3. 제원표에서 볼 숫자는 넷뿐입니다
GPU 사양서에는 코어 수, 부동소수점 연산 성능 등 숫자가 빼곡합니다. 고르는 사람에게 필요한 것은 네 가지입니다.
두 번째 숫자는 사양서 구석에 있지만 LLM에서는 속도를 좌우합니다. 메모리 대역폭은 작업대에서 물건을 1초에 얼마나 꺼내 올 수 있느냐입니다.
LLM은 글자(토큰) 하나를 쓸 때마다 모델 가중치 전체를 한 번 훑습니다. 32GB짜리 모델이라면 토큰 하나에 32GB를 읽어야 합니다. 그러면 한 사람에게 글을 써 주는 속도의 상한은 간단한 나눗셈으로 나옵니다. 대역폭 ÷ 모델 크기.
GPU
메모리 종류
메모리 대역폭
32GB 모델의 1인 토큰 속도 상한
L40S
GDDR6
864GB/s
초당 약 27토큰
RTX PRO 6000 Blackwell
GDDR7
1,597GB/s
초당 약 50토큰
A100 80GB
HBM2e
2,039GB/s
초당 약 64토큰
H100
HBM3
3,350GB/s
초당 약 105토큰
H200
HBM3e
4,800GB/s
초당 약 150토큰
B200
HBM3e
8,000GB/s
초당 약 250토큰
표의 마지막 열은 대역폭을 32로 나눈 이론적 상한이고 실제 속도는 이보다 낮습니다. 여러 요청을 묶어 처리하면 전체 처리량은 이보다 훨씬 커집니다. 그래도 순서는 그대로입니다. 2020년에 나온 A100이 2023년에 나온 L40S보다 글을 빨리 쓰는 이유가 여기 있습니다. 창고 크기가 아니라 문의 너비가 다릅니다.
반대로 이미지 생성이나 영상 분석, 작은 모델은 대역폭보다 연산 성능이 중요해서 L40S가 제 몫을 합니다. 내 일이 '큰 모델로 글 쓰기'인지 아닌지가 이 숫자의 무게를 정합니다.
GPU 한 장에 안 들어가는 일은 여러 장에 나눠 싣습니다. 이때 GPU들은 끊임없이 서로 데이터를 주고받습니다. 그 통로가 세 번째 숫자입니다.
통로
속도
쓰는 제품
서버의 일반 슬롯(PCIe 4.0 x16)
약 32GB/s
L4, L40S 등 카드형 전부
NVLink (Ampere)
600GB/s
A100
NVLink (Hopper)
900GB/s
H100, H200
NVLink 5 (Blackwell)
1,800GB/s
B200, B300, GB200·GB300
NVLink는 GPU끼리 직접 잇는 전용 다리입니다. 다리가 없으면 GPU들은 서버의 일반 통로를 거쳐 이야기해야 하고, 그 속도는 수십 분의 일입니다.
다리가 꼭 필요한 일과 필요 없는 일이 있습니다. 모델을 학습시키거나, 한 장에 안 들어가는 큰 모델을 여러 장에 나눠 돌릴 때는 다리가 성능을 정합니다. 반면 작은 모델을 카드마다 하나씩 따로 띄워 요청을 나눠 받는 서비스라면 GPU끼리 이야기할 일이 없어 다리가 필요 없습니다. L40S 8장 서버가 추론 서비스에서 잘 쓰이는 이유입니다.
④ 전력: 놓을 수 있는가
네 번째 숫자는 성능이 아니라 현실의 문제입니다. 72W짜리 L4는 어떤 서버에도 꽂히지만, 장당 1,000W 안팎인 B200은 전용 서버와 고밀도 랙, 경우에 따라 수랭 설비가 필요합니다. 이 이야기는 6장에서 따로 다룹니다.
네 숫자를 하나씩 골라 열 가지 GPU를 줄 세워 보세요.
4. 세대별로 한 장씩 뜯어 보기
이제 세대마다 대표 제품을 보겠습니다. 먼저 한눈에 보는 표입니다.
GPU
세대 · 혈통
메모리
대역폭
최대 전력
한 줄 정체
T4
Turing · 그래픽 겸용
16GB
320GB/s
70W
가장 싼 스쿠터. 판매 종료, 클라우드에는 현역
L4
Ada · 그래픽 겸용
24GB
300GB/s
72W
T4의 후계. 어디든 꽂히는 경차
L40S
Ada · 그래픽 겸용
48GB
864GB/s
350W
그래픽도 AI도 하는 SUV
RTX PRO 6000 Blackwell (서버판)
Blackwell · 그래픽 겸용
96GB
1,597GB/s
600W
L40S의 후계. 일반 서버에 꽂는 96GB
A100
Ampere · 연산 전용
40 / 80GB
2,039GB/s
400W
단종됐지만 임대 시장의 가성비 트럭
H100
Hopper · 연산 전용
80GB
3,350GB/s
700W
생성형 AI 시대의 기준 트럭
H200
Hopper · 연산 전용
141GB
4,800GB/s
700W
H100에 적재함을 1.76배로
B200
Blackwell · 연산 전용
180GB
8,000GB/s
약 1,000W
2026년의 주력 트레일러
B300
Blackwell Ultra · 연산 전용
약 270GB
—
약 1,200W
B200의 강화판
GB300 NVL72
Blackwell Ultra · 랙
72장 합계 약 20TB
—
랙당 약 120kW
GPU 72장이 한 몸인 화물열차
B200과 B300의 전력은 엔비디아가 낱개 수치를 공개하지 않아 SemiAnalysis의 추정치를 적었습니다. B300의 메모리는 엔비디아 문서 안에서도 288GB, 약 278GB, 약 262GB로 표기가 엇갈려 중간값을 썼습니다.
2020년에 나온 A100은 "대형 GPU 한 장을 여럿이 나눠 쓴다"는 방식을 정착시킨 제품입니다. MIG(Multi-Instance GPU)라는 기능으로 한 장을 최대 7개의 독립된 작은 GPU로 쪼갤 수 있습니다. 80GB 모델이면 10GB짜리 일곱 개가 되고, 조각끼리는 메모리와 연산이 분리돼 옆 사람이 무거운 일을 해도 내 조각은 느려지지 않습니다. 케이크를 통째로 한 사람에게 주면 남기지만, 잘라서 나누면 일곱 명이 먹습니다. 작은 모델 여러 개를 돌리거나 여러 팀이 개발용으로 나눠 쓸 때 요긴합니다. 이 기능은 이후 H100, H200, B200에 이어졌고, 그래픽 겸용 혈통에서는 RTX PRO 6000 Blackwell(최대 4조각)부터 들어왔습니다. L40S에는 없습니다.
A100은 엔비디아의 현행 제품표에서 빠졌고 유통사 목록에서도 단종 제품으로 분류됩니다. 그런데도 임대 시장에서는 여전히 인기입니다. 80GB의 HBM 메모리를 가장 싸게 빌릴 수 있기 때문입니다.
이럴 때 고르세요: 클라우드에서 40B급 이하 모델을 싸게 돌리거나 미세조정할 때. 여러 팀이 한 장을 쪼개 쓸 때.
이럴 땐 피하세요: 새로 구매할 때(신품을 구하기 어렵고 지원 기간이 짧습니다). 8비트(FP8) 연산 가속이 필요할 때.
Hopper — H100·H200: 생성형 AI 시대의 기준
2022년에 나온 H100은 챗GPT 이후의 AI 붐을 받아 낸 GPU입니다. 트랜스포머 모델에 맞춰 16비트와 8비트 연산을 섞어 쓰는 트랜스포머 엔진을 넣었고, 메모리(HBM3)와 GPU 간 통로(NVLink 900GB/s)를 모두 키웠습니다. 엔비디아가 내세운 수치는 A100 대비 학습 최대 4배입니다(대규모 클러스터 기준 추정치). GPU 임대료를 말할 때 "H100 시간당 얼마"가 기준이 될 만큼 표준이 됐습니다.
H200은 같은 칩에 메모리만 바꾼 개량형입니다. 80GB가 141GB로, 대역폭이 3,350GB/s에서 4,800GB/s로 늘었습니다. 엔비디아 발표로는 Llama 2 70B 추론에서 H100의 1.9배입니다. 연산 칩은 그대로인데 메모리만 바꿔서 두 배 가까이 빨라졌다는 점이, 3장에서 본 "LLM 속도는 메모리가 정한다"의 좋은 증거입니다.
세대 차이를 실측으로 보면 이렇습니다. GPU 클라우드 Jarvislabs가 같은 조건(vLLM, Qwen3-32B)으로 잰 초당 처리 토큰은 A100이 699, H100이 1,251이었고, H100에서 8비트(FP8)로 바꾸자 2,795까지 올랐습니다. A100은 FP8 가속이 없으므로 같은 모델에서 네 배 차이가 납니다. 새 세대의 값어치는 칩 속도만이 아니라 "더 작은 숫자로 계산해도 되는 기능"에서도 나옵니다.
⚠️
같은 H100이라도 형태를 확인하세요. 흔히 말하는 H100은 전용 기판에 얹는 SXM판(700W, 3,350GB/s)입니다. 일반 슬롯에 꽂는 H100 PCIe판은 이름만 같고 메모리가 한 세대 전(HBM2e, 2,000GB/s)이며 전력 한도도 350W입니다. 견적서에 "H100"이라고만 적혀 있으면 어느 쪽인지 물어야 합니다.
이럴 때 고르세요: 40B~120B급 모델의 서비스와 미세조정, 여러 장을 묶는 학습. 임대 물량이 가장 많아 구하기 쉽습니다.
이럴 땐 피하세요: 새로 구매한다면 H100보다 H200이나 B200을 봅니다. 엔비디아의 현행 제품표에 Hopper 세대는 H200만 남아 있습니다. 화면 출력이나 영상 인코딩이 필요한 일에는 맞지 않습니다(인코더가 없습니다).
Ada Lovelace — L4·L40S: 어디에나 들어가는 범용
L 계열은 "전용 서버 없이 지금 있는 서버에 꽂는다"가 핵심입니다.
L4는 72W입니다. 보조 전원 케이블 없이 슬롯 전력만으로 돌고, 높이가 낮은 한 칸짜리 카드라 거의 모든 서버에 들어갑니다. 24GB 메모리로 8B급 LLM, 임베딩, 음성 인식, OCR, 영상 분석을 맡습니다. 영상 디코더가 4개 있어 CCTV 영상 여러 채널을 동시에 풀어 분석하는 일에 특히 잘 맞습니다.
L40S는 48GB 메모리에 레이트레이싱 코어와 영상 인코더·디코더를 갖춘 다목적 카드입니다. 엔비디아는 출시 당시 A100 대비 생성형 AI 추론 최대 1.2배, 학습 최대 1.7배를 내세웠습니다. 2023~24년 H100을 몇 달씩 기다려야 하던 시기에 "바로 구할 수 있고 일반 서버에 8장이 들어가는 GPU"로 널리 퍼졌습니다. 다만 NVLink와 MIG가 없다는 점은 기억해야 합니다.
이럴 때 고르세요: 3D·디지털 트윈·영상 처리와 AI를 한 서버에서 할 때. 10B급 모델을 카드마다 하나씩 띄워 서비스할 때. 기존 전산실에 놓아야 할 때.
이럴 땐 피하세요: 한 장에 안 들어가는 큰 모델을 빠르게 돌려야 할 때(카드 간 다리가 없고 메모리가 느립니다). 대규모 학습.
Blackwell — B200·B300·GB300, 그리고 RTX PRO 6000
Blackwell은 2026년의 주력 세대이고, 판매 단위가 달라진 세대이기도 합니다.
B200은 장당 180GB, 대역폭 8,000GB/s입니다. 4비트 연산(FP4)을 지원해 같은 메모리에 더 큰 모델을 올립니다. 8장을 얹은 공랭 서버(DGX B200, HGX B200)로 팔립니다. 엔비디아는 DGX B200이 DGX H100 대비 학습 3배, 추론 15배라고 발표했고, 독립 벤치마크인 InferenceX는 B200이 H100보다 달러당 성능에서 약 2.9배(8비트 기준), 4비트 연산까지 쓰면 8.2배 앞선다고 측정했습니다.
B300(Blackwell Ultra)은 메모리와 전력을 더 키운 강화판입니다.
GB200·GB300 NVL72는 카드도 서버도 아닌 랙입니다. GPU 72장과 CPU 36개를 수랭 랙 하나에 넣고 NVLink로 전부 이어, 랙 전체가 한 대의 컴퓨터처럼 움직입니다. 최신 학습 벤치마크(MLPerf Training v6.0, 2026년 6월)에서 GB300 NVL72는 같은 규모의 GB200 NVL72보다 최대 1.6배 빨랐습니다. 랙 하나가 약 120kW를 쓰고 냉각수 배관이 필요하므로, 이것을 들이는 일은 장비 구매보다 건물 공사에 가깝습니다.
그리고 그래픽 겸용 혈통의 Blackwell이 RTX PRO 6000 Blackwell 서버판입니다. 96GB(GDDR7), 최대 600W, MIG 4조각. 엔비디아가 직접 L40S를 "이전 세대"라고 부르며 후계로 내세우는 제품이고, 일반 서버에 최대 8장을 꽂는 구성을 'RTX PRO 서버'라는 이름으로 서버 회사들이 팝니다. L4급의 후계로는 2026년 3월에 RTX PRO 4500 Blackwell 서버판(32GB, 165W, 한 칸)이 발표됐습니다. L 다음 글자는 없습니다. 그래픽 겸용 혈통은 Blackwell 세대부터 'RTX PRO'라는 이름을 씁니다.
이럴 때 고르세요: 100B급 이상 모델, 새로 구매하는 학습용 장비, 달러당 처리량이 중요한 대규모 서비스는 B200·B300. 일반 전산실에 큰 메모리가 필요하면 RTX PRO 6000 Blackwell.
이럴 땐 피하세요: 놓을 자리(전력·냉각)가 준비되지 않았을 때. 작은 모델 몇 개 돌리는 일에는 과합니다.
Rubin — 지금 살 수 있나요?
Rubin은 2026년 세대입니다. GPU 한 장에 HBM4 메모리 288GB, 대역폭 22,000GB/s(B200의 약 2.7배)이고, GPU 72장과 Vera CPU 36개를 묶은 Vera Rubin NVL72 랙이 주력입니다. 엔비디아는 5월 말에 "올가을 양산 출하 시작"을 알렸고, 9월 16일 공개된 MLPerf Inference v6.1에는 Vera Rubin NVL72가 미리보기로 참가해 GB300 NVL72 대비 최대 3.7배(Qwen3-VL), 2.5배(DeepSeek-R1)를 기록했습니다.
고객 입장에서 정리하면 이렇습니다. Rubin은 나왔지만 아직 대부분의 고객이 살 수 있는 물건은 아닙니다. 초기 물량은 대형 클라우드로 가고, 일반 기업은 2027년에 클라우드 임대로 먼저 만나게 될 가능성이 큽니다. 그리고 8장짜리 Rubin 서버(DGX Rubin NVL8)는 한 대가 약 24kW입니다. 세대가 올라갈수록 "놓을 자리" 문제는 커집니다.
"Rubin이 나오니 기다릴까요?"라는 질문에는 이렇게 답합니다. 지금 할 일이 있으면 지금 맞는 것을 쓰세요. GPU는 매년 새 세대가 나오고, 기다림에는 끝이 없습니다. 구매가 망설여지면 빌리는 것이 기다림의 대안입니다.
"DGX로 주세요"라는 말을 자주 듣습니다. DGX는 GPU의 종류가 아니라 엔비디아가 직접 만들어 자기 상표로 파는 완제품 서버의 이름입니다. GPU를 사는 방법은 크게 세 가지입니다.
방법
무엇인가
차로 치면
맞는 경우
DGX
엔비디아가 GPU·CPU·네트워크·소프트웨어를 조립·검증해 파는 완제품. 3년 지원 포함
제조사 직영 풀옵션 완성차
운영 인력이 적고, 문제가 생기면 한 곳에 전화하고 싶을 때
HGX
엔비디아가 설계한 GPU 8장짜리 기판을 델·HPE·슈퍼마이크로·레노버 등이 자기 서버에 넣어 파는 것
엔진과 차대가 같은 다른 브랜드 차
기존에 거래하는 서버 회사가 있고, CPU·저장장치 구성을 고르고 싶을 때
카드형 GPU 서버
일반 서버에 L4·L40S·RTX PRO 6000 같은 카드를 꽂는 구성. 'RTX PRO 서버'가 대표
부품을 골라 조립
기존 전산실에 놓아야 하거나, 그래픽 겸용이 필요할 때
DGX와 HGX는 속에 든 GPU 기판이 같습니다. 성능 차이가 아니라 누가 조립하고 누가 책임지느냐의 차이입니다. MGX라는 이름도 종종 보이는데, 이것은 서버 회사들이 여러 GPU·CPU 조합을 같은 틀에 끼울 수 있게 엔비디아가 정한 조립 규격입니다.
DGX의 역사는 그대로 GPU 세대의 역사입니다.
DGX
속에 든 것
GPU 메모리 합계
최대 전력 · 크기
상태
DGX-1 (2016)
P100 또는 V100 8장
128~256GB
3.5kW · 3U
퇴역
DGX A100 (2020)
A100 8장
320 / 640GB
6.5kW · 6U
단종. 출시가 19만 9천 달러부터
DGX H100 / H200
H100 또는 H200 8장
640GB / 1,128GB
약 10.2kW · 8U
H200판이 현행
DGX B200
B200 8장
1,440GB
약 14.3kW · 10U, 공랭
현행
DGX B300
Blackwell Ultra 8장
약 2.1~2.3TB
약 14~14.5kW · 10U, 공랭
현행
DGX GB300
GB300 NVL72 랙 (GPU 72장)
약 20TB
랙당 약 120kW, 수랭
현행
DGX Rubin NVL8 · Vera Rubin NVL72
Rubin 8장 · 72장
2.3TB · 20.7TB
NVL8 약 24kW
발표
10년 사이 한 대의 전력이 3.5kW에서 24kW로 일곱 배가 됐습니다. 성능은 그보다 훨씬 많이 늘었지만, 전력과 냉각이라는 청구서도 함께 커졌습니다.
DGX라는 이름을 단 책상용 제품도 둘 있습니다.
DGX Spark: 가로세로 15cm, 무게 1.2kg의 소형기입니다. 서버용 GPU가 아니라 전용 칩(GB10)에 CPU와 GPU가 메모리 128GB를 함께 쓰는 구조입니다. 240W 어댑터로 돌고 책상 콘센트에 꽂습니다. 메모리가 넉넉해 큰 모델이 올라가기는 하지만 속도는 서버용 GPU에 비할 바가 아닙니다. 개발자가 모델을 만져 보고 시제품을 만드는 용도입니다.
DGX Station: 책상 옆에 두는 타워형 워크스테이션입니다. Blackwell Ultra GPU 한 개와 메모리 합계 748GB를 넣고 최대 1,600W를 씁니다. 사무실 전기로 돌지만 다른 기기와 나눠 쓰지 않는 전용 회로를 권합니다. 서버실 없는 연구실과 소규모 팀을 위한 물건입니다.
💡
DGX를 고를지 묻는 세 가지 질문. ① GPU 서버를 운영해 본 인력이 있는가. 없다면 통합 지원의 값어치가 큽니다. ② 이미 거래하는 서버 회사와 유지보수 계약이 있는가. 있다면 같은 회사의 HGX 서버가 관리하기 쉽습니다. ③ 화면 출력·영상·3D가 필요한가. 그렇다면 DGX가 아니라 카드형 서버 쪽입니다.
GPU 도입에서 가장 자주 일정을 늦추는 것은 GPU가 아니라 건물입니다. 서버는 도착했는데 전기가 모자라 켜지 못하는 일이 드물지 않습니다.
감을 잡기 위한 숫자 몇 개입니다. 가정용 벽걸이 에어컨이 1~2kW쯤 씁니다. DGX H100 한 대는 10.2kW, DGX B200은 14.3kW입니다. 서버 한 대가 에어컨 대여섯 대에서 여덟 대만큼 전기를 쓰고, 그만큼의 열을 그대로 뿜어냅니다. 일반 사무용 전산실의 랙 하나는 흔히 4~8kW로 설계돼 있어서, 연산용 8장 서버 한 대가 랙 하나의 한도를 넘습니다.
장소
감당하는 전력
들어가는 것
책상 · 사무실 콘센트
회로당 약 3kW
DGX Spark, DGX Station(전용 회로), L4를 꽂은 소형 서버
일반 전산실 랙
4~8kW
L40S·RTX PRO 6000 카드형 서버(구성에 따라 1~2대)
데이터센터 고밀도 공랭 랙
15~20kW가 흔하고, AI 전용 설비는 그 이상
DGX·HGX의 H200, B200, B300 8장 서버 (설비에 따라 1대~여러 대)
AI 전용 수랭 데이터센터
랙당 100kW 이상
GB200·GB300 NVL72, Vera Rubin NVL72
이 표가 2장의 두 혈통 표와 겹쳐 보인다면 제대로 읽으신 것입니다. 그래픽 겸용 혈통이 '범용'으로 불리는 진짜 이유는 성능이 아니라 설치 조건입니다. 지금 있는 전산실에 들어가는 GPU와, 건물을 새로 준비해야 하는 GPU의 차이입니다.
사내에 둘 자리가 없을 때의 방법은 셋입니다. 데이터센터의 상면(랙 공간)을 빌려 내 장비를 갖다 놓거나(코로케이션), GPU 자체를 빌리거나(클라우드), 카드형 GPU로 구성을 바꿉니다.
7. 그래서 무엇을 고를까
지금까지의 내용을 네 가지 질문으로 줄였습니다.
자주 만나는 상황별로 정리하면 이렇습니다.
상황
먼저 볼 GPU
이유
사내 문서 검색용 임베딩·OCR·음성 인식
L4
모델이 작습니다. 72W라 지금 있는 서버에 꽂힙니다.
CCTV·영상 분석
L4, 채널이 많으면 L40S
영상 디코더가 있는 그래픽 겸용 혈통의 일입니다.
10B급 사내 챗봇 (수십 명)
L40S 또는 RTX PRO 6000 Blackwell
한 장에 모델과 동시 요청이 들어갑니다. 일반 랙에 놓입니다.
30~70B급 모델 서비스 (수백 명)
H100·H200, 임대라면 A100도
메모리 대역폭이 응답 속도를 정합니다.
100B급 이상 모델, 4비트·8비트로 서비스
B200, H200 여러 장
한 장의 메모리가 클수록 구성이 단순해집니다.
LoRA 미세조정 (10~40B)
L40S, A100 80GB, H100
임대해서 며칠 쓰는 것이 대개 가장 쌉니다.
대형 모델 학습
B200 8장 서버, GB300 NVL72
NVLink로 묶인 연산 전용 혈통만 가능합니다.
3D·디지털 트윈·렌더링 + AI
RTX PRO 6000 Blackwell, L40S
레이트레이싱과 화면 출력은 그래픽 겸용 혈통에만 있습니다.
개발자 한 명의 실험
DGX Spark, 또는 클라우드 L4·A10
서버를 사기 전에 책상에서 먼저 해 봅니다.
흔한 오해 일곱 가지
오해
실제
숫자가 크면 더 좋은 GPU다
숫자는 같은 글자 안에서만 비교됩니다. L40S와 H100은 등급이 아니라 혈통이 다릅니다.
L40S는 H100의 저가형이다
3D와 영상까지 하는 다목적 카드입니다. 대신 메모리가 느리고 NVLink가 없습니다. 용도가 다릅니다.
메모리 용량만 맞으면 된다
들어가는 것과 빠른 것은 다릅니다. 같은 모델도 메모리 대역폭에 따라 글 쓰는 속도가 몇 배 차이 납니다.
카드 여러 장이면 큰 모델도 문제없다
나눠 실을 수는 있지만 GPU끼리 주고받는 통로가 좁으면 느려집니다. 큰 모델은 큰 메모리 한 장이 낫습니다.
게임용 RTX 5090을 여러 장 꽂으면 싸다
지포스 드라이버의 사용 조건은 데이터센터 배치를 허용하지 않습니다. 서버용 냉각 구조도 아니고 오류 정정 메모리도 없습니다. 개인 워크스테이션용입니다.
DGX가 제일 좋은 GPU다
DGX는 서버의 상표입니다. 속의 GPU는 다른 회사 서버(HGX)와 같습니다.
최신 세대를 사야 손해가 없다
일에 맞는 등급이 정답입니다. 작은 모델에 B200은 과하고, 전력·냉각이 준비 안 된 최신 장비는 켜지도 못합니다.
8. 살까 빌릴까, 그리고 값
마지막으로 돈 이야기입니다. 2026년 10월 3일 가격표에서 GPU 한 장을 한 시간 빌리는 값입니다.
GPU
GPU 전문 클라우드 (RunPod)
AWS (버지니아)
AWS 인스턴스 이름
T4
—
$0.53
g4dn
L4
$0.49
$0.81
g6
A10G
—
$1.01
g5
L40S
$1.09
$1.86
g6e
A100 80GB
$1.59
$3.43
p4de
RTX PRO 6000 Blackwell
$2.09
$3.36~4.14
g7e
H100
$2.89
$6.88
p5
H200
$4.59
—
p5e · p5en
B200
$6.79
—
p6-b200
B300
$7.89
$17.80
p6-b300
두 가지가 보입니다. 첫째, 같은 GPU도 어디서 빌리느냐에 따라 두 배 차이가 납니다. 대형 클라우드는 비싸지만 기존 시스템과 붙이기 쉽고, GPU 전문 클라우드는 싸지만 부가 서비스가 적습니다. 둘째, 클라우드의 인스턴스 이름은 GPU 이름이 아닙니다. AWS에서 "g6e"가 L40S이고 "p5"가 H100이라는 것은 표를 봐야 압니다. 견적을 비교할 때는 인스턴스 이름이 아니라 그 안의 GPU가 무엇인지부터 확인하세요.
살 때의 값은 이렇습니다. 미국 소매 사이트와 유통사 공개가 기준이고, 재고와 환율, 관세에 따라 국내 견적은 달라집니다.
품목
가격대 (달러)
L4 한 장
2,000~3,600
L40S 한 장
8,000~12,500
H100 80GB 한 장
29,500~35,000
H100·H200 8장 서버 한 대 (HGX)
35만~43만
DGX Spark (128GB)
5,699 (2025년 10월 출시가는 3,999)
DGX Spark의 값이 출시 때보다 오른 데서 보이듯, 2026년의 GPU 가격에는 메모리값이 크게 작용합니다. 시장조사업체 트렌드포스는 4분기 D램 계약가가 전 분기보다 10~15% 더 오르고, HBM의 평균 가격은 2027년에 전년 대비 두 배 이상이 될 것으로 내다봤습니다. "기다리면 싸진다"가 통하지 않는 해입니다.
본전은 언제 뽑히나
H100 8장 서버를 40만 달러에 산다고 합시다. 같은 것을 전문 클라우드에서 빌리면 시간당 약 23달러(2.89 × 8), 하루 24시간 한 달이면 약 1만 7천 달러입니다.
하루 24시간 내내 쓸 때 (사용률 100%)
약 2년
절반만 쓸 때 (사용률 50%)
약 4년
업무 시간에만 쓸 때 (사용률 25%)
약 8년
장비값을 임대료로 나눈 단순 계산이고, 전기료와 상면 비용, 운영 인력은 넣지 않았습니다. 넣으면 더 길어집니다. GPU 한 세대의 주기가 2년 안팎인 것을 생각하면 기준은 분명합니다.
빌리는 편이 나은 경우: 사용률이 절반에 못 미칠 때, 어떤 GPU가 맞는지 아직 모를 때, 미세조정처럼 며칠만 필요할 때, 놓을 자리가 없을 때.
사는 편이 나은 경우: 하루 종일 돌릴 일이 3년 치 이상 확실할 때, 데이터를 밖으로 내보낼 수 없을 때, 전력·냉각·운영 인력이 준비돼 있을 때.
처음이라면 먼저 빌려서 일주일 돌려 보는 것을 권합니다. 우리 모델이 어느 GPU에서 얼마나 빠른지, 메모리를 실제로 얼마나 쓰는지는 재 봐야 압니다. 그 숫자를 들고 구매 견적을 받으면 과하게 사는 일도, 모자라게 사는 일도 줄어듭니다. 토큰 단위로 빌리는 방법까지 포함한 선택지는 AI 플랫폼 개발 특집의 서빙 사다리에 정리했습니다.
한국에서 알아 둘 것
정부 GPU 지원. 과학기술정보통신부와 정보통신산업진흥원(NIPA)의 '첨단 GPU 활용 지원 사업'은 정부가 확보한 H200·B200을 국내 클라우드(네이버·NHN·카카오)를 통해 나눠 줍니다. AI 인프라 허브 안내 기준으로 중소기업·스타트업의 자부담은 GPU 한 장에 월 H200 40만 원, B200 80만 원이고(8장 서버 단위 배정), 대학과 연구기관은 무료입니다. 2026년 공고분은 10월 3일 현재 자원이 모두 배정돼 접수가 닫혀 있으니, 다음 공고를 확인해야 합니다.
국내 클라우드. 네이버클라우드 공개 요금표에는 T4가 시간당 691원, A100 8장 베어메탈 서버가 시간당 49,928원(GPU 한 장에 약 6,241원)으로 올라 있습니다. L40S·H100·H200 상품도 있지만 요금은 계산기나 문의로 확인해야 합니다. 국내 리전에서 처리해야 하는 데이터라면 선택지가 여기로 좁혀집니다.
엔비디아 밖의 선택지. 이 글은 엔비디아만 다뤘지만 대안도 있습니다. AMD의 Instinct MI300X는 메모리 192GB를 시간당 2.39달러(RunPod)에, MI355X는 288GB를 시간당 6달러 안팎부터 빌릴 수 있습니다. 메모리 대비 값은 좋지만, 쓰려는 소프트웨어가 AMD를 지원하는지 먼저 확인해야 합니다. 구글의 TPU와 AWS의 Trainium은 각자의 클라우드 안에서만 쓰는 전용 칩입니다. 개발자 책상에서는 통합 메모리가 큰 맥 스튜디오나 DGX Spark가 "큰 모델을 일단 올려 보는" 용도로 쓰입니다.
마치며: 견적을 받기 전 일곱 가지 질문
질문
이 답이 정하는 것
① 무엇을 돌리나: 글(LLM)인가, 그림·영상인가, 3D인가
혈통. 연산 전용이냐 그래픽 겸용이냐
② 모델이 얼마나 큰가, 몇 비트로 올리나
필요한 메모리의 바닥
③ 동시에 몇 명이, 얼마나 긴 글을 다루나
메모리의 여유분, GPU 장수
④ 응답이 얼마나 빨라야 하나
메모리 대역폭. GDDR로 충분한가, HBM이 필요한가
⑤ 한 장에 들어가나, 여러 장에 나눠야 하나
NVLink가 필요한가
⑥ 어디에 놓나: 전력 몇 kW, 공랭인가 수랭인가
카드형이냐, 8장 서버냐, 랙이냐. 또는 빌려야 하느냐
⑦ 하루에 몇 시간 쓰나, 몇 년 쓰나
살지 빌릴지
이 일곱 가지에 답할 수 있으면 "제일 좋은 걸로 주세요"가 "40B급 모델을 8비트로, 동시 50명, 사내 전산실 랙 하나에"로 바뀝니다. 그 문장이 있으면 어느 회사에서 견적을 받아도 같은 기준으로 비교할 수 있습니다. 스쿠터가 필요한 곳에 화물열차를 들이지 않고, 화물열차가 필요한 일을 스쿠터 여러 대로 버티지 않는 것. GPU 고르기의 전부입니다.