특집소버린 AI독자 AI 파운데이션 모델독파모과학기술정보통신부SK텔레콤A.X K2업스테이지Solar Open2LG AI연구원K-EXAONE모티프테크놀로지스Motif-3네이버클라우드벤치마크Artificial AnalysisAI 평가GPU 활용률국가 AI 정책트렌드 분석
[특집] 소버린 AI 2차 평가의 역설 — 벤치마크 1위가 탈락했다: 독자 AI 파운데이션 모델 14개월과 '무엇으로 평가할 것인가'
2026년 8월, 국가대표 AI 모델을 가리는 '독자 AI 파운데이션 모델' 2차 평가에서 모티프테크놀로지스가 탈락했습니다. 그런데 세계적 평가 지표인 Artificial Analysis 지수로는 네 팀 중 모티프가 가장 높았습니다. 벤치마크 합계도 1위, 그러나 전문가와 사용자 점수는 꼴찌. 공개된 세부 점수로 배점을 바꿔 다시 채점해 보면, 이 탈락은 '모델의 우열'이 아니라 '무엇을 중시하기로 정했는가'의 결과에 가깝습니다. 1차에서 '독자성' 기준으로 탈락한 네이버, '처음부터 학습했나'를 둘러싼 공개 검증, 평가 화면에 모델 이름이 그대로 보였다는 지적, 절반 넘게 놀고 있는 임차 GPU, 그리고 '경쟁에서 육성으로'의 방향 전환까지 — 14개월의 기록과 다른 나라의 선택을 함께 봅니다.
2026년 8월 18일, 과학기술정보통신부는 '독자 AI 파운데이션 모델 프로젝트'(이하 독파모) 2차 평가 결과를 발표했습니다. 국가대표 AI 모델을 만들 팀을 단계적으로 추려 가는 사업입니다. 결과는 SK텔레콤 70.6점, 업스테이지 69.9점, LG AI연구원 69.0점, 그리고 모티프테크놀로지스 65.8점, 탈락이었습니다.
그런데 평가 직전인 8월 13일 기준, 세계적으로 쓰이는 AI 모델 종합 평가 지표인 Artificial Analysis 지수(AAII) 에서 네 모델의 점수는 이랬습니다. 모티프 Motif-3 47, 업스테이지 Solar Open2 37, SKT A.X K2 35, LG K-EXAONE 2.0 31. 탈락한 팀이 가장 높았습니다.
Artificial Analysis 종합 지수 (2026년 8월 평가 당시 버전, 최댓값 47 기준)
Motif-3 (모티프, 탈락)
47
Solar Open2 (업스테이지)
37
A.X K2 (SK텔레콤)
35
K-EXAONE 2.0 (LG)
31
이 장면은 쉽게 두 가지 이야기로 갈립니다. '심사가 불공정했다'거나, '벤치마크는 원래 믿을 게 못 된다'거나. 이 글은 어느 쪽으로도 서두르지 않으려 합니다. 대신 정부가 공개한 세부 점수로 직접 다시 채점해 보고, 14개월 동안 이 사업에 무슨 일이 있었는지 따라가며, 한 가지 질문을 붙잡습니다. 국가대표 AI는 무엇으로 평가해야 하는가.
1부. 무엇을 만들려 했나
'독자 모델'의 정의
독파모는 2025년 8월 시작됐습니다. 네이버클라우드, 업스테이지, SK텔레콤, NC AI, LG AI연구원 다섯 팀이 뽑혔고, 6개월마다 경쟁형 평가로 팀을 줄여 2027년까지 2개 팀을 남기는 구조였습니다. 공통 목표는 "글로벌 최고 모델 대비 95% 이상의 성능"이었습니다. 사업 안내서는 '독자 모델'을 이렇게 정의합니다.
해외 모델 미세조정 등으로 개발한 파생형 모델이 아닌, 모델의 설계부터 사전학습 과정 등을 수행한 국산 모델로서 타사 모델에 대한 라이선싱 이슈가 없는 것.
정부는 GPU 1,576억 원, 데이터 공동구매 100억 원, 방송·영상 데이터 200억 원, 팀별 학습 데이터 구축 28억 원 등을 지원했습니다. 3단계에선 팀당 B200 약 1,000장, 약 400억 원이 계획돼 있고, 2027년까지 사업 전체 규모는 5,300억 원입니다.
배점: 40·35·25
평가는 두 번 모두 벤치마크 40점, 전문가 35점, 사용자 25점이었습니다. 다만 세부 구성이 달랐습니다.
항목
1차 (2026년 1월)
2차 (2026년 8월)
벤치마크 40
NIA 자체 10 + 글로벌 공통 13종 20 + 글로벌 개별 5종 10
AA 지수 25 + NIA 15
전문가 35
외부 전문가 10명 평가
개발전략·기술 10 + 개발성과·계획 10 + 파급효과·기여계획 15
사용자 25
AI 전문 사용자 49명
전문 사용자 49명 15 + 일반 국민 10
이 표에서 2차의 성격이 보입니다. 전문가 점수 35점 가운데 15점이 '파급효과·기여계획', 10점이 '개발성과·계획'입니다. 즉 전문가 점수의 상당 부분이 지금 모델의 능력이 아니라, 앞으로의 계획과 생태계 기여를 봤습니다.
2부. 1차 평가 — '독자성'이라는 문턱
네이버는 왜 떨어졌나
2026년 1월 15일 1차 평가에서 LG AI연구원이 90.2점(5개 팀 평균 79.7점)으로 1위를 했습니다. 다른 팀의 점수와 순위는 공개되지 않았습니다. 그리고 두 팀이 떨어졌습니다. 최하위 NC AI, 그리고 점수로는 상위 4개 팀 안에 들었던 네이버클라우드.
네이버의 탈락 사유는 성능이 아니라 '독자성'이었습니다. 정부 발표: "네이버클라우드 정예팀의 AI 모델이 기술적·정책적 부분에서 독자성 기준을 충족하지 못하는 것으로 판단." 차관은 "비디오 인코더, 오디오 인코더"에서 "가중치를 그대로 갖다 쓴" 부분을 지적했고, 사업 책임자는 "가중치를 업데이트할 수 있는 형태가 아니라 프로즌돼 있는 형태"였다고 설명했습니다. 실제로 네이버가 공개한 HyperCLOVA X 모델의 설정 파일에는 비전 부분의 구조가 알리바바 Qwen2.5 계열의 비전 트랜스포머로 적혀 있습니다.
'처음부터 학습했나' — 공개 검증이라는 해법
같은 시기 업스테이지도 의혹을 받았습니다. 2026년 1월 1일, 한 AI 스타트업 대표가 업스테이지의 Solar Open이 중국 즈푸AI의 GLM-4.5-Air에서 파생됐다고 주장했습니다. 근거는 두 모델의 LayerNorm 파라미터가 96.8% 같다는 분석이었습니다.
업스테이지의 대응은 빨랐습니다. 이튿날 약 1,500명이 지켜보는 생중계로 학습 체크포인트와 학습 기록을 공개했고, LayerNorm은 1로 초기화되기 때문에 서로 무관한 모델끼리도 유사도가 원래 높다고 설명했습니다(GLM과 마이크로소프트 Phi 모델 사이도 0.9가 넘는다는 것). 1월 3일 의혹 제기자는 "엄밀하게 검증하지 않은 채 불필요한 혼란과 논란을 야기한 점"을 사과했습니다.
이 두 사건은 '독자성'이 얼마나 판단하기 어려운 기준인지 보여 줍니다. 오늘날 거의 모든 모델은 공개된 구조와 기법 위에 지어집니다. 어디까지가 '참고'이고 어디부터가 '파생'인지 선을 긋는 일은 기술적 판단이면서 동시에 정책적 판단입니다. 업스테이지 사례는 그 판단에 공개 검증이라는 좋은 해법이 있다는 것도 보여 줬습니다.
추가 팀, 모티프
탈락한 자리를 채우려는 추가 공모에 네이버, NC, 카카오, KT 등은 다시 도전하지 않았습니다. 2월 20일, 트릴리온랩스를 제치고 모티프테크놀로지스가 뽑혔습니다. 다른 팀보다 6개월 늦게 출발한 팀이었고, 정부는 B200 768장 등 약 117억 원을 지원했습니다.
3부. 2차 평가 — 다시 채점해 보기
공개된 세부 점수
2차 평가 결과 발표(8월 18일) 직후 모티프가 이의를 제기했고, 세부 점수는 8월 27일에야 공개됐습니다.
팀 (모델)
AA 지수 /25
NIA /15
전문가 /35
전문 사용자 /15
국민 /10
총점
SK텔레콤 (A.X K2)
8.8
13.4
29.3
11.6
7.5
70.6
업스테이지 (Solar Open2)
9.4
13.3
29.1
10.8
7.3
69.9
LG AI연구원 (K-EXAONE 2.0)
7.8
12.8
29.5
11.3
7.6
69.0
모티프 (Motif-3)
11.9
12.7
27.1
8.4
5.7
65.8
표가 모든 걸 말해 줍니다. 모티프는 벤치마크 합계(24.6점)가 네 팀 중 가장 높았지만, 전문가(27.1점)와 사용자(14.1점)에서 가장 낮았습니다. 그리고 하나 더. AA 지수 원점수의 16점 격차(47 대 31)가 25점 만점으로 환산되자 약 4점 차이(11.9 대 7.8)로 줄었습니다. 반면 전문가 점수의 2.4점 차이(29.5 대 27.1)는 그대로 반영됐습니다.
배점을 바꾸면
이 점수로 직접 다시 채점해 보세요. 실제 배점(40·35·25)에선 공개된 총점과 같은 순위가 나옵니다.
'벤치마크만' 버튼을 눌러 보면, 1위는 모티프, 최하위는 LG가 됩니다. '사용자 중심'이면 다시 모티프가 최하위입니다. 즉 이 탈락은 '누가 더 좋은 모델을 만들었나'라는 하나의 질문에 대한 답이 아니라, '벤치마크·전문가·사용자 가운데 무엇을 얼마나 중시하기로 정했나' 라는 설계의 결과입니다. 배점 자체가 잘못됐다는 뜻은 아닙니다. 다만 그 설계가 결과를 좌우했다는 걸 알고 나면, 논쟁의 초점이 달라집니다.
9월 8일 보도된 국회 제출 자료에 따르면, 사용자 평가 화면에 'EXAONE', 'Solar', 'MOTIF' 같은 모델명이 그대로 보였고, SKT 화면엔 'SK텔레콤이 개발한 국가대표 AI 모델'이라는 문구가 떴습니다. 평가 관리 기관은 "모델에게 직접 물어보면 알 수 있어 블라인드가 실효성이 없다"고 해명했습니다. 이해충돌 점검은 서약서에 의존했습니다.
②
국민 평가 3분
일반 국민 평가는 200명을 뽑아 185명이 참여했고, 모델당 문항당 약 3분씩 네 영역을 평가했습니다. 대규모 모델의 차이를 가리기엔 짧은 시간이라는 지적이 가능합니다. 모티프의 국민 점수(5.7)는 네 팀 중 가장 낮았습니다.
③
벤치마크 '맞춤 학습' 의혹은 없었다
높은 벤치마크 점수가 시험 문제를 외운 결과(벤치맥싱)라면 이야기가 다릅니다. 그러나 차관은 발표 당일 "AA 측에서 체계적인 암기나 과적합의 증거를 찾지 못했다"며 "벤치맥싱 관련 이슈는 평가에 반영되지 않았다"고 밝혔습니다.
모티프의 6쪽짜리 이의신청서에는 전문가 심사에서 '외국계 자본 주요주주'에 관한 질문이 있었다는 내용도 담겼습니다. 9월 10일 이의신청은 '기각' 한 단어로 돌아왔고, 9월 18일 면담 뒤 일단락됐습니다. 모티프의 반응은 이랬습니다. "충분한 답변을 듣지 못해 아쉽다."
지금 다시 재면
한 가지 더 짚을 것이 있습니다. Artificial Analysis는 그 뒤 지표를 개정해(4.3.2판, 새 벤치마크 추가) 지금은 점수가 전반적으로 낮아졌습니다. 현재 값은 Motif-3 34, Solar Open2 25, A.X K2 23, K-EXAONE 2.0 20입니다. 순위는 그대로입니다. 벤치마크로 재면, 2차 평가 이후에도 모티프가 앞서 있습니다.
4부. 무엇을 만들었나 — 네 모델의 모습
모델
전체 파라미터
한 번에 쓰는 파라미터
라이선스
SK텔레콤 A.X K2
약 6,917억 (692B)
약 330억 (33B)
Apache 2.0
LG K-EXAONE 2.0
약 7,494억 (749B)
약 370억 (37B)
Apache 2.0 (1차 모델의 자체 라이선스에서 변경)
업스테이지 Solar Open2
약 2,503억 (250B)
약 150억 (15B)
업스테이지 자체 라이선스
모티프 Motif-3
약 3,148억 (315B)
약 132억 (13.2B)
MIT
네 모델 모두 전문가 혼합(MoE) 구조라, 전체 파라미터 중 일부만 한 번에 씁니다. 눈에 띄는 건 모티프입니다. 한 번에 쓰는 파라미터가 넷 중 가장 적은데(약 132억) 벤치마크는 가장 높았고, 가장 개방적인 MIT 라이선스를 택했습니다. 같은 성능을 더 적은 계산으로 내는 효율, 그리고 누구나 가져다 쓸 수 있는 개방성은 '국가 AI 생태계'라는 목표에 직접 닿는 지표지만, 현재 배점에선 따로 점수가 없습니다.
5부. 놀고 있는 GPU
독파모와 별개로, 정부가 민간 클라우드에서 빌려 연구자와 기업에 나눠 주는 '고성능 컴퓨팅 지원사업'의 GPU 활용률이 10월 1일 국회에서 공개됐습니다.
정부 임차 GPU 가운데 사용률 50% 미만인 비율 (고성능 컴퓨팅 지원사업, 최댓값 100% 기준)
2025년 (620장 중 443장)
71.5%
2026년 (478장 중 350장)
73.2%
국산 AI 반도체(NPU)는 더 심합니다. 2025년 배정된 NPU 201장 가운데 실제 추론 서비스 단계까지 간 건 26장(약 13%) 이었고, 89장은 아직 모델을 변환하는 단계였습니다. 2026년 배정된 105장 중엔 최적화나 추론 단계에 이른 것이 없었습니다. 과기정통부는 활용률은 과제마다 편차가 커서 숫자만으로 판단하기 어렵다고 했습니다.
수요가 없는 것도 아닙니다. 2025년 추가경정예산으로 마련한 GPU 1만 장 가운데 4,224장을 나눌 때 514개 과제가 신청해 159개만 받았고, 신청 수요는 1만 3,712장이었습니다. 모자라다는 아우성과 놀고 있다는 숫자가 동시에 존재하는 것, 이게 한국 AI 컴퓨팅 정책의 현주소입니다.
2027년 예산안에서 '최상위 AI 모델·기술'은 5조 5,937억 원이고, 그중 'AI 컴퓨팅 자원 활용 기반 강화'가 2조 841억 원에서 3조 8,500억 원으로 늘었습니다. 정부는 이 돈으로 최신 GPU '베라 루빈' 약 1만 장을 사겠다고 했습니다. GPU를 더 사는 것만큼, 이미 산 GPU가 왜 놀고 있는지 묻는 일이 중요해 보입니다.
6부. 경쟁에서 육성으로?
9월 말, 사업의 방향 자체가 흔들렸습니다. 9월 27일 배경훈 과기정통부 장관은 한 회의에서 "1년 반 전 수립된 평가나 경쟁 방식이 (…) 여전히 유효한지 근본적인 고민"이 필요하다고 말했습니다. 이튿날 한 일간지는 2차 평가까지 2,000억 원 넘게 들어간(신문 추산) 독파모를 중단하고, 정부가 5조 원을 내고 민간이 70%를 대는 프런티어 AI 특수목적법인을 세우는 방안을 검토 중이라고 보도했습니다. 과기정통부는 당일 "중단 및 SPC 설립 여부 등은 아직 정해진 바 없다"고 해명했습니다.
9월 29일 장관은 직접 정리했습니다. "결론부터 말하면 독파모는 계속된다." 그리고 이렇게 덧붙였습니다. "'누구를 탈락시킬 것인가'보다 '어떻게 더 많은 가능성을 키울 것인가'." 10월 1일엔 3차 평가를 2027년 1월로 잡고 세 팀을 탈락 없이 계속 지원하는 방안을 검토 중이라는 보도가 나왔습니다. 확정된 건 아닙니다. 업계에선 "어차피 끝난 것"이라는 냉소도, "환경이 바뀐 것은 없다. 전략이 부족했던 것"이라는 정치권의 비판도 나왔습니다.
7부. 다른 나라는 어떻게 하나
국가 AI 모델 사업은 한국만의 것이 아닙니다. 흥미로운 건, 나라마다 '독자성'과 '경쟁'에 대한 선택이 다르다는 점입니다.
나라
방식
눈여겨볼 점
일본 (GENIAC)
경제산업성이 컴퓨팅 자원을 지원, 탈락 경쟁 없음
해외 모델 기반 파생 모델도 허용(예: Llama 3.1 기반 405B 모델). 한국의 '처음부터' 원칙과 정반대
프랑스 (미스트랄)
민간 기업이 국가 대표 역할
2026년 9월 30억 유로 투자 유치, 기업가치 210억 유로 이상. 주도 투자자는 삼성전자. 마크롱: 프랑스와 한국이 'AI의 제3의 길'을 만든다
인도 (IndiaAI 미션)
정부 컴퓨팅으로 스타트업이 학습
사르밤 30B·105B를 처음부터 학습(각 16조·12조 토큰). 그 전 모델은 미스트랄 기반이었다
'벤치마크 1위가 탈락했다'는 문장은 자극적이지만, 공개된 숫자를 따라가 보면 이야기는 더 차분합니다. 2차 평가는 처음부터 벤치마크에 40%만 주고, 나머지 60%로 전문가의 판단과 사용자의 경험, 그리고 계획과 기여를 보기로 설계돼 있었습니다. 모티프는 그 설계 안에서 졌습니다. 문제는 그 설계가 충분히 투명했는지, 그리고 국가가 진짜 원하는 것(효율, 개방, 실제 쓰임)을 재고 있었는지입니다.
14개월 만에 정부가 "누구를 탈락시킬 것인가보다 어떻게 더 많은 가능성을 키울 것인가"라고 말하기 시작한 건, 어쩌면 이 역설에서 얻은 가장 큰 교훈일지 모릅니다. 국가대표를 뽑는 일과 생태계를 키우는 일은 같은 일이 아니니까요. 그리고 어느 쪽이든, 이미 산 GPU의 절반 이상이 놀고 있다면 먼저 그 이유부터 물어야 합니다.
참고 자료
정부 발표
정책브리핑, 독자 AI 파운데이션 모델 1차 평가 결과 브리핑 (2026-01-15) — korea.kr