coredot.today
벤치마크 점수로 AI 모델을 고르면 안 되는 이유 — 독파모 2차 평가 원점수로 직접 계산해 보기
블로그로 돌아가기
독자 AI 파운데이션 모델독파모소버린 AI과학기술정보통신부SKT A.X K2LG K-EXAONE업스테이지 Solar모티프 Motif 3벤치마크Artificial AnalysisAI 평가2027 AI 예산모두의 AI

벤치마크 점수로 AI 모델을 고르면 안 되는 이유 — 독파모 2차 평가 원점수로 직접 계산해 보기

8월 18일 발표된 독자 AI 파운데이션 모델 2차 평가에서 SKT·업스테이지·LG가 통과하고 모티프가 탈락했습니다. 그런데 과기정통부가 8월 27일 공개한 세부 점수를 보면 모티프는 벤치마크 점수 1위였고, 국제 평가 기관 Artificial Analysis의 지수에서는 2위와 10점 넘게 차이가 났습니다. 결과를 가른 것은 전문가와 사용자 평가였습니다. 평가위원 10명과 국민 평가단 185명의 원점수까지 공개된 자료로, 가중치를 바꾸면 순위가 어떻게 달라지는지 직접 계산해 볼 수 있게 했습니다. 공정했느냐를 따지려는 글이 아닙니다. 국내 모델을 고르는 기업에 '벤치마크 1위'가 무엇을 뜻하고 무엇을 뜻하지 않는지 보여 주는 드문 공개 데이터라서 들여다봤습니다. 2027년 AI 예산 9.4조와 '모두의 AI'까지 함께 정리했습니다.

코어닷투데이2026-10-0420분

벤치마크 점수로 모델을 고르면 안 되는 이유 — 사무실에서 한 팀이 막대그래프가 그려진 사양표 대신 AI 로봇 후보들에게 문서 작업, 고객 전화, 스프레드시트 같은 실제 업무를 맡겨 보며 각자 점수표를 적는 장면크게 보기

들어가며: 정부가 원점수를 공개했다

국가 AI 사업의 평가 결과는 보통 '누가 붙고 누가 떨어졌다'로 끝납니다. 이번에는 달랐습니다. 과학기술정보통신부는 8월 18일 독자 AI 파운데이션 모델(이하 독파모) 2차 평가 결과를 발표한 뒤, 탈락한 모티프테크놀로지스의 요청을 받아 8월 27일 세부 점수 전체를 공개했습니다. 벤치마크 항목별 점수뿐 아니라 전문 평가위원 10명 각자의 점수, 사용자 평가단의 점수 합계까지 들어 있습니다.

이 자료가 흥미로운 이유는 결론이 하나가 아니기 때문입니다. 벤치마크 점수만 보면 1위는 탈락한 모티프였습니다. 국제 평가 기관 Artificial Analysis(이하 AA)의 지능 지수로는 모티프 47.4, 2위 업스테이지 37.4로 10점 차이였습니다. 그런데 전문가와 사용자 평가에서 순위가 뒤집혔습니다.

이 글은 그 평가가 옳았는지 판정하려는 것이 아닙니다. 평가의 목적은 벤치마크 경연이 아니라 '국가대표로 키울 모델'을 고르는 것이었고, 그 목적에 맞는 기준은 여러 가지일 수 있습니다. 우리가 주목한 것은 다른 질문입니다. 국내 기업이 모델을 고를 때 '벤치마크 1위'는 무엇을 말해 주고, 무엇을 말해 주지 않는가. 이 공개 데이터는 그 질문에 답할 수 있는 드문 자료입니다.

✅
요약.
· 총점 SKT 70.6 · 업스테이지 69.9 · LG 69.0 · 모티프 65.8. 상위 세 팀이 3차로 갔습니다.
· 모티프는 벤치마크(40점) 1위(24.6점)였지만 전문가(35점)·사용자(25점) 평가에서 각각 2.4점·5.0점 뒤졌습니다.
· AA 지수의 16점 차이(47.4 vs 31.0)는 25점 만점 환산(×0.25)을 거치며 약 4점 차이가 됐습니다. 모티프가 공식 이의를 제기한 대목입니다.
· 기업에 주는 교훈: 벤치마크는 후보를 거르는 데 쓰고, 고르는 것은 우리 업무 기준의 평가로 하라.
· 2027년 과기정통부 AI 예산은 9조4,211억 원(2026년 5조938억 원 대비 +85.0%). GPU 확충에만 3조8,500억 원.

1. 어떤 평가였나

독파모는 2025년 8월 4일 다섯 개 정예팀(네이버클라우드·업스테이지·SKT·NC AI·LG AI연구원)을 뽑으며 시작했습니다. 2026년 1월 15일 1차 평가에서 LG·SKT·업스테이지가 통과했습니다. 1차에는 사연이 있었습니다. NC AI는 점수 5위로 떨어졌고, 네이버클라우드는 점수로는 상위 4위 안에 들었지만 '독자성' 기준을 통과하지 못해 탈락했습니다. 이후 추가 공모에서 모티프가 2월 20일 합류했습니다.

2차 평가의 배점은 이렇습니다.

영역 (배점)세부방식
벤치마크 (40)AA 지능 지수 25 + NIA(한국지능정보사회진흥원) 평가 15AA가 6월 말 기준으로 9개 벤치마크(에이전트·코딩·일반·과학 추론)를 직접 측정. NIA는 수학·지식·장문 이해·지시 이행·한국어·신뢰성·안전성 등 7개 영역
전문가 (35)개발 전략·기술 10, 성과·계획 10, 파급·기여 15산업 3·학계 5·연구 2, 총 10명. 약 5일간 서면 검토와 질의응답. 최고·최저 점수를 빼고 평균
사용자 (25)AI 전문 사용자 15 + 일반 국민 10전문 사용자 49명(주로 스타트업 대표), 일반 국민은 약 1,400명 지원자 중 성별·연령 할당으로 200명을 무작위 추첨해 185명 참여. 모두 1~5점 절대 평가

과기정통부 차관은 브리핑 질의응답에서 벤치마크 40점 만점에 30점을 넘은 팀이 없었다고 확인했습니다. 결과는 "근소한 차이"였고, 모든 영역에서 1위를 한 팀은 없었다고 했습니다.


2. 점수를 해부하면

크기가 다른 세 개의 추(스톱워치, 돋보기, 사람들 아이콘)가 올려진 큰 저울에서, 손이 가장 작은 추를 조정하자 저울이 기우는 장면크게 보기

업스테이지SKTLG모티프
AA 지수 (원점수)37.435.031.047.4
AA 환산 (/25)9.48.87.811.9
NIA (/15)13.313.412.812.7
벤치마크 소계 (/40)22.722.220.624.6
전문가 (/35)29.129.329.527.1
전문 사용자 (/15)10.811.611.38.4
일반 국민 (/10)7.37.57.65.7
사용자 소계 (/25)18.119.118.914.1
총점69.970.669.065.8

모든 총점은 공개된 세부 점수를 더하면 정확히 맞습니다. 영역별로 1위가 모두 다릅니다. 벤치마크는 모티프, 전문가는 LG, 사용자는 SKT였습니다. 모티프와 3위 LG의 차이 3.2점을 나눠 보면 이렇습니다. 벤치마크에서 4.0점 앞섰지만 전문가에서 2.4점, 전문 사용자에서 2.9점, 일반 국민에서 1.9점 뒤졌습니다.

아래에서 항목별 점수와 AA의 세부 지표 10개를 직접 보세요. 모티프는 터미널 작업(Terminal-Bench v2.1, 74.9 대 39.0~44.2)과 에이전트 과제(τ3-Banking, 35.3 대 11.5~21.6)에서 크게 앞섰고, NIA의 지식·신뢰성 영역에서는 다른 팀보다 낮았습니다.


3. 16점 차이가 4점이 된 이유

모티프가 8월 27일 공식 이의를 제기한 핵심은 '압축'이었습니다. AA 원점수로 16점(47.4 대 31.0) 차이가 25점 만점 환산(×0.25)을 거치면 4.1점이 됩니다. 반면 사용자 평가 25점은 1~5점 절대 평가를 그대로 환산해 팀 간 차이가 5점까지 벌어졌습니다. 같은 '1점'이 영역마다 다른 크기의 실력 차이를 뜻하게 된 것입니다. 모티프는 또 AA 지수 31점인 모델이 당시 최고 수준(Opus 5, 63점)의 49%에 불과해 사업 목표인 '글로벌 최고 수준의 95%'와 거리가 있다고 지적했고, 전체 자료 공개를 요구하며 3차에 참여하지 않겠다고 밝혔습니다.

과기정통부 자료에서 확인되는 맥락도 있습니다. AA 리더보드 기준 국내 최고 모델과 세계 최고의 차이는 1월(32 대 51)보다 8월(47 대 63)에 줄었습니다. 그리고 과기정통부는 AA에 의뢰해 특정 벤치마크에만 맞춘 흔적(벤치맥싱)이 없음을 확인했다고 밝혔습니다.


4. 가중치를 바꾸면

공개된 원점수로 직접 계산해 보면, 결과는 가중치에 꽤 민감합니다. 아래 도구에서 다섯 영역의 가중치를 바꿔 보세요. 공식 가중치를 기준으로, 몇 가지 '만약'을 프리셋으로 넣었습니다.

몇 가지 결과를 정리하면 이렇습니다.

  • 일반 국민 평가만 빼면: 순위는 그대로이고 모티프는 여전히 4위입니다. 과기정통부의 "일반 국민 평가는 당락에 영향이 없었다"는 설명과 일치합니다.
  • 사용자 평가 전체를 빼면: LG가 4위로 내려가고 모티프가 2위로 올라갑니다.
  • AA 지수의 비중을 키우면: 다른 가중치를 그대로 두고 AA 비중을 약 45점까지 올리면 모티프가 LG를 앞서고, 약 67점이면 1위가 됩니다.
  • 전문가 점수에서 최고·최저를 빼지 않으면: 업스테이지(70.05)가 SKT(69.85)를 앞서 1위가 바뀝니다. 평가위원 한 명(위원7)의 점수가 다른 위원들과 크게 달랐기 때문입니다(업스테이지 30, SKT 20, LG 24, 모티프 17).

사용자 평가에서도 눈에 띄는 차이가 있습니다. 모티프는 전문 사용자 49명 중 10명에게 최저점(1점)을 받았고, 다른 팀은 1~2명이었습니다. 일반 국민 평가에서도 1점이 11명으로 다른 팀(2~7명)보다 많았습니다. 벤치마크가 높은 모델이 실제 사용자에게는 덜 만족스러웠다는 신호일 수 있고, 평가단이 짧은 시간 동안 써 본 인상이라는 한계도 있습니다. 데이터만으로는 어느 쪽인지 단정할 수 없습니다.


5. 기업에 주는 교훈: 벤치마크로 거르고, 우리 기준으로 고른다

이 평가는 '국가대표 모델'을 고르는 일이었지만, 국내 기업이 사내에 쓸 모델을 고르는 일과 구조가 같습니다. 숫자 하나로 순위를 매기면 편하지만, 그 숫자가 우리가 원하는 것을 재는지가 먼저입니다.

1단계
벤치마크로 후보를 거른다. AA 같은 공개 지수와 한국어 평가로 일정 수준 아래를 걸러 냅니다. 이 단계에서 1위와 3위의 차이는 결정적이지 않을 수 있습니다.
2단계
우리 업무로 평가 세트를 만든다. 실제 문서·질문·도구 호출로 50~200개 과제를 만들고, 정답 기준을 미리 정합니다. 우리가 지난 한국어 검색 스택 시리즈에서 했던 방식입니다.
3단계
실사용자에게 써 보게 한다. 이번 평가에서 사용자 점수가 순위를 가른 것처럼, 현업이 느끼는 품질은 벤치마크와 다를 수 있습니다. 1~5점 평가라면 분포(특히 최저점 비율)를 함께 봅니다.
4단계
가중치를 미리 정하고 공개한다. 결과를 보고 가중치를 바꾸면 평가가 아니라 정당화가 됩니다. 이번 평가가 세부 점수를 공개한 것처럼, 사내에서도 기준과 원점수를 남겨 두면 나중에 다시 계산할 수 있습니다.

참고로 2차 평가에 나온 네 모델은 모두 가중치가 공개돼 있습니다. SKT A.X K2(688B, Apache-2.0), LG K-EXAONE 2.0(750B, Apache-2.0), 업스테이지 Solar Open2(250B, 자체 라이선스 — Apache 2.0에 파생 모델의 'Solar' 표기 조건), 모티프 Motif 3(314B, MIT)입니다. 모두 전문가 혼합(MoE) 구조라 실제 활성 파라미터는 13~37B입니다.


6. 돈은 어디로: 2027년 AI 예산과 '모두의 AI'

정부 청사 마당에서 트럭이 빛나는 칩 상자를 내리고, 금화로 만든 커다란 파이가 잘리는데 그 절반에 칩 아이콘이 표시된 장면크게 보기

2027년 예산안(8월 31일 발표, 9월 1일 국무회의 의결): 과기정통부 총예산 29조6,476억 원 중 AI 예산이 9조4,211억 원입니다. 정부 발표는 '+84.3%'였지만 2026년 5조938억 원과 비교해 직접 계산하면 +85.0%입니다.

분야20262027(안)
최상위 AI 모델·기술2조6,146억5조5,937억
AI 서비스·활용1조2,067억1조8,611억
AI 포용사회9,744억1조1,707억
3대 메가프로젝트2,981억7,956억
합계5조938억9조4,211억

가장 큰 항목은 GPU 확충입니다. 2조841억 원에서 3조8,500억 원으로 늘었고, 과기정통부는 'GPU 1만 장'이라고 설명합니다(보도 기준 엔비디아 베라 루빈 140랙, 랙당 72개면 1만 80개). 학습 데이터 예산은 300억 원에서 8,000억 원으로 늘었습니다. 반면 독파모 3차에 올라간 세 팀에 대한 GPU 지원은 팀당 약 400억 원, 6개월간 총 약 1,200억 원 규모입니다(과기정통부 브리핑 질의응답).

마을 광장에서 친절한 공공 서비스 로봇이 여러 연령대 시민에게 빛나는 태블릿으로 정부 서비스를 안내하고, 뒤에 서로 다른 색의 키오스크 세 대가 있는 장면크게 보기

'모두의 AI'는 시민이 무료로 쓰는 공공 AI 에이전트입니다. 8월 28일 SKT·카카오·KT 컨소시엄이 선정됐고, 10월 비공개 베타, 12월 정식 출시가 목표입니다(보도 기준). 조건이 눈에 띕니다. 독파모 기준을 충족한 국내 모델을 50% 이상, 다른 국내 기업 모델을 30% 이상 써야 하고, 해외 모델은 최소한의 기능에만 쓸 수 있으며 정부 지원을 받지 못합니다. 2026년에는 세 컨소시엄에 B200 512장이 지원되고, 2027년 예산안에는 2,500억 원이 잡혔습니다. 흥미롭게도 독파모에서 탈락한 모티프의 Motif 3는 SKT와 KT 두 컨소시엄의 모델 목록에 모두 들어가 있습니다.

마치며

이번 평가의 진짜 성과는 결과보다 공개였습니다. 원점수가 공개됐기 때문에 이의 제기도, 다시 계산해 보는 이 글도 가능했습니다. 과기정통부 장관은 9월 29일 "독파모 3차는 계획대로 마무리"하고 프런티어 AI를 위한 별도 노력을 병행하겠다고 밝혔습니다. 3차 평가에서도 같은 수준의 공개를 기대합니다. 그리고 모델을 고르는 모든 조직에 이번 데이터가 남기는 말은 하나입니다. 벤치마크는 출발선이지 결승선이 아니다.

함께 읽으면 좋은 글: 한국어 임베딩 모델, 우리 문서로 직접 재봤다 · AI 기본법 계도기간이 끝나간다 · GPU 고르는 법 2026

참고한 자료