#독자 AI 파운데이션 모델
2개의 포스트

벤치마크 점수로 AI 모델을 고르면 안 되는 이유 — 독파모 2차 평가 원점수로 직접 계산해 보기
8월 18일 발표된 독자 AI 파운데이션 모델 2차 평가에서 SKT·업스테이지·LG가 통과하고 모티프가 탈락했습니다. 그런데 과기정통부가 8월 27일 공개한 세부 점수를 보면 모티프는 벤치마크 점수 1위였고, 국제 평가 기관 Artificial Analysis의 지수에서는 2위와 10점 넘게 차이가 났습니다. 결과를 가른 것은 전문가와 사용자 평가였습니다. 평가위원 10명과 국민 평가단 185명의 원점수까지 공개된 자료로, 가중치를 바꾸면 순위가 어떻게 달라지는지 직접 계산해 볼 수 있게 했습니다. 공정했느냐를 따지려는 글이 아닙니다. 국내 모델을 고르는 기업에 '벤치마크 1위'가 무엇을 뜻하고 무엇을 뜻하지 않는지 보여 주는 드문 공개 데이터라서 들여다봤습니다. 2027년 AI 예산 9.4조와 '모두의 AI'까지 함께 정리했습니다.
![[특집] 소버린 AI 2차 평가의 역설 — 벤치마크 1위가 탈락했다: 독자 AI 파운데이션 모델 14개월과 '무엇으로 평가할 것인가'](/_next/image?url=https%3A%2F%2Ffiles.core.today%2Fstorage%2Fcoredot%2Fpublic%2Fblog%2Fsov-cover.webp&w=3840&q=75)
[특집] 소버린 AI 2차 평가의 역설 — 벤치마크 1위가 탈락했다: 독자 AI 파운데이션 모델 14개월과 '무엇으로 평가할 것인가'
2026년 8월, 국가대표 AI 모델을 가리는 '독자 AI 파운데이션 모델' 2차 평가에서 모티프테크놀로지스가 탈락했습니다. 그런데 세계적 평가 지표인 Artificial Analysis 지수로는 네 팀 중 모티프가 가장 높았습니다. 벤치마크 합계도 1위, 그러나 전문가와 사용자 점수는 꼴찌. 공개된 세부 점수로 배점을 바꿔 다시 채점해 보면, 이 탈락은 '모델의 우열'이 아니라 '무엇을 중시하기로 정했는가'의 결과에 가깝습니다. 1차에서 '독자성' 기준으로 탈락한 네이버, '처음부터 학습했나'를 둘러싼 공개 검증, 평가 화면에 모델 이름이 그대로 보였다는 지적, 절반 넘게 놀고 있는 임차 GPU, 그리고 '경쟁에서 육성으로'의 방향 전환까지 — 14개월의 기록과 다른 나라의 선택을 함께 봅니다.