coredot.today
블로그로 돌아가기

#소버린 AI

6개의 포스트

벤치마크 점수로 AI 모델을 고르면 안 되는 이유 — 독파모 2차 평가 원점수로 직접 계산해 보기
인사이트독자 AI 파운데이션 모델독파모
2026.10.04

벤치마크 점수로 AI 모델을 고르면 안 되는 이유 — 독파모 2차 평가 원점수로 직접 계산해 보기

8월 18일 발표된 독자 AI 파운데이션 모델 2차 평가에서 SKT·업스테이지·LG가 통과하고 모티프가 탈락했습니다. 그런데 과기정통부가 8월 27일 공개한 세부 점수를 보면 모티프는 벤치마크 점수 1위였고, 국제 평가 기관 Artificial Analysis의 지수에서는 2위와 10점 넘게 차이가 났습니다. 결과를 가른 것은 전문가와 사용자 평가였습니다. 평가위원 10명과 국민 평가단 185명의 원점수까지 공개된 자료로, 가중치를 바꾸면 순위가 어떻게 달라지는지 직접 계산해 볼 수 있게 했습니다. 공정했느냐를 따지려는 글이 아닙니다. 국내 모델을 고르는 기업에 '벤치마크 1위'가 무엇을 뜻하고 무엇을 뜻하지 않는지 보여 주는 드문 공개 데이터라서 들여다봤습니다. 2027년 AI 예산 9.4조와 '모두의 AI'까지 함께 정리했습니다.

코어닷투데이20분
AI 플랫폼은 모델 바깥에서 만들어진다 — 2026년 일곱 층의 노하우와 서빙 플랫폼 지도
특집AI 플랫폼LLM 서빙
2026.10.03

AI 플랫폼은 모델 바깥에서 만들어진다 — 2026년 일곱 층의 노하우와 서빙 플랫폼 지도

2026년에 AI 플랫폼을 만든다는 것은 모델을 만드는 일이 아니라 모델 둘레의 일곱 층을 짓는 일입니다. 서빙, 게이트웨이, 컨텍스트·캐시, 에이전트 런타임, 도구·프로토콜, 평가·관측, 보안·거버넌스. 이 글은 10월 3일 기준의 가격표·저장소·사양·엔지니어링 블로그를 직접 확인해, 층마다 무엇을 사고 무엇을 지을지 정리했습니다. 특히 서빙은 '빌려 쓰기 대 직접 돌리기'가 아니라 일곱 단짜리 사다리로 풀었습니다. 같은 모델의 입력 단가가 호스트에 따라 23배 벌어지는 이유, GPU 임대료가 2년 만에 반등한 지금의 손익분기, 서버를 늘리면 오히려 느려지는 캐시 문제, 한 해 사이 주인이 바뀐 게이트웨이·관측 도구들, 그리고 서울 리전에서 최신 프런티어 모델을 '국내 처리'로 쓸 수 없는 현실까지 다룹니다. 계산기와 시뮬레이터 7개를 직접 움직여 볼 수 있습니다.

코어닷투데이86분
[특집] 프런티어가 브레이크를 밟는다 — 최강 AI는 이제 '살 수 있는 상품'이 아니다
인사이트특집프런티어 AI
2026.10.03

[특집] 프런티어가 브레이크를 밟는다 — 최강 AI는 이제 '살 수 있는 상품'이 아니다

2026년 9월, AI 업계에서 보기 드문 일이 한 달 안에 겹쳤습니다. OpenAI 수석과학자는 '어떤 연구소도 최대 속도로 계속 키울 만큼 안전 문제를 풀지 못했다'고 썼고, Anthropic CEO는 '프런티어의 속도를 조절해야 한다'는 글에서 외부 평가자를 회사 안에 상주시키겠다고 약속했습니다. 올트먼은 올해 상장을 접었습니다. 그리고 세 회사의 가장 강한 모델은 모두 '심사를 통과한 소수'에게 먼저 갔습니다. Anthropic의 Mythos 5.1은 지금 미국 조직만 쓸 수 있습니다. 여름 내내 이어진 사고와 정지, 그 뒤의 선언을 원문으로 따라가고, OpenAI가 공개한 내부 데이터(연구자 한 명이 하루 600달러어치 에이전트를 쓴다)를 읽은 뒤, 한국 기업이 지금 실제로 쓸 수 있는 모델이 무엇인지 정리합니다.

코어닷투데이25분
[특집] 소버린 AI 2차 평가의 역설 — 벤치마크 1위가 탈락했다: 독자 AI 파운데이션 모델 14개월과 '무엇으로 평가할 것인가'
특집특집소버린 AI
2026.10.03

[특집] 소버린 AI 2차 평가의 역설 — 벤치마크 1위가 탈락했다: 독자 AI 파운데이션 모델 14개월과 '무엇으로 평가할 것인가'

2026년 8월, 국가대표 AI 모델을 가리는 '독자 AI 파운데이션 모델' 2차 평가에서 모티프테크놀로지스가 탈락했습니다. 그런데 세계적 평가 지표인 Artificial Analysis 지수로는 네 팀 중 모티프가 가장 높았습니다. 벤치마크 합계도 1위, 그러나 전문가와 사용자 점수는 꼴찌. 공개된 세부 점수로 배점을 바꿔 다시 채점해 보면, 이 탈락은 '모델의 우열'이 아니라 '무엇을 중시하기로 정했는가'의 결과에 가깝습니다. 1차에서 '독자성' 기준으로 탈락한 네이버, '처음부터 학습했나'를 둘러싼 공개 검증, 평가 화면에 모델 이름이 그대로 보였다는 지적, 절반 넘게 놀고 있는 임차 GPU, 그리고 '경쟁에서 육성으로'의 방향 전환까지 — 14개월의 기록과 다른 나라의 선택을 함께 봅니다.

코어닷투데이31분
AI를 국경에서 멈춰 세우다 — 칩, 가중치, 그리고 2026년 AI 수출통제
특집AI 수출통제반도체 규제
2026.07.01

AI를 국경에서 멈춰 세우다 — 칩, 가중치, 그리고 2026년 AI 수출통제

냉동 랍스터 밑에 숨긴 GPU, 가짜 임신복 속의 칩, 하루 만에 증발한 6천억 달러. AI 수출통제라는 낯선 단어 뒤에는 냉전에서 시작된 70년의 계보와, '무기가 파일이 되는' 시대의 새로운 질문이 있다. 왜 칩이 급소가 됐고, 왜 이번엔 모델 자체를 막으려 했으며, 그 사이에서 한국은 어디에 서 있는가.

코어닷투데이27분
CB Insights 2026 테크 트렌드 완전 해부 — 14개 메가트렌드로 읽는 기술의 미래
인사이트테크 트렌드AI 에이전트
2026.03.30

CB Insights 2026 테크 트렌드 완전 해부 — 14개 메가트렌드로 읽는 기술의 미래

CB Insights가 102페이지에 걸쳐 분석한 2026년 14대 테크 트렌드를 완전 해부합니다. AI 에이전트의 ROI 측정부터 매장의 소멸, 데이터센터의 전력망 편입, 로봇 팀워크까지 — 지금 가장 중요한 기술 변화를 풍부한 데이터와 인터랙티브 탐색기로 체험하세요.

코어닷투데이34분