coredot.today
블로그로 돌아가기

#벤치마크

8개의 포스트

벤치마크 점수로 AI 모델을 고르면 안 되는 이유 — 독파모 2차 평가 원점수로 직접 계산해 보기
인사이트독자 AI 파운데이션 모델독파모
2026.10.04

벤치마크 점수로 AI 모델을 고르면 안 되는 이유 — 독파모 2차 평가 원점수로 직접 계산해 보기

8월 18일 발표된 독자 AI 파운데이션 모델 2차 평가에서 SKT·업스테이지·LG가 통과하고 모티프가 탈락했습니다. 그런데 과기정통부가 8월 27일 공개한 세부 점수를 보면 모티프는 벤치마크 점수 1위였고, 국제 평가 기관 Artificial Analysis의 지수에서는 2위와 10점 넘게 차이가 났습니다. 결과를 가른 것은 전문가와 사용자 평가였습니다. 평가위원 10명과 국민 평가단 185명의 원점수까지 공개된 자료로, 가중치를 바꾸면 순위가 어떻게 달라지는지 직접 계산해 볼 수 있게 했습니다. 공정했느냐를 따지려는 글이 아닙니다. 국내 모델을 고르는 기업에 '벤치마크 1위'가 무엇을 뜻하고 무엇을 뜻하지 않는지 보여 주는 드문 공개 데이터라서 들여다봤습니다. 2027년 AI 예산 9.4조와 '모두의 AI'까지 함께 정리했습니다.

코어닷투데이20분
[특집] 소버린 AI 2차 평가의 역설 — 벤치마크 1위가 탈락했다: 독자 AI 파운데이션 모델 14개월과 '무엇으로 평가할 것인가'
특집특집소버린 AI
2026.10.03

[특집] 소버린 AI 2차 평가의 역설 — 벤치마크 1위가 탈락했다: 독자 AI 파운데이션 모델 14개월과 '무엇으로 평가할 것인가'

2026년 8월, 국가대표 AI 모델을 가리는 '독자 AI 파운데이션 모델' 2차 평가에서 모티프테크놀로지스가 탈락했습니다. 그런데 세계적 평가 지표인 Artificial Analysis 지수로는 네 팀 중 모티프가 가장 높았습니다. 벤치마크 합계도 1위, 그러나 전문가와 사용자 점수는 꼴찌. 공개된 세부 점수로 배점을 바꿔 다시 채점해 보면, 이 탈락은 '모델의 우열'이 아니라 '무엇을 중시하기로 정했는가'의 결과에 가깝습니다. 1차에서 '독자성' 기준으로 탈락한 네이버, '처음부터 학습했나'를 둘러싼 공개 검증, 평가 화면에 모델 이름이 그대로 보였다는 지적, 절반 넘게 놀고 있는 임차 GPU, 그리고 '경쟁에서 육성으로'의 방향 전환까지 — 14개월의 기록과 다른 나라의 선택을 함께 봅니다.

코어닷투데이31분
글자를 포기한 모델 — TypeSafe의 Jev와 '시스템 원' 완전 해부
특집JevTypeSafe AI
2026.09.24

글자를 포기한 모델 — TypeSafe의 Jev와 '시스템 원' 완전 해부

2026년 9월 15일, ChatGPT를 만든 사람이 2년 스텔스 끝에 내놓은 모델은 글을 쓰지 않는다. 상태와 타입이 정해진 질문을 받아 확률이 붙은 결정만 돌려준다. 해커뉴스 1,924점, API가 수요를 감당 못 해 잠시 멈췄다. 이 글은 그 모델의 구조(Choice·Score·Noul), 실제 API 모양, 회사가 공개한 워크플로 평가 데이터 전량, 그리고 커뮤니티가 제기한 반론까지 한자리에 놓는다. 흥미로운 사실 하나 — 평가 데이터를 뜯어 보면 Jev는 정확도 1등이 아니고, 정작 가장 유용한 발견은 Jev와 무관하다. 인터랙티브 위젯 7종과 삽화 12장. 한국어 사용자를 위한 경고도 포함.

코어닷투데이60분
코딩이 풀렸다면, 그다음은? — 코드의 '슬롭'을 측정하는 법
특집AI 코딩코드 품질
2026.09.12

코딩이 풀렸다면, 그다음은? — 코드의 '슬롭'을 측정하는 법

LLM은 이제 형식적으로 올바른 코드를 거의 완벽하게 쓴다. 그런데 테스트를 전부 통과한 코드가 왜 한 달 뒤에는 아무도 손댈 수 없는 덩어리가 되는가. Earendil의 세바스티안이 던진 이 질문이 해커뉴스를 뜨겁게 달궜다. 이 글은 그 질문의 뿌리를 1976년 맥케이브의 순환 복잡도까지 거슬러 올라가 추적하고, 그 답으로 등장한 벤치마크 SlopCodeBench의 아키텍처를 수식과 코드 수준에서 뜯어본다. 침식(erosion)과 군더더기(verbosity)라는 두 지표가 어떻게 계산되는지, 왜 프롬프트로는 고쳐지지 않는지, 그리고 2026년 9월 현재 프론티어 모델들이 이 벤치마크 앞에서 어디까지 왔는지를 인터랙티브 도구 여섯 개와 함께 짚는다.

코어닷투데이89분
AI 연구 자율주행 5단계 — 지금 우리는 L2에 서 있다
기술AutoResearchAI 과학
2026.09.01

AI 연구 자율주행 5단계 — 지금 우리는 L2에 서 있다

자율주행에 L0~L5가 있듯 AI 연구 자동화에도 단계가 있다. 24개 기관 연구진이 49쪽 서베이로 그 지도를 그렸고, 결론은 냉정하다 — 화려한 파이프라인들은 전부 L2다. 그런데 같은 달, 한 스타트업의 AI는 스스로 벤치마크 3개에서 세계 기록을 갈아치웠다. 지도와 영토가 어긋나는 지점에서 2026년 AI 과학의 진짜 좌표를 읽는다.

코어닷투데이55분
당신의 AI, 빌린 겁니까 가진 겁니까 (3부): 90억 모델이 프런티어를 이긴 날, 그리고 판별법
기술인텔리전스 오너십파인튜닝
2026.07.30

당신의 AI, 빌린 겁니까 가진 겁니까 (3부): 90억 모델이 프런티어를 이긴 날, 그리고 판별법

이론은 충분하다. 이제 숫자다. Fermisense의 90억 파라미터 모델은 e커머스 카탈로그 검수에서 프런티어 5종을 어떻게 이겼고, 비용은 왜 최대 340배 저렴했나. 브리지워터부터 링크드인·체커까지 11개 회사의 성적표를 펼치고, 마지막엔 '우리 회사의 어떤 업무가 이 방식의 후보인가'를 직접 판별하는 체크리스트로 특집을 닫는다.

코어닷투데이22분
GameWorld: AI가 비디오 게임을 '제대로' 할 수 있을까? — 멀티모달 게임 에이전트 평가의 새로운 기준
논문 리뷰GameWorld게임 AI
2026.04.13

GameWorld: AI가 비디오 게임을 '제대로' 할 수 있을까? — 멀티모달 게임 에이전트 평가의 새로운 기준

34개 브라우저 게임, 170개 태스크, 18개 모델로 AI 게임 에이전트를 체계적으로 평가한 GameWorld 벤치마크를 깊이 있게 분석합니다. 왜 최고의 AI도 초보 게이머에게 지는지, 그 이유를 파헤칩니다.

코어닷투데이50분
GraphRAG는 정말 효과적인가? — ICLR 2026 논문이 밝힌 9가지 진실
기술GraphRAGRAG
2026.04.08

GraphRAG는 정말 효과적인가? — ICLR 2026 논문이 밝힌 9가지 진실

그래프가 RAG를 377배 비싸게 만든다면, 언제 쓸 가치가 있을까? ICLR 2026에서 발표된 GraphRAG-Bench 논문이 9개 시스템을 체계적으로 벤치마킹하여 밝혀낸 9가지 핵심 발견을 깊이 있게 분석합니다.

코어닷투데이67분