coredot.today
블로그로 돌아가기

#벤치마크

5개의 포스트

코딩이 풀렸다면, 그다음은? — 코드의 '슬롭'을 측정하는 법
특집AI 코딩코드 품질
2026.09.12

코딩이 풀렸다면, 그다음은? — 코드의 '슬롭'을 측정하는 법

LLM은 이제 형식적으로 올바른 코드를 거의 완벽하게 쓴다. 그런데 테스트를 전부 통과한 코드가 왜 한 달 뒤에는 아무도 손댈 수 없는 덩어리가 되는가. Earendil의 세바스티안이 던진 이 질문이 해커뉴스를 뜨겁게 달궜다. 이 글은 그 질문의 뿌리를 1976년 맥케이브의 순환 복잡도까지 거슬러 올라가 추적하고, 그 답으로 등장한 벤치마크 SlopCodeBench의 아키텍처를 수식과 코드 수준에서 뜯어본다. 침식(erosion)과 군더더기(verbosity)라는 두 지표가 어떻게 계산되는지, 왜 프롬프트로는 고쳐지지 않는지, 그리고 2026년 9월 현재 프론티어 모델들이 이 벤치마크 앞에서 어디까지 왔는지를 인터랙티브 도구 여섯 개와 함께 짚는다.

코어닷투데이89
AI 연구 자율주행 5단계 — 지금 우리는 L2에 서 있다
기술AutoResearchAI 과학
2026.09.01

AI 연구 자율주행 5단계 — 지금 우리는 L2에 서 있다

자율주행에 L0~L5가 있듯 AI 연구 자동화에도 단계가 있다. 24개 기관 연구진이 49쪽 서베이로 그 지도를 그렸고, 결론은 냉정하다 — 화려한 파이프라인들은 전부 L2다. 그런데 같은 달, 한 스타트업의 AI는 스스로 벤치마크 3개에서 세계 기록을 갈아치웠다. 지도와 영토가 어긋나는 지점에서 2026년 AI 과학의 진짜 좌표를 읽는다.

코어닷투데이55
당신의 AI, 빌린 겁니까 가진 겁니까 (3부): 90억 모델이 프런티어를 이긴 날, 그리고 판별법
기술인텔리전스 오너십파인튜닝
2026.07.30

당신의 AI, 빌린 겁니까 가진 겁니까 (3부): 90억 모델이 프런티어를 이긴 날, 그리고 판별법

이론은 충분하다. 이제 숫자다. Fermisense의 90억 파라미터 모델은 e커머스 카탈로그 검수에서 프런티어 5종을 어떻게 이겼고, 비용은 왜 최대 340배 저렴했나. 브리지워터부터 링크드인·체커까지 11개 회사의 성적표를 펼치고, 마지막엔 '우리 회사의 어떤 업무가 이 방식의 후보인가'를 직접 판별하는 체크리스트로 특집을 닫는다.

코어닷투데이22
GameWorld: AI가 비디오 게임을 '제대로' 할 수 있을까? — 멀티모달 게임 에이전트 평가의 새로운 기준
논문 리뷰GameWorld게임 AI
2026.04.13

GameWorld: AI가 비디오 게임을 '제대로' 할 수 있을까? — 멀티모달 게임 에이전트 평가의 새로운 기준

34개 브라우저 게임, 170개 태스크, 18개 모델로 AI 게임 에이전트를 체계적으로 평가한 GameWorld 벤치마크를 깊이 있게 분석합니다. 왜 최고의 AI도 초보 게이머에게 지는지, 그 이유를 파헤칩니다.

코어닷투데이50
GraphRAG는 정말 효과적인가? — ICLR 2026 논문이 밝힌 9가지 진실
기술GraphRAGRAG
2026.04.08

GraphRAG는 정말 효과적인가? — ICLR 2026 논문이 밝힌 9가지 진실

그래프가 RAG를 377배 비싸게 만든다면, 언제 쓸 가치가 있을까? ICLR 2026에서 발표된 GraphRAG-Bench 논문이 9개 시스템을 체계적으로 벤치마킹하여 밝혀낸 9가지 핵심 발견을 깊이 있게 분석합니다.

코어닷투데이67