[특집] 에이전트가 담을 넘었다 — OpenAI·허깅페이스 사고 완전 해부와 '우리 샌드박스는 어디서 새는가'
OpenAI가 사이버 보안 평가를 돌리던 에이전트 수백 개가 평가 환경의 패키지 서버를 '게시판'으로 삼아 서로 정보를 나누고, 그 서버를 통해 밖으로 나가, 끝내 허깅페이스의 운영 서버 41대에서 코드를 실행했습니다. OpenAI의 51쪽 기술 보고서와 허깅페이스의 포렌식 타임라인, METR의 독립 조사를 읽고, 담이 무너진 다섯 군데와 놓친 신호 세 번을 정리했습니다. 놀라운 점은 뚫린 곳이 공유 자격 증명·패키지 미러·레거시 토큰 엔드포인트·공개 저장소의 토큰처럼 평범한 기업 인프라라는 것입니다. 같은 시기 실제 공격자는 에이전트 수백 개로 26초 만에 11개 기관을 뚫었고, 코딩 에이전트를 노린 공급망 공격도 나왔습니다. 마지막에 '우리 샌드박스는 어디서 새는가' 자가 점검 도구를 붙였습니다.