AI에게 도구 100개를 쥐여줘도 일을 못 한다. '언제·어떻게 쓰는지'를 모르기 때문이다. 이 '절차의 공백'을 메우려 등장한 것이 바로 '스킬'이다. 2023년 마인크래프트의 Voyager에서 시작해 2026년 700만 개가 넘는 스킬이 쌓인 지금, 학계는 스킬을 AI의 새로운 '단위'로 보기 시작했다. 에이전트 스킬 종합 서베이의 분류 대지도(원문 그림 인용)와, 스킬 생성이 왜 그토록 어려운지 보여준 최신 벤치마크 논문들을 쉽게 풀어본다.
코어닷투데이2026-06-0638분
한 줄로 시작하는 이야기
주방에 세계 최고급 조리도구 100개를 깔아놓는다고, 누구나 요리사가 되는 건 아니다. 무엇을, 언제, 어떤 순서로 쓰는지를 모르면 도구는 그냥 쇳덩이다.
2026년의 AI 에이전트가 정확히 이 문제에 부딪혔다. GPT든 Claude든 Gemini든, 검색·코드 실행·API 호출 같은 '도구(tool)'는 차고 넘치게 붙일 수 있다. 그런데 막상 복잡한 일을 시키면 — 매번 처음부터 더듬더듬 추론하다가 느려지고, 깨지고, 들쭉날쭉해진다.
이 빈틈을 메우려고 등장한 개념이 스킬(Skill) 이다. 도구가 '무엇을 할 수 있는가'라면, 스킬은 '언제·어떻게·해야 하는가'까지 담은, 재사용 가능한 절차 묶음이다. 그리고 2026년 현재, 이 스킬은 단순한 기능을 넘어 "AI 능력의 새로운 단위" 로 다뤄지기 시작했다.
에이전트가 짧은 단일 작업을 넘어 긴 호흡의 과제(long-horizon task) 를 맡게 되자 이 공백이 치명적으로 드러났다. 매 실행마다 백지에서 추론을 다시 짜는 방식은 서베이의 표현대로 "깨지기 쉽고(brittle), 지연이 크고(high latency), 신뢰할 수 없다(unreliable)."
!
문제: 매번 처음부터 추론
같은 종류의 일을 시켜도 에이전트는 매번 백지에서 '어떻게 하지?'를 다시 고민한다. 느리고, 토큰을 낭비하고, 결과가 들쭉날쭉하다.
+
해결: 절차를 '아티팩트'로 외부화
'이런 상황에선 이렇게 한다'는 노하우를 지속 가능한 파일로 박제해 두고, 필요할 때 꺼내 쓴다. 매번 추론하지 않고 '불러온다'.
✓
결과: 빠르고 일관되고 재사용 가능
한 번 잘 만든 스킬은 수천 번 재사용된다. 라이브러리가 커질수록 에이전트는 더 강해진다 — 이것이 스킬 중심 에이전트의 핵심.
요약하면, 스킬은 '추론'을 '검색'으로 바꾸는 장치다. 매번 머리를 싸매는 대신, 검증된 절차를 불러와 실행한다. 이 단순한 전환이 2023년 이후 AI 에이전트 연구의 한 축을 통째로 만들어냈다.
제2장: 스킬이란 무엇인가 — S = (M, R, C)
서베이는 에이전트 스킬을 "경계가 분명한, 재사용 가능한 절차적 아티팩트" 로 정의하고, 깔끔한 3요소 수식으로 형식화한다.
에이전트 스킬의 형식적 정의
S = (M, ℛ, 𝒞)
M = 루트 지침 문서 (root instruction) — 핵심 노하우를 담은 SKILL.md 같은 본문
ℛ = 보조 리소스 — 참조 문서, 템플릿, 실행 가능한 스크립트
𝒞 = 적용 조건 (conditions) — 메타데이터, 설명, 임베딩 → '언제 이 스킬을 꺼낼지'
흥미로운 건 𝒞(적용 조건) 의 존재다. 이게 바로 1장의 '절차의 공백'을 메우는 부분이다. 스킬은 내용(M)만이 아니라 '언제 발동되어야 하는가'라는 메타정보를 함께 품는다.
인류의 스킬에서 에이전트의 스킬로
서베이의 첫 그림은 이 개념을 인류사 전체로 확장한다. 스킬은 사실 인간 문명의 축적 방식 그 자체였다는 것이다.
▲ 원문 Fig. 1: From Human Skills to Agent Skills (arXiv:2605.07358)
불 피우기·도구 만들기(생존) → 수학·공학(지식) → 기계·대량생산(산업) → 컴퓨터·인터넷(디지털) → 도구 사용 AI(2023~) → 자율 에이전트 스킬(2024~현재). 인류가 노하우를 글·도면·매뉴얼로 외부화해 다음 세대에 물려줬듯, 이제 AI 에이전트도 자신의 노하우를 스킬로 외부화해 다른 에이전트에게 물려준다.
스킬의 세 가지 몸: 글·코드·하이브리드
서베이는 스킬을 리소스 구성에 따라 셋으로 나눈다.
스킬 표현(Representation)의 3가지 형태
Text-backed글 기반참조·예시·템플릿. 사람이 읽기 좋고 해석 가능 / 단, 실행 결정성은 낮음
Code-backed코드 기반실행 스크립트·함수. 반복 작업에 강하고 결정적 / 단, 버전·테스트·의존성 비용
Hybrid혼합형글 + 실행 아티팩트. 해석 가능성과 실행력을 모두 / 단, 조율 부담이 가장 큼
네 갈래 중 연구가 가장 몰린 건 ②경험 기반이다. "에이전트가 한 일을 보고, 그로부터 재사용할 노하우를 뽑는다"는 직관이 매력적이기 때문이다. 서베이는 이 과정을 네 단계 연산으로 정리한다.
Selection · 선별수많은 궤적 중 쓸 만한 성공 사례를 고른다 (Voyager: 성공한 실행 코드만 보관)
Abstraction · 추상화구체적 사례를 일반적 교훈으로 압축 (Reflexion·ExpeL·Trace2Skill)
Memory Org · 기억 정리재사용하기 좋게 구조화 (Think-in-Memory·G-Memory·Nemori)
Packaging · 포장워크플로를 호출 가능한 API/스킬로 패키징 (AWM·PolySkill·JARVIS-1)
여기서 주목할 신작이 Trace2Skill(arXiv 2603.25158)다. 이 논문의 통찰은 "궤적 전체를 통째로 스킬로 만들지 말라"는 것. 대신 궤적 안의 '국소적 교훈(trajectory-local lessons)' — 이를테면 "이 메뉴 구조는 이렇게 뚫는다" 같은 특정 결정 지점 — 만 콕 집어 추출한다. 그래야 다른 과제로 전이(transfer) 가 잘 되고 중복도 줄어든다. 통째로 vs 국소적, 작아 보이는 차이가 재사용성을 가른다.
제5장: 스킬의 일생 — 검색·선택·진화
스킬은 만들고 끝이 아니다. 라이브러리에 수십만 개가 쌓이면, 이제 "필요한 순간에 올바른 스킬을 찾아 쓰고, 낡으면 고치는" 문제가 생긴다. 서베이는 이를 검색·선택과 진화로 다룬다.
검색과 선택: 2단계 파이프라인
검색(Retrieval) — 후보를 불러온다: 밀집 임베딩(Voyager), 키워드 매칭(SkillWeaver), 생성형 검색(ToolGen), 구조 인식(계층·의존성 기반).
선택(Selection) — 실제로 무엇을 실행할지 결정한다: 맥락 인식, 스킬 조합(composition), 비용/효용 고려, 피드백 기반 재랭킹.
수십만 개 라이브러리에서 '의미는 비슷한데 상황엔 안 맞는' 스킬을 거르는 건 단순 유사도 검색으로는 부족하다. 그래서 상태·전제조건(precondition) 까지 보는 구조 인식 검색이 부상하고 있다.
SkillGenBench(arXiv 2605.18693)는 스킬을 쓰는 능력이 아니라 만드는 능력만 따로 떼어 측정한 최초의 벤치마크다. 결과는 "상당한 성능 편차(substantial performance variation)." 특히 출처가 다르면 실패 양상도 달랐다 — 코드 저장소에서 절차를 뽑을 때와 긴 문서에서 뽑을 때, 무너지는 지점이 서로 다르다. 결론은 단호하다. 재사용 가능한 스킬 증류는 아직 근본적으로 어려운 문제다.
▪ 저자들이 제안한 'Metric Freedom(F)' 지표가 유용성을 강하게 예측: r = -0.85 (p<0.0001)
▪ 충격적 결론: "동일한 궤적이 경직된 지표에선 정반대의 효과를 낸다"
▪ 제안 기법 AdaSkill: 성능 유지하며 연산비용 최대 8배↓, 지연 최대 15배↓
이건 실무에 직접적이다. "스킬을 도입하기 전에, 당신의 평가 지표가 스킬을 받아들일 만큼 '유연한지'부터 점검하라." 지표가 경직돼 있으면, 아무리 좋은 스킬도 효과가 사라지거나 마이너스가 된다.
증거 3 — Skill-SD: 제대로 하면 크게 오른다
물론 잘 설계하면 효과는 크다. Skill-SD(arXiv 2604.10674)는 에이전트 자신의 성공 궤적을 자연어 '스킬'로 요약해, 그것을 교사 모델에만 슬쩍 알려주고 학생 모델은 원래 프롬프트로 배우게 하는 '스킬 조건부 자기증류'를 제안했다. 결과(개선폭)는 인상적이다.
Skill-SD vs OPD · AppWorld
+42.1%
Skill-SD vs OPD · Sokoban
+40.6%
Skill-SD vs GRPO · AppWorld
+14.0%
Skill-SD vs GRPO · Sokoban
+10.9%
※ 기존 강화학습 기법(GRPO·OPD) 대비 성능 개선폭. 막대는 +45% 기준 상대 길이.
세 논문을 종합하면 메시지는 명확하다. 스킬은 강력하지만 자동화는 어렵다. 그리고 효과는 '무엇을 어떻게 측정하느냐'에 크게 좌우된다. 'AI에게 시키면 알아서 좋은 스킬이 나온다'는 환상은 버려야 한다.
제7장: 보이지 않는 위협 — 스킬 공급망과 거버넌스
스킬이 앱처럼 거래되는 생태계에는 앱과 똑같은 그림자가 따라온다. 서베이가 경고하는 대표적 위협이 'PoisonedSkills(오염된 스킬)' 다. 누군가 악의적이거나 낡은 스킬을 공개 라이브러리에 올리고, 에이전트가 그걸 검증 없이 불러 실행한다면? 이것은 소프트웨어의 공급망 공격(supply chain attack) 과 정확히 같은 구조다.
스킬 생태계의 3대 미해결 과제
상호운용성플랫폼마다 스킬 포맷이 제각각 — 표준화 없이는 '내 스킬'이 다른 호스트에서 안 돈다
안전·검증선의의 업데이트와 악의적·오염된 업데이트를 구분하기. 실행 전 신뢰 검사가 필수
장기 거버넌스라이브러리가 커질수록 폐기·감사·출처 추적 같은 '능력 관리'가 핵심 과제로
여기서 COLLEAGUE.SKILL 글에서 강조했던 '거버넌스를 처음부터 설계의 바닥에 둔다' 는 원칙이 다시 빛난다. 검사 가능성(inspectable)·교정 가능성(correctable)·롤백·출처 추적은 멋부림이 아니라, 스킬 생태계가 신뢰 위에서 지속되기 위한 필수 인프라다.
제8장: 2026년, 스킬이 AI의 '단위'가 된다
이 모든 흐름을 한 발 물러나 보면, 거대한 그림이 보인다. AI의 능력을 담는 '기본 단위'가 바뀌고 있다는 것이다.
시대
능력의 단위
비유
~2022
모델 가중치(weights)
능력이 모델 안에 '학습'으로 박제됨 — 바꾸려면 재훈련
2023~2024
프롬프트 · 도구(tools)
능력을 말과 API로 확장 — 단, 매번 다시 조립
2025~2026
스킬(skills)
능력을 '검사·재사용·공유·진화 가능한 아티팩트'로 외부화 — 앱스토어처럼
이 변화의 함의는 크다. 능력이 모델 가중치 안에 갇혀 있을 때는, AI를 개선하려면 거대한 재훈련이 필요했다. 하지만 능력이 스킬이라는 외부 아티팩트가 되는 순간 — 누구나 만들고, 읽고, 고치고, 거래하고, 물려줄 수 있게 된다. 우리가 이 시리즈에서 다룬 흐름들이 모두 이 한 점으로 모인다.
Voyager (2023): 경험을 스킬 라이브러리로
↓
Task-Observer: 스킬을 스스로 개선하는 스킬
↓
COLLEAGUE.SKILL: 사람의 전문성을 스킬로 증류
↓
서베이 (2026): 스킬을 'AI의 새 단위'로 체계화
마치며: 실무자가 가져갈 세 가지
1
'도구'가 아니라 '스킬'로 생각하라
에이전트에 API만 잔뜩 붙이지 말고, '언제·어떻게 쓰는지'를 담은 스킬(SKILL.md)로 노하우를 외부화하라. 반복 작업일수록 효과가 크다.
2
자동 생성을 맹신하지 말고, 측정부터 점검하라
스킬 효과는 +28%~-2%로 출렁인다. 도입 전 평가 지표의 '유연성'을 확인하고, 생성된 스킬은 반드시 검증·롤백 체계를 갖춰라.
3
스킬 공급망을 보안 문제로 다뤄라
외부 스킬은 외부 패키지와 같다. 출처·검증·감사·폐기 — 거버넌스를 처음부터 설계에 넣어야 신뢰가 지속된다.
2026년, AI의 진짜 경쟁력은 '얼마나 큰 모델'이 아니라 '얼마나 좋은 스킬을 만들고, 고르고, 진화시키는가' 로 옮겨가고 있다. 도구는 모두가 가진다. 차이는, 그 도구를 언제·어떻게 쓸지 아는 스킬에서 갈린다.