coredot.today
[특집] 스코어북을 코드로 내려가 보다 — 메타의 '조직 세컨드 브레인'과 「Learning on the Job」이 보여준 '배우는 에이전트'의 실체
블로그로 돌아가기
특집메타세컨드 브레인조직 지식계속 학습Learning on the Jobτ-benchAhaBenchTrainee-Bench스코어북레시피자기개선 루프회귀 테스트적대적 검토컴플라이언스 AILLM 위키Open Knowledge Format카파시지식 관리전문가 시스템에세이 해설

[특집] 스코어북을 코드로 내려가 보다 — 메타의 '조직 세컨드 브레인'과 「Learning on the Job」이 보여준 '배우는 에이전트'의 실체

지난 특집은 프라이머리 벤처의 '스코어북'과 '계속 배우는 루프'를 개념으로 다뤘습니다. 이번에는 그 개념이 실제로 어떻게 생겼는지 코드 수준으로 내려갑니다. 2026년 9월 2일 메타 엔지니어링 블로그가 공개한 '조직의 세컨드 브레인'은 컴플라이언스 전문가의 머릿속 지식을 200개 넘는 텍스트 파일로 증류하고, 전문가의 교정 하나하나를 진단·컴파일·검증·승인의 네 단계로 '컴파일'해 회귀 0건으로 6주 만에 며칠 걸리던 평가를 몇 분으로 줄인 시스템입니다. 7월의 논문 「Learning on the Job」은 가중치를 고정한 에이전트가 '맞았다/틀렸다' 한 비트만으로 1.6배, 교정을 받으면 2.6배 나아지고, 약한 모델이 쓴 메모가 강한 모델까지 돕는다는 것을 은행 업무 97개 과제로 보였습니다. 그리고 9월 개정된 AhaBench와 '에이전트의 첫 출근' 벤치마크는 그 반대편, 즉 손을 놓는 순간 36~53점이 무너지고 답만 보고는 절차를 복원하지 못하는 현실을 보여 줍니다. 인터랙티브 7개와 삽화 13장, 메타 원문 도표 3장으로 '배우는 에이전트'가 어디까지 왔는지 따라가 봅니다.

코어닷투데이2026-09-2956분

조직의 세컨드 브레인 — 뇌 모양의 서류함에서 카드를 꺼내는 로봇과 도장을 찍는 전문가크게 보기

들어가며: 개념에서 코드로

지난 특집 「SaaS가 25년 동안 못 지킨 약속, AI가 지킨다」는 프라이머리 벤처 파트너스의 글을 따라 두 개념을 소개했습니다. 에이전트가 무엇을 결정했고 무슨 일이 일어났고 그게 옳았는지를 기록하는 스코어북, 그리고 그 기록에서 배운 것이 다음 고객으로 넘어가는 계속 배우는 루프(CLL). 그 글은 벤처캐피털의 글이라 개념은 선명했지만 코드가 없었습니다. 스코어북은 실제로 어떤 파일로 되어 있는가? 전문가의 교정 한 줄은 어떤 경로를 거쳐 다음 실행을 바꾸는가? '배운다'는 말은 벤치마크에서 몇 점으로 나타나는가?

이번 특집은 그 질문에 답하는 세 자료를 겹쳐 읽습니다. 셋 다 2026년 하반기에 나왔고, 셋 다 모델의 가중치를 건드리지 않는다 는 공통점이 있습니다.

자료누가, 언제무엇을 보였나이 글에서의 역할
「An Organizational Second Brain」메타 엔지니어링 블로그, 2026-09-02 (Sengar·Nawrocki·Shah·Kommireddi)컴플라이언스 전문가의 지식을 200+ 텍스트 파일로 구조화하고, 전문가 교정을 자동 컴파일해 회귀 0건으로 6주간 개선. 평가 시간 '며칠 → 몇 분', 토큰 80% 절감스코어북의 구현. 빅테크 사내 시스템
「Learning on the Job」 (arXiv:2607.22157)Tablan·Taylor·Bernhem, 2026-07-24τ-bench 은행 도메인 97과제. 가중치 고정 + 외부 메모리로, 결과 판정만 배우면 1.6배, 교정을 배우면 2.6배. 못 풀던 84과제 중 22개 전환. 메모리가 모델 간에 이전됨스코어북의 실증. 재현 가능한 수치
AhaBench (arXiv:2609.05435) · Trainee-Bench (arXiv:2601.08173)텐센트·프린스턴, 2026-09-21 개정 · 상하이 AI 랩 등, 2026-06 개정프런티어 모델들이 힌트를 걷으면 36~53점 하락, 답만 보고는 절차를 못 복원, 1년 운영에서 파산. '첫 출근' 시뮬레이션 최고 성공률 35%스코어북의 한계. 무엇이 아직 안 되나

순서는 이렇습니다. 1부에서 메타가 풀려던 문제를, 2부에서 네 층 구조를, 3부에서 이 설계의 계보(카파시의 LLM 위키 → 구글 OKF → 메타)를 봅니다. 4부는 「Learning on the Job」의 실험을, 5부는 AhaBench와 Trainee-Bench의 반증을 다룹니다. 6부에서 지난 특집의 여섯 층과 대응시키고, 7부에서 한국 조직이 이 설계를 어떻게 빌릴 수 있는지, 8부에서 한계와 반론을 정리합니다.


1부. 문제: 지식은 문서가 아니라 머릿속에 산다

메타의 글은 큰 조직이라면 누구나 아는 장면에서 시작합니다.

큰 조직들은 전문 지식에 관해 같은 문제를 안고 있다. 일부는 모델, 플레이북, 체크리스트, 프레임워크의 형태로 적혀 있지만, 가장 가치 있는 전문 지식은 사람들의 머릿속에 살고 어디에도 오래가는 형태로 잡히지 않는다. 예컨대 컴플라이언스 도메인에서는 같은 유형의 질문이 수백 건의 제품 검토에서 반복되고, 전문가의 평가는 며칠의 수작업 조사가 걸리며, 평가 사이의 불일치가 실제 조직 위험을 만든다.

지식은 문서가 아니라 머릿속에 산다 — 질문 쪽지를 든 줄 앞에 앉은 컴플라이언스 전문가크게 보기

여기서 '컴플라이언스'는 메타의 맥락에서 제품이 개인정보·규제·정책 요건을 지키는지 검토하는 일입니다. 새 기능 하나가 나올 때마다 "이 데이터 흐름은 괜찮은가"를 누군가 판단해야 하고, 그 누군가는 늘 같은 몇 명입니다. 메타는 이 상황의 비용을 두 가지로 짚습니다. 첫째, 전문가가 진짜 어려운 문제보다 반복되는 질문에 더 많은 시간 을 씁니다. 둘째, 같은 질문에 다른 전문가가 다른 답을 하면 조직 전체가 일관성을 잃습니다.

흔한 해법은 '문서를 다 넣고 검색하자'입니다. 메타는 왜 그게 부족한지 정확히 씁니다.

큰 조직은 전문가 업무의 부산물로 수천 개의 문서를 쌓는다. 그 문서를 조직의 지식으로 취급하고 싶어지지만, 진짜 지식은 암묵적이다. 전문가가 어떻게 추론하는지, 무엇을 우선하는지, 모호함을 어떻게 해소하는지. 추론 시점에 문서 조각을 검색하는 에이전트는 매 실행마다 원자료에서 그 추론을 다시 끌어내야 하는데, 이는 느리고, 오류가 잦고, 일관되지 않는다.

이 문장은 지난 특집이 인용한 프라이머리의 진단, "신입에게 부족한 것은 정보가 아니라 경험"의 엔지니어링 버전입니다. 문서는 '조직이 할 수 있는 것'을 말해 주지만, 전문가는 '조직이 과거 입장과 사업 방향에 비추어 해야 하는 것'을 압니다. 메타는 그 차이를 "could와 should의 차이"라고 부릅니다.


2부. 네 층: 지식, 레시피, 평가, 그리고 루프

메타의 시스템은 네 층으로 되어 있고, 각 층이 하나의 문제를 풉니다. 원문의 표를 옮기면 다음과 같습니다.

메타 원문의 4층 표. 지식 시스템(조직 지식이 흩어져 AI가 닿지 못함 → LLM이 읽기 좋은 탐색 가능한 파일 시스템으로 구조화), 추론 파이프라인(전문가 방법론을 단일 프롬프트로 못 담음 → 아는 것과 추론하는 법을 분리하는 레시피), 평가 프레임워크(잴 수 없으면 개선 못 함 → 개선 주기마다 자라는 자동 벤치마크), 자기개선 루프(수동 피드백은 몇 주 걸림 → 지식 유지보수를 컴파일 문제로)크게 보기
메타 원문 그림 1. 네 층이 푸는 문제와 핵심 통찰. 그림: Meta Engineering, 원문에서 인용 목적 전재

각 층을 눌러 보고, 하나씩 빼 보세요. 메타는 "어느 한 층을 빼면 나머지가 무너진다"고 씁니다.

네 층 — 서고, 주방, 시험실, 그리고 교정을 아래로 되돌리는 플라이휠크게 보기

1층. 지식 시스템: 200개 파일, 하나의 의존성 그래프

메타는 원문서를 그대로 검색하지 않고, 오프라인에서 오래 도는 프로세스 가 원문서를 읽고 '조직이 이 도메인을 어떻게 해석하는지'를 구조화된 지식 파일로 증류합니다. 파일은 네 종류입니다.

파일 종류담는 것왜 따로 두나
입장(position) 파일조직이 어떤 도메인 질문을 어떻게 해석하기로 했는가. 제약, 경계 조건, 그리고 추론 층에 '언제 이 입장을 적용하라'고 알리는 기계가 읽는 라우팅 함의'문서에 뭐라고 쓰여 있나'가 아니라 '우리는 어떻게 보기로 했나'가 지식의 단위
용어·분류 파일개체 유형, 활동 범주, 분류 등급 같은 조직의 어휘. 각각 단일 출처에이전트와 조직이 같은 말을 같은 뜻으로 쓰게
라우팅 인덱스입력의 특성 → 관련 입장과 절차의 매핑임베딩 유사도에만 기대지 않아 검색이 결정적이고 감사 가능
관문(gateway) 파일분석 도메인에 들어가기 전에 통과해야 하는 임계 검사전문 지식을 엉뚱한 곳에 적용하는 것을 막음

모든 파일은 YAML 머리말에 depends_on과 referenced_by를 선언합니다. 그래서 파일 하나가 바뀌면 무엇이 영향을 받는지 추적할 수 있습니다. 이것이 사소해 보이지만 4층(자동 편집)을 가능하게 하는 조건입니다.

메타 원문의 지식 시스템 그림. 왼쪽은 파일 시스템처럼 탐색 가능한 디렉터리 구조, 오른쪽은 각 파일의 YAML 머리말이 적용 시나리오와 의존성·소비자를 선언해 양방향 의존성 그래프를 이루는 모습크게 보기
메타 원문 그림 2. 탐색 가능한 파일 시스템(왼쪽)과 각 파일의 YAML 머리말(오른쪽). 그림: Meta Engineering, 원문에서 인용 목적 전재

가상의 '개인정보 검토' 도메인으로 흉내 낸 파일을 열어 보고, 머리말의 링크를 따라 그래프를 걸어 보세요.

위키와 RAG를 어떻게 가르나

메타의 설계에서 실무적으로 가장 쓸모 있는 대목은 '무엇을 위키에 넣고 무엇을 검색에 남기나'의 기준입니다. 기준은 정보 밀도와 사용 빈도 입니다.

위키와 RAG — 책상 위의 두꺼운 바인더 몇 권과 서치라이트가 훑는 창고크게 보기

  • 밀도 높고 자주 참조되는 것은 위키로. 입장, 결정 프레임워크, 경계 사례, 전략적 해석. 에이전트가 거의 매 턴 참조하고, 조직의 생각이 바뀌면 함께 바뀌어야 하므로 갱신·버전 관리·검증이 쉬운 위키 구조가 맞습니다.
  • 희소하고 상황에 따라 필요한 것은 RAG로. 상세 참고 자료, 개별 제품 사양, 과거 결정 기록, 틈새 외부 지식. 적용될 때는 깊이 중요하지만 대부분의 실행에서는 필요 없습니다. 전부 위키에 넣으면 시스템이 비대해지고 주의력이 흩어집니다.

이 블로그의 RAG 특집 시리즈, 특히 「검색이 에이전트가 된다」에서 카파시의 LLM 위키 패턴을 다뤘는데, 메타는 그 패턴을 "인용 충실도와 조직적 일관성이 타협 불가인" 환경으로 확장했다고 스스로 위치를 밝힙니다.

2층. 레시피: 아는 것과 추론하는 법을 분리한다

지식만으로는 부족합니다. 전문가는 사실을 떠올리는 게 아니라 방법론을 따릅니다. 재무 분석가는 밸류에이션 모델을 단계별로 밟고, 보안 엔지니어는 위협 모델링 절차를 따릅니다. 메타는 이 방법론을 '레시피'라는 조합 가능한 절차로 담습니다.

레시피는 절차, 지식은 재료 — 헤드 셰프의 마스터 레시피와 소스·단백질·가니시를 맡은 보조 요리사들크게 보기

지식 파일이 선언형이라면 레시피는 명령형이다. 각 레시피는 다단계 분석 워크플로를 규정한다. 무엇을 먼저 볼지, 각 단계에서 어떤 지식을 불러올지, 어떤 결정 절차를 따를지, 무엇이 완전한 분석인지.

핵심 설계 결정은 분리 입니다. 레시피는 지식 파일을 참조하지만 도메인 사실을 담지 않고, 지식 파일은 입장을 말하지만 절차를 규정하지 않습니다. 그래서 다음이 성립합니다.

입장을 추가할 때
지식 파일 하나를 더하고 라우팅 인덱스를 갱신한다. 레시피는 안 바뀐다.
방법론의 결함을 고칠 때
레시피 하나를 고친다. 지식 파일은 안 바뀐다.
실패했을 때
한 층으로 깨끗하게 귀속된다. 지식이 틀렸나, 절차가 틀렸나? 이 질문이 4층 진단의 뼈대가 된다.

레시피는 파이프라인으로 조합됩니다. 메타의 비유가 좋습니다. 헤드 셰프의 마스터 레시피는 소스·단백질·가니시의 하위 레시피에 위임할 뿐 그 세부를 담지 않습니다. 최상위 라우팅 레시피가 입력을 보고 어떤 하위 레시피를 부를지 고르고, 각 하위 레시피는 하나의 분석 단계를 맡습니다.

이 구조의 부수 효과가 점진적 공개 입니다. 초기 버전은 하나의 평평한 지시 파일에 시맨틱 검색으로 모든 소스를 실어 매 실행마다 관련성이 뒤섞인 대량의 파일을 컨텍스트에 넣었습니다. 레시피 단계별로 재구성하자 각 질의가 작은 부분집합만 건드리게 됐고, 턴당 토큰이 약 80% 줄었습니다. 이 블로그의 「컨텍스트 엔지니어링 완전 정복」이 말한 '컨텍스트는 유한하고 주의력은 양에 따라 떨어진다'의 실무 증거입니다.

사람은 어디에 있나: 체크포인트와 에스컬레이션

체크포인트와 에스컬레이션 — 톨게이트마다 깃발을 드는 전문가, 갈림길에서 질문 카드를 올리는 로봇크게 보기

메타는 사람이 판단의 권위를 유지한다는 점을 두 장치로 강제합니다. 체크포인트 는 분석의 정해진 지점에서 에이전트가 중간 추론을 전문가에게 내보이는 곳입니다. 전문가는 확인하거나, 고치거나, 방향을 바꿉니다. 에스컬레이션 은 에이전트가 진짜 모호함(입력이 불충분하거나, 증거가 둘 이상의 방어 가능한 해석을 지지할 때)을 만나면 억지로 결론 내지 않고 질문을 전문가에게 넘기는 것입니다.

이 두 장치가 세 가지를 동시에 합니다. 품질과 방향의 통제, 자기개선 루프의 훈련 신호, 그리고 신뢰의 보정. 전문가는 최종 출력만이 아니라 추론을 보면서, 그리고 에이전트가 불확실성을 감추지 않고 드러내는 것을 보면서 점진적으로 신뢰를 쌓습니다. 지난 특집이 인용한 프라이머리의 '전문가 채점' 층이 실제로는 이렇게 생겼습니다. 별도의 채점 화면이 아니라, 일하는 도중의 교정 이 곧 채점입니다.

3층과 4층. 지식 유지보수는 컴파일 문제다

메타가 "이 시스템에서 가장 독특한 부분"이라고 부르는 것이 자기개선 플라이휠입니다. 문제 설정이 정확합니다.

구조화된 지식 시스템과 조합 가능한 레시피는 사람과 에이전트가 읽을 수 있고, 테스트할 수 있고, 모듈화된 시스템을 만든다. 그러나 상호의존하는 파일의 수 때문에 수동 유지보수는 확장될 수 없다. 전문가가 에이전트에 피드백을 주면 그것을 정확한 파일 편집으로 번역해야 한다. 이 과정은 몇 주가 걸릴 수 있다. 전체 의존성 그래프를 이해하고, 다른 것이 깨지지 않는지 확인하고, 수정이 실제로 통하는지 검증해야 하기 때문이다.

메타는 이 유지보수를 컴파일 문제 로 다루고 자동화합니다. 모든 전문가 교정이 네 단계를 거칩니다.

메타 원문의 자기개선 루프 그림. 전문가 교정이 근본 원인으로 진단되고, 최소한의 검증된 편집으로 컴파일되며, 리플레이와 회귀 테스트로 평가된 뒤 검토·착지된다. 각 수정은 회귀 스위트에 되돌아가 이득이 영구화된다크게 보기
메타 원문 그림 3. 자기개선 루프. 그림: Meta Engineering, 원문에서 인용 목적 전재

진단. 원시 피드백은 전문가가 에이전트와 대화하며 교정한 기록입니다. 메타의 첫 접근은 대화의 형태로 분류하는 것이었습니다. 전문가가 정보를 주면 지식 격차, 방향을 바꾸면 절차 문제. 이 휴리스틱은 실패했습니다. 대화의 형태는 근본 원인의 나쁜 대리 변수였기 때문입니다. 결론을 고치는 교정 하나가 지식 격차일 수도, 레시피 결함일 수도, 진짜 모호함일 수도 있습니다. 통한 방법은 추출과 분류를 분리 하는 것이었습니다. 먼저 전문가의 모든 실질적 신호를 에이전트의 지식 매니페스트(어떤 파일을 언제 어떻게 썼는지)와 나란히 뽑고, 그다음 실제 지식 파일을 읽고 단 하나의 귀속 테스트를 적용합니다.

에이전트가 자기 소스 자료에서 올바른 결론에 닿을 수 있었는가? 자료에 정답이 있었는데도 틀렸다면 → 레시피 문제. 자료에 정답이 없었다면 → 지식 격차. 전문가들끼리 정답이 다르다면 → 모호함, 사람의 토론으로.

이 테스트를 직접 해 보세요.

컴파일. 진단된 이슈를 최소한의 파일 편집으로 번역합니다. 서브에이전트들이 병렬로 교차 참조, 기존 입장과의 충돌, 토큰 예산, 테스트 커버리지, 중복 위험을 분석합니다. 신뢰를 만드는 설계 선택이 둘 있습니다.

맥락을 모르는 심사관 — 눈가리개를 한 로봇 심판 앞에는 짧은 diff 한 장뿐, 문 뒤의 로봇들은 두꺼운 맥락 바인더를 들고 있다크게 보기

  • 독립적 적대적 검토. 개선 이유를 전혀 모르는 별도의 에이전트가 새 컨텍스트에서 실행되며, 지식 베이스에 제안된 diff만 받습니다. 그 임무는 문제를 찾는 것입니다. 새로 생긴 모순, 깨진 엣지 케이스, 약화된 입장. 제안한 에이전트들과 맥락을 공유하지 않으므로 그들의 맹점을 물려받을 수 없습니다.
  • 결정적 구조 검증. 린터가 끊긴 교차 참조, 파일 크기 예산 위반, 식별자 충돌, 의존성 순환을 프로그램으로 잡습니다. 이 층은 확률적이지 않습니다. 통과 아니면 실패입니다.

검증. 두 단계입니다. 표적 리플레이 는 피드백을 촉발한 원래 시나리오를 에이전트에게 다시 돌립니다. 에이전트는 자기가 시험받는지 모릅니다. 별도의 심판이 새 출력을 원래 전문가 피드백과 대조하는데, 심판은 무엇이 바뀌었는지 모릅니다. 이 의도적인 눈가림이 확증 편향을 막습니다. 회귀 테스트 는 도메인별 벤치마크(대개 Q&A 쌍의 테스트 스위트)를 병렬 세션으로 돌려 후퇴를 잡습니다. 회귀가 나면 어디서 후퇴했는지, 원래 이슈와 시도한 수정을 담은 프롬프트로 컴파일을 다시 합니다.

착지와 보강. 산출물은 완전한 감사 기록이 붙은 풀 리퀘스트입니다. 전문가는 원시 실패를 디버깅하는 대신 증명된 수정 을 검토합니다. 승인되어 착지하면, 원래 실패 시나리오와 검증된 정답이 회귀 테스트 스위트에 자동으로 추가됩니다. 그래서 모든 수정이 기준선을 영구히 올립니다.

교정 하나가 영구 개선이 되기까지 — 돋보기, 렌치, 녹색 등, 서명, 그리고 쌓여 가는 회귀 테스트 더미크게 보기

한 건의 교정이 루프를 도는 모습을 시뮬레이션해 보세요.

결과

6주에 걸친 개발 스프린트 3회 뒤 메타가 보고한 결과입니다.

①
전문가 평가: "거의 항상 유용"
초기 버전은 출력에 상당한 재작업이 자주 필요했다. 6주 뒤 도메인 전문가들은 출력이 거의 항상 유용하다고 평가했고, 에이전트가 분석 작업의 대부분을 처리해 자신들은 사람의 판단이 진짜 필요한 모호한 사례에 집중할 수 있다고 보고했다.
②
평가 시간: 며칠 → 몇 분
개별 평가에 걸리던 시간이 며칠에서 몇 분으로. 자동 자기개선이 이전에는 엔지니어링 스프린트 하나가 통째로 필요하던 속도로 검증된 지식 편집을 생산했다.
③
회귀 0건
개선 주기 전체에서 회귀가 한 건도 없었고, 모든 수정이 회귀 스위트를 자동으로 강화했다. 토큰은 레시피 구조 도입으로 턴당 약 80% 감소.

이 수치는 메타의 자기 보고이고, 비교 대상(같은 기간 사람만의 처리량)이 공개되지 않았다는 점은 8부에서 다시 짚습니다. 다만 '회귀 0건'은 자랑이 아니라 설계의 결과입니다. 회귀가 나면 착지하지 못하도록 루프를 짰기 때문입니다.


3부. 계보: 카파시의 위키에서 구글의 OKF, 그리고 메타까지

메타는 자기 설계가 새롭지 않다고 솔직하게 씁니다. "업계는 비슷한 생각으로 수렴했다." 그 계보를 정리하면 이 설계가 어디서 왔는지 보입니다.

시점누가무엇을메타가 더한 것
2025. 5안드레이 카파시, '시스템 프롬프트 학습'사전학습은 지식, 파인튜닝은 습관. 문제를 풀고 메모를 남겨 다음에 쓰는 세 번째 패러다임이 빠져 있다인용 충실도와 조직적 일관성이 타협 불가인 환경. 결정적 라우팅, 관문, 의존성 그래프, 그리고 자동 컴파일 + 검증
2025~26카파시, 'LLM 위키'에이전트 지식을 탐색 가능한 파일 그래프로 구조화. 미리 추출하고, 명시적으로 구조화하고, 점진적으로 공개하라
2026. 6. 12구글 클라우드, Open Knowledge Format(OKF) v0.1LLM 위키 패턴을 이식 가능한 열린 규격으로. 데이터셋·지표·API·표를 사람과 에이전트가 함께 읽는 마크다운 파일로 표현. 필수 필드는 type 하나뿐
2026. 9. 2메타, 조직의 세컨드 브레인위 원칙을 200+ 파일의 엄격한 분류 체계와 4단계 자기개선 루프로 구현—

세 흐름의 공통 통찰은 하나입니다. 지식은 매 질의마다 다시 끌어내는 것이 아니라, 미리 추출해 명시적으로 구조화하고, 필요한 만큼만 드러내야 한다. 이 블로그의 「에이전트를 만들지 말고 스킬을 만들라」가 다룬 앤트로픽의 Agent Skills(SKILL.md 파일과 점진적 공개)도 같은 원칙의 다른 구현입니다. 2026년 하반기의 에이전트 설계는 '더 큰 컨텍스트'가 아니라 '더 잘 정리된 파일'로 가고 있습니다.

메타의 마지막 문단이 이 원칙을 한 줄로 요약합니다.

더 깊은 원칙은 단순하다. 복잡성을 파인튜닝된 모델 가중치가 아니라, 사람과 에이전트가 둘 다 읽을 수 있는 텍스트 파일에 두라. 모든 개선은 도메인 전문가가 30초면 검토할 수 있는 텍스트 편집이다. 모든 변경은 버전 관리되고, diff를 볼 수 있고, 되돌릴 수 있다.


4부. 실증: '맞았다/틀렸다' 한 비트로도 배운다

메타의 글은 사내 시스템이라 남이 재현할 수 없습니다. 같은 생각을 공개 벤치마크에서 수치로 보인 것이 2026년 7월 24일의 논문 「Learning on the Job: Continual Learning from Deployment Feedback for Frozen-Weights Agents」 입니다. 저자들은 Spark라는 에이전트용 공유 메모리 시스템을 만든 팀이고, 이전에 코딩 도메인에서 잰 것을 이번에는 코드가 전혀 없는 지식 집약 도메인으로 확장했습니다.

은행 창구의 에이전트 — WHEN→THEN 규칙 카드가 적힌 공책과 700권의 정책 바인더크게 보기

설정: 규정을 숨긴 은행

실험대는 τ-bench의 은행 도메인 입니다. 각 과제는 에이전트와 (별도 LLM이 연기하는) 고객의 다중 턴 대화이고, 에이전트는 데이터베이스를 읽고 쓰는 도구를 가지며, 최종 DB 상태가 사전 계산된 정답과 일치하면 성공입니다. 97개 과제 중 하나를 빼고는 LLM 심판 없이 결정적으로 채점됩니다.

이 도메인이 어려운 이유는 규정을 미리 주지 않기 때문 입니다. 에이전트는 업무 규칙도 도구 목록도 모른 채, 약 700개의 서로 얽힌 정책 문서를 검색 도구(BM25)로 뒤져야 합니다. 공개된 프런티어 모델의 단일 시도 성공률은 약 25%이고, 과제에 결정적인 문서를 시스템 프롬프트에 직접 넣어 주는 '골드' 설정에서도 최고 모델이 약 40%입니다. 논문의 표현으로 "모델이 이미 갖고 있지 않은 지식이 결정적인 영역", 즉 대부분의 실제 기업 배치가 놓인 조건입니다.

논문은 벤치마크를 딱 하나 바꿉니다. 메모리 저장소가 비어 있는 채로 시작해 한 과제의 네 번 시도에 걸쳐 살아 있게 합니다. 표준 평가는 상태가 없어서 시도 사이의 학습이 구조적으로 불가능하기 때문입니다. 기준선은 이미 정책 코퍼스 전체를 검색하는 정적 RAG이므로, 측정된 모든 이득은 정적 RAG 위에 메모리가 보탠 몫입니다.

세 조건, 두 모델

조건에피소드 뒤에 받는 것메모리에 쓰는 것
메모리 없음없음없음. 매 시도가 처음과 같다
경험(experience)'맞았다/틀렸다' 1비트. 검증된 해법은 시스템 어디에도 전달되지 않음반성 턴이 대화와 판정만 보고 규칙 하나를 씀
교정(instruction)실패한 뒤에만, 검증된 행동 순서와 '검증 vs 실행' diff반성 턴이 결정적 분기를 diff로 찾아 규칙 하나를 씀

모델은 둘입니다. 데이터 주권 요건이 있는 조직이 자체 호스팅할 수 있는 오픈 웨이트 모델 Mistral Large(2512), 그리고 프런티어 모델 Claude Sonnet 5(중간 추론 노력). 고객 시뮬레이터는 공개 리더보드와 같은 GPT-5.2입니다.

메모리 쓰기의 규약이 메타의 설계와 놀랍도록 닮았습니다. 모든 쓰기는 에피소드가 끝난 뒤 전용 반성 턴 에서만 일어나고, 대화 도중의 쓰기 시도는 접수만 되고 커밋되지 않습니다. 자신만만한 실수가 저장소를 오염시키는 것을 막기 위해서입니다. 규칙은 에피소드당 하나, WHEN–THEN 형식, 결정 핵심 값은 원문 그대로여야 하며 쓰기 시점 검증기가 확인합니다. 검증된 규칙은 절대 반박되거나 약화되지 않고, 거의 같은 상황에 다른 검증 행동이 있을 때만 통제된 병합 한 번이 허용됩니다.

결과

숫자를 풀어 보겠습니다. Mistral Large의 기준선은 단일 시도 성공률 0.064, 즉 97과제 중 13개만 한 번이라도 풀었습니다. 1비트 판정만으로 배우면 0.103(1.6배), 교정을 배우면 0.170(2.6배)입니다. 더 중요한 것은 못 풀던 과제 입니다. 기준선이 한 번도 못 푼 84과제 중 교정 조건은 22개를 풀게 됐고, 그중 10개는 다른 어떤 구성도 못 푼 과제였습니다. 과제별 결과 그리드에서 이 전환의 서명이 보입니다. 첫 시도 실패, 그다음 세 번 성공. 검증된 규칙이 첫 실패에 기록되고 이후 시도에서 검색되어 적용된 것입니다.

Claude Sonnet 5에서도 재현됩니다. 기준선 0.248(리더보드의 '약 25%'와 일치)이 교정으로 0.397이 됐고, 절대 증가폭(+0.149)은 Mistral(+0.106)보다 큽니다. 논문은 이것으로 "외부 메모리는 약한 모델의 부족함을 메울 뿐"이라는 의심에 답합니다. 기준선이 네 배 높은 모델에서 이득이 살아남고, 오히려 자랍니다.

약한 모델의 메모가 강한 모델을 돕는다

약한 모델의 메모가 강한 모델을 돕는다 — 크고 튼튼한 주황 로봇과 작고 날렵한 파란 로봇이 공책을 교환한다크게 보기

두 번째 실험이 이 글에서 가장 흥미로운 대목입니다. 각 모델이 교정 조건으로 쌓은 메모리 저장소를 얼어붙인 채 다른 모델에게 읽기 전용으로 붙였습니다. Sonnet이 쌓은 저장소를 읽은 Mistral은 0.064에서 0.289로 올랐습니다. 자기가 직접 쌓은 것(0.170)보다 낫습니다. 반대 방향도 성립합니다. 네 배 약한 Mistral이 쓴 규칙을 읽은 Sonnet은 0.248에서 0.314로 올랐습니다. 두 모델은 서로 다른 과제를 풀기 때문에 각 저장소에는 상대가 모르는 지식이 있습니다.

논문의 결론 문장이 지난 특집의 CLL과 정확히 겹칩니다.

축적된 저장소는 다른 모델이 읽어도 가치를 유지했다. 이것이 한 에이전트의 경험을 조직이 어떤 에이전트에게든 건넬 수 있는 지식으로 바꾼다.

프라이머리의 글이 "한 고객에서 배운 예외가 다음 고객의 기본값이 된다"고 했다면, 이 논문은 "한 모델이 배운 규칙이 다음 모델의 기본값이 된다"를 보였습니다. 모델이 바뀌어도 메모리는 남습니다. 지난 특집의 반론 3, "모델이 좋아지면 하니스의 절반은 녹는다"에 대한 부분적 답이기도 합니다. 녹지 않는 절반이 바로 이런 규칙 저장소입니다.

지표의 함정 하나

논문이 정직하게 짚는 대목이 있습니다. τ-bench의 공식 지표 pass^k는 'k번 시도 전부 성공'입니다. pass^4에서는 Mistral의 세 조건이 0.031로 똑같습니다. 이것은 학습이 없다는 뜻이 아니라 지표의 구조입니다. 첫 시도 실패 후 세 번 성공한 과제(0111)는 pass^1에서 0.75, pass^4에서 정확히 0으로 계산되므로, 배우는 에이전트의 이점은 k가 커질수록 줄다가 k=4에서 사라집니다. 그래서 논문은 지식이 저장된 뒤의 일관성을 유지율(hold rate), 즉 t에 성공한 과제가 t+1에도 성공할 확률로 따로 잽니다. 경험 조건 0.88, 교정 조건 0.65(Mistral), 0.83(Sonnet). 위젯의 pass^4 탭에서 확인해 보세요.


5부. 반증: 손을 놓으면 절반이 무너진다

여기까지 읽으면 '배우는 에이전트'가 다 된 것처럼 들립니다. 같은 달에 나온 두 벤치마크가 그 반대편을 보여 줍니다.

AhaBench: 힌트를 걷었을 때

손을 놓으면 절반이 무너진다 — 자전거 안장을 잡아 주면 잘 타다가 손을 떼면 휘청이는 로봇크게 보기

텐센트와 프린스턴 연구진의 AhaBench(2026년 6월 제출, 9월 21일 개정)는 이름 그대로 '아하'를 잽니다. 논문의 정의로 아하는 "경험을 나중의 능력에 잇는 재사용 가능한 관계"입니다. 세 패널로 구성됩니다.

  • 퍼즐. 숨은 이야기를 질문으로 알아내는 '스무고개'형 과제. 앞서 풀린 에피소드들이 컨텍스트에 남은 채로, 힌트(흔적)를 점점 줄여 마지막에는 완전히 걷습니다. 학습 기회는 '풀린 에피소드가 보여 준 질문 전략'입니다.
  • 오일러. 프로젝트 오일러식 계산 문제를 한 입력으로 가르치고 다른 입력으로 시험합니다. '전체 교육'은 답·설명·코드를, '부분 교육'은 문제와 답만 줍니다.
  • 자판기. 시뮬레이션 자판기 사업을 1년 운영합니다. 환불, 피싱, 기계 고장, 납품 지연 같은 사건이 섞이고, 결정의 결과는 며칠 뒤에야 돌아옵니다.

결과의 패턴은 일관됩니다. 명시적 안내를 쓰는 것은 잘하지만, 그 너머로 일반화하거나 유용한 행동을 지속하는 것은 못 합니다. 퍼즐에서 모든 모델이 힌트가 있을 때는 39~57점 앞서다가 힌트를 걷으면 −3.8~+12.6점으로 떨어졌습니다(철수 격차 36.0~53.5점). 오일러에서 절차까지 가르치면 80~100%가 옮겨가지만 답만 주면 0~73.9%입니다. Qwen 3.6 Plus는 97.3% 대 8.1%였습니다. 자판기에서는 네 모델이 파산선 근처에서 끝났고, 이익이 난 모델도 '완주'와 '이익'이 갈렸습니다.

이 결과를 4부와 나란히 놓으면 그림이 맞춰집니다. 「Learning on the Job」에서 교정(절차 제공)이 경험(1비트)보다 1.6배 나았던 것과, AhaBench에서 절차 교육이 답만 교육보다 압도적으로 나은 것은 같은 현상 입니다. 지금의 에이전트는 '어떻게 했는지'를 보면 옮길 수 있지만, '답이 뭐였는지'만 보고 방법을 복원하지는 못합니다. 지난 특집의 스코어북 용어로는, ④ 결정 흔적이 있어야 학습이 옮겨가고 ⑥ 결과만으로는 부족하다는 뜻입니다.

1년 자판기 운영 — 동전이 쌓이던 기계가 몇 달 뒤 '매진' 팻말과 빨간 장부만 남긴다크게 보기

Trainee-Bench: 에이전트의 첫 출근

상하이 AI 연구소 등의 「The Agent's First Day」(2026년 1월 제출, 6월 개정)는 지난 특집의 '신입 첫 출근' 비유를 벤치마크로 만든 것 같은 논문입니다. '훈련생' 에이전트가 낯선 직장 환경을 계속 탐색하는 동적 시뮬레이션에서 세 능력을 잽니다. 우선순위가 다른 과제가 흘러들어올 때의 맥락 인식 스케줄링, 환각을 줄이기 위한 신중한 정보 획득(능동 탐색), 규칙 기반으로 동적 생성되는 과제에서 일반화된 전략을 증류하는 계속 학습.

결과는 냉정합니다. 50개 동적 시나리오에서 최고 모델(Gemini 3 Flash)의 성공률이 35% 였고, 저자들은 "특히 능동 탐색과 계속 학습에서 상당한 결함"을 보고합니다. 과제가 2개에서 6개로 늘면 Gemini 3 Flash의 성공률은 50%에서 36%로 떨어졌습니다. 어려운 과제에서는 Claude 4 Sonnet이 37%에서 8%로, GPT-4o가 26%에서 3%로 무너졌습니다.

두 벤치마크의 공통 결론을 한 문장으로 쓰면 이렇습니다. 가중치를 고정한 오늘의 모델은 '기록된 절차'를 재사용하는 데는 능하지만, 기록되지 않은 것을 스스로 알아내 기록으로 만드는 데는 아직 서툽니다. 메타와 「Learning on the Job」이 통한 이유가 여기 있습니다. 둘 다 에이전트에게 '스스로 깨달으라'고 하지 않았습니다. 사람(전문가, 또는 검증된 정답)이 절차를 교정해 주고, 시스템은 그것을 정확히 기록하고 정확히 재사용 하는 데 집중했습니다.


6부. 스코어북 여섯 층, 코드에서는 어디에 있나

지난 특집의 스코어북 여섯 층을 두 시스템에 대응시켜 보면, 다섯 층은 이미 코드로 존재하고 한 층이 비어 있습니다.

비어 있는 층은 ⑥ 비즈니스 결과 입니다. 메타의 루프에서 '성공'은 전문가가 옳다고 한 것까지이고, 「Learning on the Job」에서 '성공'은 최종 DB 상태가 사전 정답과 같은 것입니다. 그 판정이 나중에 사업적으로 옳았는지, 즉 고객이 남았는지, 규제 제재를 피했는지, 손실이 줄었는지는 어느 루프에도 들어오지 않습니다. 프라이머리의 글에 달린 댓글, "루프는 나쁜 성공 정의도 복리로 쌓는다"는 경고가 정확히 이 빈칸에서 나옵니다. 메타의 시스템은 전문가의 편향을 회귀 테스트로 영구화 합니다. 그것이 설계의 장점이자, 전문가가 틀렸을 때의 위험입니다.

두 시스템에서 뽑아낼 수 있는 설계 원칙을 정리하면 이렇습니다.

원칙메타에서「Learning on the Job」에서왜 중요한가
가중치가 아니라 텍스트에모든 개선이 30초에 검토되는 텍스트 편집. 버전 관리, diff, 되돌리기자연어 WHEN–THEN 규칙. 모델이 바뀌어도 저장소는 남고 다른 모델에 이전됨감사 가능성과 이식성. 모델 교체가 학습을 지우지 않는다
쓰기는 사후에, 검증하고교정 → 진단 → 컴파일 → 리플레이·회귀 → 승인 뒤에만 착지반성 턴에서만 쓰기, 대화 중 쓰기는 커밋 안 함, 결정적 값은 검증기가 확인자신만만한 실수가 지식 베이스를 오염시키는 것을 막는다
원인을 한 층으로 귀속지식이 틀렸나, 절차가 틀렸나, 사람들이 다른가'검증 vs 실행' diff로 결정적 분기를 찾음고칠 곳을 정확히 하나로 좁힌다. 추측으로 고치면 회귀가 난다
맥락 없는 심사관diff만 보는 적대적 검토, 무엇이 바뀌었는지 모르는 리플레이 심판(해당 없음, 벤치마크 채점기가 결정적)제안자의 맹점을 물려받지 않는다
절차를 기록하라, 답이 아니라레시피(명령형)를 지식(선언형)과 분리해 따로 고침교정(절차)이 경험(1비트)보다 1.6배. AhaBench도 같은 방향지금의 모델은 절차는 옮기지만 답에서 절차를 복원하지 못한다
성공 정의를 밖에서 검증하라두 시스템 모두 없음전문가의 편향이 회귀 테스트로 굳는 것을 막는 유일한 길

7부. 한국 조직이 이 설계를 빌린다면

메타의 시스템은 메타의 규모에서 만들어졌지만, 원문이 밝힌 적용 조건은 규모와 무관합니다. 전문 지식이 전문가 머릿속의 부족 지식으로 살아 있고, 평가 사이의 일관성이 중요하고, 일의 양이 전문가의 용량을 넘고, 범용 LLM의 분석이 부족한 곳. 한국의 조직에서 이 네 조건을 다 만족하는 업무는 널려 있습니다.

어디에 맞나

  • 규제·컴플라이언스 검토. 개인정보 영향평가, 금융 광고 심의, 의료기기 인허가 문서 검토. 규정은 공개돼 있지만 '우리 회사는 이 조항을 어떻게 해석하기로 했나'는 담당자 몇 명의 머릿속에 있습니다. 메타의 '입장 파일'이 정확히 이 지식을 담는 그릇입니다.
  • 공공기관의 민원·질의 응답. 같은 질문이 수백 번 반복되고, 부서마다 답이 조금씩 다릅니다. '용어·분류 파일'과 '라우팅 인덱스'가 일관성을 만듭니다.
  • 의정 자료 조사. 코어닷투데이가 광역의회에 구축한 의정 지원 AI는 회의록·조례·질의를 GraphRAG로 엮는데, 메타의 분할 기준을 빌리면 '이 의회가 어떤 조례를 어떻게 해석해 왔는가'는 위키(입장 파일)에, 개별 회의록 전문은 RAG에 두는 것이 맞습니다. 지금까지는 후자에 무게가 실려 있었습니다.
  • 제조 품질 판정, 보험 손해사정, 병원 청구 심사. 지난 특집이 '방어 가능 구역'으로 꼽은 업무들. 결과가 객관적이고, 담당자의 예외 판단이 잦습니다.

어떻게 시작하나

메타의 네 층을 한꺼번에 만들 필요는 없습니다. 원문이 밝힌 도입 요건을 작은 조직의 순서로 바꾸면 이렇습니다.

1. 입장 파일 20개부터
전문가에게 "지난달 가장 많이 받은 질문 20개"를 뽑게 하고, 각 질문에 대한 우리 조직의 해석을 한 파일에 한 입장씩 적는다. 규정 원문이 아니라 해석을. 경계 조건("단, ~인 경우는 예외")을 반드시 붙인다.
2. 용어집을 단일 출처로
입장 파일에 등장하는 용어를 한 파일로 모으고, 다른 파일이 재정의하지 못하게 한다. 메타의 '분류 파일'. 부서마다 다른 말을 쓰는 것이 불일치의 절반이다.
3. 레시피 하나를 쓴다
전문가가 실제로 검토하는 순서를 5~7단계로 적는다. 각 단계에 "이때 어떤 입장 파일을 본다"를 붙인다. 이 파일에 도메인 사실을 하나도 넣지 않는 것이 규칙이다.
4. 실패 20건으로 회귀 스위트를
앤트로픽의 평가 가이드도 같은 조언을 한다. 완벽한 데이터셋을 기다리지 말고 실제 실패 20~50건으로 시작하라. 각 건에 '전문가 둘이 독립적으로 같은 판정을 내릴 수 있는' 정답을 붙인다.
5. 교정을 PR로 받는다
자동 컴파일러가 없어도 된다. 전문가의 교정을 사람이 파일 편집으로 옮기되, 반드시 (a) 원인을 지식/절차/모호함 중 하나로 귀속하고 (b) 회귀 스위트를 돌리고 (c) 그 실패 사례를 스위트에 추가한다. 이 세 습관이 메타 루프의 뼈대이고, 자동화는 그 뒤의 일이다.

「Learning on the Job」의 교훈도 하나 보태겠습니다. 데이터 주권 때문에 자체 호스팅 모델을 써야 하는 조직이라면, 이 논문의 Mistral Large 결과가 위안이 됩니다. 기준선 6.4%의 약한 모델도 규칙 메모리를 붙이면 17%, 강한 모델이 쌓은 메모리를 빌리면 28.9%가 됐습니다. 모델을 못 바꿔도 메모리는 바꿀 수 있습니다.

신입 에이전트의 교정 — 빨간 표시, 서류함의 카드 한 장 수정, 눈가리개 심판의 승인, 그리고 커피를 마시는 전문가크게 보기


8부. 한계와 반론

1. 메타의 수치는 대조군이 없는 자기 보고다

'며칠 → 몇 분', '회귀 0건', '거의 항상 유용'은 모두 메타 내부 평가이고, 같은 기간 사람만의 처리량이나 오류율과의 비교는 공개되지 않았습니다. '회귀 0건'은 앞서 말했듯 회귀가 나면 착지하지 못하는 설계의 결과이므로, 그 자체가 품질의 증거는 아닙니다. 회귀 스위트가 잡지 못하는 종류의 후퇴(예: 스위트에 없는 새 유형의 질문에서 나빠지는 것)는 정의상 0건에 잡히지 않습니다.

2. 전문가의 편향이 영구화된다

6부에서 짚은 빈칸입니다. 메타의 루프는 전문가의 교정을 검증된 사실로 승격시키고 회귀 테스트로 굳힙니다. 전문가가 옳으면 조직의 판단이 축적되고, 전문가가 틀리면 조직의 오류가 축적됩니다. 메타는 '전문가들끼리 다른' 경우를 모호함으로 빼두지만, '전문가들이 모두 같은 방향으로 틀린' 경우는 잡을 장치가 없습니다. 「Learning on the Job」도 검증된 규칙은 "절대 반박되거나 약화되지 않는다"는 규약을 두는데, 이는 오염을 막는 동시에 잘못 검증된 규칙을 영원히 남깁니다. 지난 특집이 소개한 8월의 「가역적 망각」 논문(arXiv:2608.18177)이 활성·휴면·은퇴 3상태 메모리를 제안한 이유가 이것입니다.

3. 벤치마크는 한 도메인, 한 번 실행

「Learning on the Job」의 저자들이 스스로 밝힌 한계입니다. 모든 조건이 단일 실행이라 보고된 구간은 과제 표본의 불확실성만 반영하고 실행 간 변동은 반영하지 않습니다. 경험 조건은 Mistral에서만 돌렸습니다. 증거는 두 모델, 한 도메인이며, 전이는 교정으로 만든 저장소에서만 쟀습니다. 또 τ-bench의 과제들은 대체로 각자 하나의 결정적 규칙에 달린 독립 시나리오라, 과제 사이에 교훈이 옮겨가는 실제 배치의 분산은 반복 실행이 있어야 추정할 수 있습니다.

4. '배운다'와 '깨닫는다'는 다르다

5부의 두 벤치마크가 보였듯, 두 시스템의 성공은 사람이 절차를 명시적으로 교정해 줄 때 의 성공입니다. AhaBench의 정의로 '아하'(경험에서 스스로 통찰을 뽑는 것)는 프런티어 모델에서도 아직 약합니다. 메타와 「Learning on the Job」은 그 약점을 우회한 것이지 해결한 것이 아닙니다. 메타 시스템에서 지식 파일을 처음 만드는 '오프라인 증류' 과정에 사람의 손이 얼마나 들어갔는지는 원문에 없습니다.

5. 비용과 적대적 검토의 실효성

진단·컴파일(병렬 서브에이전트)·적대적 검토·리플레이·회귀(병렬 세션)를 교정 한 건마다 돌리면 토큰 비용은 작지 않습니다. 메타는 턴당 토큰 80% 절감은 보고했지만 루프 한 바퀴의 비용은 보고하지 않았습니다. 또 '맥락 없는 심사관'이 제안자의 맹점을 물려받지 않는다는 주장은 설계 의도이지 측정 결과가 아닙니다. 같은 기반 모델을 쓰는 두 에이전트는 컨텍스트를 나누지 않아도 같은 사전 지식과 같은 편향을 공유합니다.

6. 규제 산업의 문제: 누가 책임지나

한국의 금융·의료·공공에서 이 시스템을 쓰면, 컴플라이언스 판정의 근거가 '입장 파일 pos-xxx.md 3번 조항'이 됩니다. 감사 가능성은 좋아지지만, 그 파일을 누가 승인했고 그 승인이 법적 책임을 지는 사람의 판단인지가 새 질문이 됩니다. 메타의 '30초 검토'는 효율의 지표이지 책임의 지표는 아닙니다.


맺으며: 스코어북은 이미 파일로 존재한다

지난 특집의 마지막 질문은 "여러분의 판단은 지금 어디에 기록되고 있습니까?"였습니다. 이번 특집의 답은 구체적입니다. 메타에서는 200개 넘는 텍스트 파일과 그 사이의 의존성 그래프에, 「Learning on the Job」에서는 WHEN–THEN 규칙 저장소에 기록됩니다. 둘 다 모델의 가중치가 아닙니다. 둘 다 사람이 읽을 수 있고, diff를 볼 수 있고, 되돌릴 수 있습니다.

그리고 둘 다 같은 것을 조심합니다. 아무 때나 쓰지 않는다. 쓰기 전에 검증한다. 원인을 하나로 좁힌다. 답이 아니라 절차를 기록한다. 이 네 습관이 '배우는 에이전트'와 '실수를 복리로 쌓는 에이전트'를 가릅니다.

남은 것은 두 시스템 모두에 없는 여섯 번째 층입니다. 전문가가 옳다고 한 것이 정말 옳았는지를 현실이 다시 채점하는 층. 그것을 루프에 넣는 조직이, 지난 특집이 말한 '전문성의 힘'을 진짜로 갖게 될 것입니다.


출처

주 자료

계보와 배경

함께 읽으면 좋은 코어닷투데이 글