[특집] SaaS가 25년 동안 못 지킨 약속, AI가 지킨다 — 「전문성의 힘」과 계속 배우는 루프(CLL) 완전 해부
2026년 2월, 앤트로픽의 클로드 코워크가 나오자 월가는 'AI가 SaaS를 죽인다'며 소프트웨어 주식을 던졌습니다. 그로부터 일곱 달 뒤인 9월 15일, 프라이머리 벤처 파트너스의 에밀리 만이 정반대 글을 올렸습니다. 「Enterprise AI is Finally Delivering on the Promise SaaS Made」, 즉 '기업용 AI가 드디어 SaaS가 했던 약속을 지키고 있다'. 1999년 세일즈포스가 '소프트웨어의 종말'을 선언한 이래 SaaS는 25년 동안 '전문성'을 팔았지만 정작 그 전문성은 제품이 아니라 영업사원과 컨설턴트의 머릿속에 있었다는 진단에서 출발해, 오늘의 AI 에이전트는 왜 '똑똑한 신입'에 불과한지, 신입을 베테랑으로 만드는 '스코어북'이란 무엇인지, 고객이 늘수록 다음 고객이 쉬워지는 '계속 배우는 루프(CLL)'가 왜 진짜 해자인지, 그리고 '연구소가 앱을 다 먹을 것'이라는 공포에 스노우플레이크와 세일즈포스의 역사가 뭐라고 답하는지를 따라갑니다. 카드 분쟁 100달러 사례, 청구서 예외의 롱테일, 카파시의 '시스템 프롬프트 학습'부터 2026년 8월의 '하니스 계속 학습' 논문까지 — 인터랙티브 6개와 삽화 13장, 원문 도표 4장으로 함께 읽어 보세요.
2026년 1월 12일, 앤트로픽이 사무직 업무용 에이전트 클로드 코워크(Claude Cowork) 를 공개했습니다. 1월 30일에는 영업·법무 검토·재무 분석·고객 지원 등 화이트칼라 직무 하나씩을 겨냥한 플러그인 11개를 오픈소스로 풀었습니다. 그러자 월가가 결론을 내렸습니다. "AI 에이전트가 사람 몫의 일을 직접 하면, 사람 수대로 돈을 받던 SaaS는 끝났다."
S&P 소프트웨어·서비스 지수는 1월 12일부터 2월 23일 사이에 25% 가 빠졌습니다. 2월 3일 하루에만 시가총액 2,850억 달러 가 사라졌고, 사람들은 이 사건에 'SaaS 종말론(SaaSpocalypse)'이라는 이름을 붙였습니다. 리걸줌은 약 20%, 톰슨 로이터는 16% 떨어졌습니다. 2월 24일 앤트로픽이 세일즈포스·도큐사인·인튜이트 등과의 통합을 발표하며 "대체가 아니라 연결"이라는 신호를 보내자 일부 반등했지만, 잃은 것을 다 되찾지는 못했습니다.
2026년 초 'SaaS 종말론' 매도 — 하락률 (최댓값 25% 기준, 출처: 딥러닝AI The Batch·언론 보도 종합)
S&P 소프트웨어·서비스 지수 (1.12~2.23)
−25%
리걸줌 (LegalZoom)
약 −20%
톰슨 로이터
−16%
JP모건 소프트웨어 지수 (당일)
−7%
S&P 소프트웨어 지수 (2.3 당일, −2,850억 달러)
−4%
그 공포가 채 가시지 않은 9월 15일, 뉴욕의 초기 단계 벤처캐피털 프라이머리 벤처 파트너스(Primary Venture Partners) 의 파트너 에밀리 만(Emily Man) 이 동료 캐시 영, 닉 데일리와 함께 정반대의 글을 올렸습니다. 제목은 「Enterprise AI is Finally Delivering on the Promise SaaS Made」. 우리말로 옮기면 '기업용 AI가 드디어 SaaS가 했던 약속을 지키고 있다'입니다. 부제는 더 도발적입니다. "옛것이 다시 새것이 된다. 다만 이번에는 전문성이 제품 안에 산다."
에밀리 만은 헤지펀드 포인트72의 애널리스트로 시작해 포인트72 벤처스, 레드포인트 벤처스를 거쳐 2023년 프라이머리에 첫 핀테크 파트너로 합류한 투자자입니다. 이 글은 투자자가 자기 투자 논리를 공개한 글입니다. 그래서 어떤 대목은 광고처럼 읽히고, 어떤 대목은 포트폴리오 회사 자랑처럼 읽힙니다. 그런데도 이 글이 읽을 가치가 있는 이유는, 2026년 기업용 AI를 둘러싼 가장 뜨거운 질문 세 개에 하나의 틀로 답하려 하기 때문입니다.
왜 그렇게 똑똑한 모델이 회사에 들어오면 첫날에 아무것도 못 하는가?
왜 어떤 AI 회사는 고객이 늘수록 강해지고, 어떤 회사는 고객이 늘수록 컨설팅 회사가 되는가?
앤트로픽·OpenAI 같은 연구소가 결국 응용 시장까지 다 가져가지 않을까?
원문은 네 가지 개념으로 이 질문에 답합니다. 먼저 전체 흐름을 보겠습니다.
① 진단
SaaS는 25년 동안 '전문성에 대한 접근권'을 팔았지만, 전문성 자체를 제품에 넣지는 못했다. "훌륭한 게 뭔지 보여 드리겠다"는 영업팀의 말이었고, 실제로 그걸 해내는 건 컨설팅과 고객 성공 팀의 몫이었다.
② 신입 에이전트
오늘의 AI 에이전트는 똑똑하지만 회사도, 업계도 모르는 신입이다. 부족한 건 정보가 아니라 경험, 즉 어떤 절차가 실제로 통했는지에 대한 감이다. 쓸모 있는 에이전트에는 컨텍스트·하니스·모델 세 입력이 필요하다.
③ 스코어북
에이전트가 무엇을 결정했고, 무슨 일이 일어났고, 그게 옳았는지를 기록하는 장부. 데이터·온톨로지·플레이북·결정 흔적·전문가 채점·비즈니스 결과의 여섯 층. 이것이 '일을 할 수 있는' 에이전트를 '일에서 배우는' 에이전트로 바꾼다.
④ 계속 배우는 루프(CLL)
같은 스코어북을 여러 고객 환경에 깔면, 한 고객에서 배운 예외가 다음 고객의 기본값이 된다. 50번째 고객은 5번째보다 눈에 띄게 쉬워야 한다. 이렇게 쌓이는 것이 '전문성의 힘(Expertise Power)'이고, 그것이 진짜 해자다.
⑤ 연구소는?
AWS가 레드시프트를 내놨어도 스노우플레이크가 컸고, 마이크로소프트가 다 가졌어도 CRM은 세일즈포스가 가져갔다. 하니스 강도 × 프런티어 강도 좌표에서 하니스가 무거운 두 사분면이 독립 앱의 자리다.
이 특집은 원문의 순서를 따라가되, 각 개념이 어디서 왔는지, 어떤 논문과 역사가 뒤에 있는지, 그리고 2026년 9월 한국에서 이 글을 어떻게 써먹을 수 있는지를 보탭니다. 원문에 없는 수치와 사례는 출처를 밝혔고, 원문의 주장에 동의하지 않는 대목은 8부에 따로 모았습니다.
1부. SaaS가 한 약속 — "우리가 훌륭한 게 뭔지 보여 드리겠다"
1999년, 소프트웨어의 종말을 선언한 회사
원문의 첫 문장은 역사에서 시작합니다.
2000년, 한 회사가 소프트웨어의 종말을 선언하는 로고를 내걸고 출범했다. 그런데 세일즈포스는 이전 세대 소프트웨어가 늘 팔던 것을 똑같이 팔아서 기업용 소프트웨어의 거인이 됐다. 워크플로, 이 문제를 천 번은 본 벤더, 그리고 고장 났을 때 탓할 사람.
1999년 3월, 오라클의 임원이었던 마크 베니오프가 샌프란시스코의 작은 아파트에서 세일즈포스를 창업했습니다. 로고는 'SOFTWARE'라는 글자에 빨간 원과 사선을 그은 것이었고, 첫 출범 파티의 이름은 아예 '소프트웨어의 종말(The End of Software)'이었습니다. 당시 시장을 지배하던 시벨(Siebel)의 CRM은 CD-ROM으로 설치하고, 서버를 사고, 컨설턴트를 부르고, 1년에 한 번 업그레이드하는 물건이었습니다. 세일즈포스의 제안은 간단했습니다. 설치하지 마라. 브라우저로 빌려 써라. 매달 돈을 내라.
이 제안은 통했습니다. 오늘 우리가 SaaS라고 부르는 산업이 여기서 시작됐습니다. 그런데 원문이 짚는 것은 그다음입니다. 세일즈포스가 커진 뒤에 판 것은 결국 옛 소프트웨어가 팔던 것과 같았습니다. 고객이 원한 것은 브라우저가 아니라, 우리 영업 조직을 어떻게 굴려야 하는지 아는 사람이었습니다.
2005년, '고객 성공'이라는 발명
SaaS의 구조적 약점은 금방 드러났습니다. 설치형 소프트웨어는 라이선스를 한 번 팔면 끝이지만, 구독은 고객이 다음 달에도 써야 돈이 됩니다. 2005년 세일즈포스의 월간 이탈률은 8% 에 이르렀습니다. 연 환산으로 고객의 80%가 빠져나가는 속도였습니다. 세일즈포스는 'Customers for Life'라는 조직을 만들어 고객이 제품을 실제로 잘 쓰도록 돕는 일을 사람에게 맡겼고, 이것이 오늘날 모든 SaaS 회사에 있는 고객 성공(Customer Success) 팀의 원형이 됐습니다.
여기서 원문의 핵심 진단이 나옵니다.
SaaS는 25년 동안 전문성에 대한 접근권을 팔았지만, 그 전문성을 제품 안에 담는 일은 거의 하지 못했다. "우리가 훌륭한 게 뭔지 보여 드리겠다"는 말은 영업팀이 팔았고, 실제로 알아내는 일은 전문 서비스 팀에 떠넘겨졌다.
이 문장을 곱씹어 보면 SaaS 산업의 익숙한 풍경이 다 설명됩니다. 왜 도입 컨설팅이 그렇게 비싼지, 왜 '베스트 프랙티스 웨비나'가 그렇게 많은지, 왜 좋은 고객 성공 매니저가 이직하면 고객사가 흔들리는지. 제품은 빈 그릇이었고, 그 그릇을 어떻게 채우는지는 사람이 알았습니다. 소프트웨어 회사는 사실 '워크플로를 가진 컨설팅 회사'였고, 그 컨설팅은 확장되지 않았습니다.
AI는 여기서 다른 가능성을 엽니다. 원문의 표현으로는 이렇습니다.
AI는 훨씬 큰 기회를 연다. 일이 어떻게 처리되는지를 포착하고, 그 결과에서 배우고, 축적된 경험을 다음 실행에서 더 나은 판단으로 바꾸는 애플리케이션. 응용 계층은 사라지는 게 아니다. 기업용 SaaS가 늘 열망했지만 끝내 이루지 못한 것이 드디어 되고 있다.
원문이 기대는 역사, 한눈에
원문은 짧지만 그 뒤에 27년치 산업사가 있습니다. 연도를 눌러 가며 각 사건이 원문의 어떤 주장을 떠받치는지 보세요.
지능은 풍부해지고, 전문성은 희소하다
원문의 두 번째 문단에는 이 글 전체의 뼈대가 되는 대비가 나옵니다.
원시 지능은 풍부해지고 있다. 다음 프런티어는 지능을 전문성으로 바꾸는 것이다. 우리는 모두 갓 졸업한 법대생보다 관련 사건 수백 건을 다뤄 본 변호사를 원한다. 수술복을 처음 입은 심장외과의를 찾는 사람은 없다.
이 문장은 지난 특집에서 다룬 「지능이 상품이 될 때」의 논리와 정확히 맞물립니다. 그 글은 모델이 내놓는 원시 지능의 가격이 몇 년 새 수백 분의 일로 떨어졌고, 그래서 지능이 밀이나 구리처럼 '상품'이 됐다고 말했습니다. 상품이 된 것으로는 마진을 남길 수 없습니다. 그렇다면 무엇이 희소한가? 원문의 답은 전문성 입니다. 같은 지능이라도 '이 회사에서, 이 업무에서, 무엇이 실제로 통했는가'를 아는 것은 여전히 비쌉니다.
원문은 이 희소한 것에 이름을 붙입니다. 전문성의 힘(Expertise Power), 즉 "축적된 생산 경험을 측정 가능하게 더 나은 판단으로 바꾸는 능력"입니다. 이 힘이 어떻게 만들어지는지가 2부에서 4부까지의 내용입니다.
2부. 신입 에이전트 — 정보와 경험은 다르다
첫 출근한 천재
원문의 비유는 단순하고 정확합니다.
오늘의 AI 에이전트는 갓 졸업한 신입 같다. 똑똑하고, 열심이고, 지치지 않지만, 일도, 회사도, 업계도 모른다. 즉 첫날에는 거의 쓸모가 없다.
여기서 원문은 흔한 오해 하나를 걷어냅니다. 신입에게 부족한 것이 정보 라고 생각하면, 해법은 회사 문서를 전부 먹이는 것입니다. 2024년부터 2025년까지 기업들이 RAG(검색 증강 생성)에 매달린 이유가 그것이었습니다. 원문은 그게 틀렸다고 말합니다.
신입에게 부족한 것은 정보가 아니다. 회사 문서를 전부 주면 다 읽을 것이다. 부족한 것은 전문성이다. 어떤 절차와 답이 실제로 통했고 어떤 것은 안 통했는지 아는 것. 그 감각은 현장 경험으로만 얻어진다.
이 구분은 이 글에서 가장 중요한 구분입니다. 문서에는 '규정'이 적혀 있지만, '이 규정을 언제 어겨야 하는지'는 적혀 있지 않습니다. 매뉴얼에는 '승인 절차'가 있지만 '누구에게 먼저 물어야 빨리 끝나는지'는 없습니다. 원문은 이 간극을 튜링(Turing)의 CFO 바르샤 우다야바누의 말로 요약합니다. 에이전트 배치의 가장 큰 어려움은 "표준 운영 절차(SOP)와 실제로 일이 되는 방식 사이의 간극" 이라고.
세 가지 입력: 컨텍스트, 하니스, 모델
원문은 쓸모 있는 에이전트 시스템에 세 가지 핵심 입력이 필요하다고 정리합니다.
입력
무엇인가
비유
코딩 에이전트에서는
컨텍스트
일을 하려면 모델이 알아야 하는 것: 관련 데이터, 이력, 과거 결정, 회사 고유의 지식
마차에 실린 지도와 서류함
저장소의 코드, 이슈, 과거 PR, 설계 문서
하니스
모델을 둘러싼 비계: 핵심 시스템으로 이어지는 배관, 일이 진행되는 단계별 플레이북, 실제로 한 일의 기록이 쌓이는 '서류함'
'하니스'라는 말이 낯설다면, 이 블로그에서 먼저 다룬 두 글이 도움이 됩니다. 「하니스 — AI가 스스로 일하는 방식을 설계하다」는 개념을, 「같은 모델인데 성적이 10배 차이」는 같은 모델에 하니스만 바꿔 176개 실험을 돌린 논문을 다룹니다. 그 논문에서 5,500억 파라미터 모델은 하니스에 따라 성공률이 6.4%에서 58.4%로 갈렸습니다. 말은 같은데 마구가 달랐던 것입니다.
세 부품을 직접 켜고 꺼 보세요. 그리고 네 번째 부품이 왜 필요한지도.
코딩 에이전트가 먼저 성공한 이유
원문은 왜 하필 코딩 에이전트가 2025년의 돌파구가 됐는지를 이 틀로 설명합니다.
코딩 에이전트가 독보적 성공 사례인 이유는, 소프트웨어 공학에는 이미 이례적으로 완전한 인프라가 있었기 때문이다. 일은 저장소에 산다. 변경은 풀 리퀘스트로 나타난다. 테스트가 즉각적인 피드백을 준다. 다른 기업 업무도 이렇게 생겼다면 좋으련만.
이 관찰은 앞서 다룬 「가장 쓴 교훈」 특집의 결론과도 통합니다. 그 글은 AI 발전에서 결정적인 것이 계산량보다 '올바른 과제', 즉 정답이 자동으로 확인되는 과제라고 했습니다. 코딩은 컴파일러와 테스트가 채점을 해 줍니다. 원문의 언어로 바꾸면, 코딩에는 스코어북이 공짜로 딸려 있었습니다.
반면 다른 기업 업무는 어떤가요. 원문의 묘사는 냉정합니다. 데이터는 흩어져 있거나, 지저분하거나, 아예 없습니다. 하나의 워크플로를 끝내려면 여러 도구와 여러 이해관계자의 입력이 필요합니다. 그래서 대부분의 기업은 아직 1단계 에 머물러 있습니다. 쓸모 있는 에이전트를 배치하기 전에, 기존 데이터와 시스템을 연결하고, 정리하고, 표준화해야 합니다.
배관공의 시대: 전진 배치 엔지니어의 폭증
그 1단계를 대신해 주는 직업이 2026년 실리콘밸리에서 가장 뜨거운 직함이 됐습니다. 전진 배치 엔지니어(Forward Deployed Engineer, FDE) 입니다.
이 직함은 2010년대 초 팔란티어가 만들었습니다. 정보기관 고객에게는 요구사항 문서를 받아 개발하는 방식이 구조적으로 통하지 않아, 엔지니어를 아예 고객사에 보내 함께 일하게 한 것입니다. 15년 동안 팔란티어 밖에서는 거의 쓰지 않던 이 직함이 2025년 하반기부터 폭발했습니다.
①
파일럿의 95%가 손익에 흔적을 못 남겼다 (MIT NANDA, 2025년 8월)
300여 개 공개 사례, 52개 조직 인터뷰, 153명 설문을 바탕으로 한 예비 보고서는 생성형 AI 이니셔티브의 95%가 측정 가능한 수익을 내지 못했다고 했습니다. 원인은 '부서지기 쉬운 워크플로, 약한 맥락 학습, 일상 업무와의 부적합'. 자체 구축 도구의 배치 성공률은 약 33%, 외부 파트너와 만든 도구는 약 67%였습니다. (자기 보고 자료이며, 정의가 조직마다 달랐다는 한계를 저자들 스스로 밝혔습니다.) 이 블로그의 「기업 AI 스케일링」이 이 보고서를 자세히 다룹니다.
②
그 틈을 사람이 메우기 시작했다 (테크크런치, 2026년 7월 30일)
임원 서치펌 크리스천 & 팀버스의 추산에 따르면 2026년 1월에는 미국 기업의 5~10%만 FDE 채용을 계획했는데, 6월에는 70%가 적극 채용 중이었습니다. 미국에 FDE는 약 1만 7천 명이 있지만, 업계 지식과 실제 AI 배치 경험을 함께 갖춰 '수천만 달러 단위의 ROI'를 만들어 낼 수 있는 사람은 2천 명 안팎이라는 추산입니다. 보도에 따르면 AWS도 6월 30일 수천 명의 FDE를 고객사에 배치하는 10억 달러 투자를 발표했습니다.
③
원문의 경고: 거기서 멈추면 컨설팅 회사다
"데이터를 닦고 시스템을 잇는 일이 지금은 수요가 높지만, 일이 거기서 멈추면 그건 컨설팅이다." FDE는 필요조건이지 해자가 아닙니다. 배관을 이은 다음에 무엇을 쌓느냐가 3부의 주제입니다.
3부. 스코어북 — 결정과 결과를 한 줄로 잇는 장부
일을 하는 것과 일에서 배우는 것
원문은 여기서 이 글의 핵심 개념을 꺼냅니다.
컨텍스트 + 하니스 + 모델은 에이전트가 일을 할 수 있게 만든다. 스코어북은 그 일을 하면서 시스템이 배울 수 있게 만든다. 에이전트가 무엇을 결정했고, 무슨 일이 일어났고, 그게 옳았는지의 기록이다.
'스코어북(scorebook)'은 야구 기록지에서 온 말입니다. 야구 스코어북에는 점수만 적히지 않습니다. 몇 회에 누가 어떤 공을 쳤고, 수비수가 어디로 던졌고, 그 결과 주자가 어떻게 됐는지가 한 칸 한 칸 남습니다. 그래서 경기가 끝난 뒤에 '그때 번트가 옳았나'를 따질 수 있습니다. 원문의 스코어북도 같습니다. 결정의 입력 과 과정 과 결과 를 한 줄로 이어 두는 장부입니다.
시스템이 무엇을 봤고, 어떤 단계와 도구를 썼고, 무엇을 냈고, 사람이 무엇을 고치거나 뒤집거나 다시 시켰는지
틀렸을 때 '어디서' 틀렸는지 모른다
⑤ 전문가 채점
내부 전문가가 결정의 질을 어떻게 평가하는가. 무엇이 중요했고, 무엇을 놓쳤고, 예외가 적절했는지
'규정대로 했다'와 '잘했다'를 구분 못 한다
⑥ 비즈니스 결과
결정 뒤에 실제로 무슨 일이 일어났는가. 결국 옳은 판단이었는가
채점이 전문가의 취향으로 굳어지고, 현실이 교정해 주지 않는다
이 여섯 층 가운데 앞의 셋(데이터·온톨로지·플레이북)은 사실 팔란티어 파운드리가 10년 넘게 팔아 온 것과 겹칩니다. 파운드리의 온톨로지는 '객체·연결·행동'의 세 가지 원소로 회사를 모델링하고, 현장 사용자가 내리는 결정을 '결정 포착(decision capture)'이라는 이름으로 데이터 자산에 넣습니다. 원문이 새로 강조하는 것은 뒤의 셋, 특히 ⑤와 ⑥입니다. 결정을 기록하는 것만으로는 부족하고, 누군가가 그 결정에 점수를 매기고, 나중에 현실이 그 점수를 다시 매겨야 시스템이 배웁니다.
100달러짜리 분쟁 한 건
원문은 이 추상적 구조를 포트폴리오 회사 카사프(Casap) 의 사례로 구체화합니다. 카사프는 2023년 로빈후드와 차임 출신 두 사람이 세운 회사로, 은행과 신용조합의 카드 분쟁 처리를 자동화합니다. 카드 분쟁이란 고객이 "이 결제는 내가 한 게 아니다" 혹은 "물건을 못 받았다"고 은행에 이의를 제기하는 일입니다. 미국에서는 이 가운데 상당수가 본인이 결제해 놓고 부인하는 '1자 사기(first-party fraud)'인데, 렉시스넥시스 자료로는 전체 사기 손실의 30~50%를 차지하는 1,000억 달러 규모의 문제입니다.
원문의 설명을 따라가 봅시다. 분쟁 한 건을 처리하는 데 필요한 입력 은 찾기 쉽습니다. 거래 기록, 기기 이력, 판매자 영수증. 찾기 어려운 것, 그래서 대개 기록되지 않는 것은 그 입력을 결정 으로 바꾸는 모든 과정입니다.
100달러짜리 분쟁에서 기기 지문, IP, 배송지가 과거 주문과 일치하면 1자 사기로 읽힌다. 그런데도 분석가는 환불을 해 줄 수 있다. 고객이 고가치 고객이고, 수십 년째 거래해 왔고, 분쟁을 제기한 적이 한 번도 없기 때문이다. 그리고 결과가 있다. 차지백에서 이겼는가? 얼마를 회수했는가? 고객이 떠났는가?
이 사례가 좋은 이유는 '정답'이 규정집에 없기 때문입니다. 3년 된 SOP는 "일치하면 거절"이라고 합니다. 베테랑 분석가는 "이 고객은 예외"라고 합니다. 둘 중 누가 옳았는지는 결과 가 나와야 압니다. 100달러를 아끼고 20년 고객을 잃었다면 규정이 틀린 것이고, 100달러를 내주고 고객을 지켰다면 분석가가 옳은 것입니다. 스코어북이 ⑥번 층까지 있어야만, 이 판단이 다음 플레이북의 '예외 조항'으로 승격될 수 있습니다.
여섯 층을 하나씩 열어 보세요. 같은 분쟁을 규정집이 처리했을 때와 분석가가 처리했을 때 장부가 어떻게 달라지는지 비교할 수 있습니다.
카사프는 자사 고객 사례로 차트웨이 신용조합의 분쟁 처리 비용 85% 절감, 미드사우스의 사기 손실 절반 감소를 내세웁니다. 이 수치는 회사 발표이고 독립 검증은 없으니 참고만 하시되, 원문이 이 회사를 든 이유는 수치가 아니라 구조 입니다. 분쟁은 결과가 명확하고(차지백 승패, 회수액, 고객 유지), 몇 주 안에 확인되며, 은행마다 비슷한 판단이 반복됩니다. 스코어북을 쓰기에 이상적인 업무입니다.
연구실에서는 이걸 뭐라고 불렀나
원문은 벤처캐피털의 글이라 논문을 인용하지 않습니다. 그러나 '가중치를 바꾸지 않고 기록으로 배운다'는 생각은 AI 연구에서 3년 넘게 이어져 온 흐름이고, 그 계보를 알면 원문의 주장이 얼마나 단단한 땅 위에 있는지 보입니다.
시점
연구
핵심 아이디어
원문의 어느 층에 해당하나
2023.03
Reflexion (신 외)
실패한 시도를 '말로 된 반성'으로 요약해 메모리에 넣고 다음 시도에 붙인다. 가중치 갱신 없음
④ 결정 흔적 + ⑤ 자기 채점
2023.05
Voyager (왕 외)
마인크래프트에서 성공한 행동을 코드 '기술'로 저장해 도서관을 쌓고 재사용한다
③ 플레이북이 자라는 방식
2023.08
ExpeL (자오 외)
성공·실패 경험을 모아 과제를 넘나드는 '통찰'로 추출하고, 평가 때 과거 성공을 회상한다
③ + ④, 여러 과제에 걸친 일반화
2025.05
카파시, '시스템 프롬프트 학습'
"사전학습은 지식, 파인튜닝은 습관. 사람이 배우는 방식은 둘 다 아니다. 문제를 풀고 메모를 남겨 다음에 쓰는 세 번째 패러다임이 빠져 있다"
스코어북의 한 줄 요약
2025.10
ACE (스탠퍼드·삼바노바)
컨텍스트를 '진화하는 플레이북'으로 다룬다. 생성기·반성기·큐레이터가 작은 단위로 덧붙여 '요약하다 보면 세부가 사라지는' 붕괴를 막는다. 에이전트 벤치마크 +10.6%p, 적응 지연 −86.9%
③ 플레이북 + ⑤ 채점의 자동화
2026.04
「계속 학습이 메모리로 옮겨갈 때」 (후 외)
메모리로 배우면 망각이 사라지는 게 아니라 '메모리 수준'에서 다시 나타난다. 상세 궤적보다 추상적 절차 기억이 더 잘 옮겨가고, 어려운 사례에서는 부정적 전이가 생긴다
4부·8부의 경고
2026.08
「하니스 계속 학습」 (캉 외)
모델은 고정하고 프롬프트·메모리·도구·기술·라우팅 규칙을 진화시킨다. 후보 생성과 채택을 분리하는 '보호된 하니스 진화'. 여러 설정에서 10% 이상 상대 이득, '하니스 수준 망각' 개념 제시
③④⑤를 시스템으로 묶은 것
이 표에서 눈여겨볼 것은 흐름의 방향입니다. 2023년에는 '한 에이전트가 한 과제에서' 배우는 이야기였습니다. 2025년에는 그 메모가 '플레이북'으로 구조화됐고, 2026년에는 모델을 고정한 채 하니스 전체 가 배우는 대상이 됐습니다. 원문의 스코어북은 이 흐름을 기업 워크플로 규모로 옮긴 것이고, 다음 4부의 CLL은 그것을 '여러 고객에 걸쳐' 돌리자는 제안입니다.
여기까지 읽으면 자연스러운 반론이 나옵니다. 응용 계층의 가치가 '우리 회사의 노하우를 제품화하는 것'이라면, 왜 직접 만들지 않고 남에게 맡기는가? 원문의 답은 이렇습니다.
사내 시스템은 하나의 환경에서 배운다. 한 회사의 워크플로, 한 회사의 엣지 케이스, 한 회사의 결과만 본다. 좋은 스코어북은 국지적으로 반복 개선을 가능하게 한다. 같은 스코어북을 많은 고객 환경에 깐 제3자는 고객 기반 전체에 걸쳐 전문성을 복리로 쌓는 계속 배우는 루프(Continual Learning Loop, CLL)를 연다.
원문의 그림이 이 주장을 잘 보여 줍니다.
크게 보기원문 그림 1. "각 코호트는 사내 전문가 수준에 앞선 코호트보다 빨리 닿는다." 회색은 고객 안에서만 배우는 곡선, 주황은 루프가 있을 때. 그림: Primary Venture Partners, 원문에서 인용 목적 전재
청구서 예외의 롱테일: 탭스
원문의 두 번째 사례는 탭스(Tabs) 입니다. 2023년 뉴욕에서 창업해 B2B 회사의 청구·수금·수익 인식을 AI 에이전트로 처리하는 회사로, 2025년 9월 라이트스피드 주도로 5,500만 달러 시리즈 B를 받았고 커서(Cursor)·스탯시그 같은 회사가 고객입니다. (CEO 알리 후세인은 원문 끝의 감사 명단에도 있습니다.)
원문이 이 회사를 든 이유는 청구 업무가 예외의 롱테일 그 자체이기 때문입니다.
완전한 전문가 수준 자동화의 가장 큰 장애물은 고객마다 다른 뉘앙스와 예외에 있다. 모든 매입채무(AP) 포털이 다르게 작동하고 다른 항목을 요구한다. 매출채권(AR) 수신함에는 송금 통지, 분쟁, W-9 요청, 담당자 변경이 끊임없이 섞여 들어오고, 각각을 구분해 라우팅해야 한다. 계약마다 별난 조항이 있다. 사후 정산되는 사용량, 1년 뒤 줄어드는 할인, 두 법인에 나눠 발행되는 인보이스.
이 중 어느 것도 기록 시스템에 없다. 예외 하나씩 배워야 한다. 탭스는 그것을 배워서 시스템으로 되돌린다. 한 고객을 위해 만든 수정이 다음 고객의 출발 가정이 된다. 그래서 새 고객마다 첫날부터 '전문가 CFO'에 더 가까이 출발하고, 그 수준에 더 빨리 닿는다.
크게 보기원문 그림 2. "새 고객마다 앞선 고객보다 나은 상태에서 출발한다." 코호트마다 넘어오는 학습의 예시가 적혀 있다. 그림: Primary Venture Partners / Tabs, 원문에서 인용 목적 전재
주목할 점은 코호트 10+에 적힌 학습의 종류입니다. "어떤 지급인은 독촉해야 하는가", "계약 수정이 실제로 무엇을 바꾸는가", "지저분한 CRM에서 계약을 어떻게 꺼내는가", "언제 인보이스를 보내고 언제 에스컬레이션하는가". 어느 것도 특정 고객의 거래 데이터가 아닙니다. 전부 일하는 법 에 대한 지식입니다.
50번째 고객은 5번째보다 쉬워야 한다
원문은 CLL이 제대로 돌면 배치의 경제학이 달라져야 한다고 말합니다.
진짜 CLL은 배치의 경제학도 바꿔야 한다. 50번째 고객은 5번째 고객보다 눈에 띄게 구현이 쉬워야 한다. 첫날부터 더 나은 평가, 더 단단한 엣지 케이스 지원, '좋은 것이 무엇인지'에 대한 더 강한 의견이 있어야 한다. 모든 맞춤 구현의 어느 부분은 재사용 가능한 제품이 돼야 한다.
이 문장은 SaaS 투자자들이 오랫동안 써 온 잣대와 정반대입니다. 전통적인 SaaS 실사에서 '구현에 사람이 많이 든다'는 것은 나쁜 신호였습니다. 매출총이익률이 낮아지기 때문입니다. 원문은 그 질문을 바꿉니다. 구현에 사람이 드는 것 자체는 문제가 아니다. 그 사람이 배운 것이 다음 고객에게 제품으로 넘어가느냐 가 문제다. 넘어가면 복리이고, 안 넘어가면 컨설팅입니다.
원문의 그림을 움직이게 만들었습니다. 몇 번째 고객인지, 학습이 고객 사이에 얼마나 일반화되는지를 바꿔 보세요.
여기서 원문은 중요한 단서를 답니다. 기업 고객은 자기 데이터를 남과 섞는 것을 극도로 꺼립니다. 그래서 CLL은 원시 고객 데이터를 모으는 것이 아닙니다.
정확히 말하면 CLL에 원시 고객 데이터가 꼭 필요한 것은 아니다(대부분의 기업은 그러기엔 너무 영리하다). 진짜 데이터 풀링 학습은 존재하지만, 주로 고객들이 공유된 이해관계를 가진 상황에 한정된다. 사기, 알려진 취약점과 공격 벡터, 장비 고장 같은 것들.
고객을 넘어 복리로 쌓일 수 있는 것은 과정 지식이다. 어떤 구현이 실패하는지, 어떤 예외가 중요한지, 어떤 평가가 엣지 케이스를 잡아내는지, 첫날에 '좋은 것'이 무엇인지.
이 구분은 실무적으로 아주 중요합니다. 2026년 한국에서 AI 벤더와 계약하는 기업의 법무팀이 가장 먼저 묻는 것이 "우리 데이터로 학습하느냐"입니다. 원문의 답은 '아니오, 그러나'입니다. 여러분의 거래 기록은 여러분 것입니다. 그러나 '여러분의 AP 포털이 요구하는 항목 순서'나 '여러분 업계에서 흔한 계약 조항의 처리법'은, 그것이 특정 고객을 식별하지 않는 한, 벤더의 플레이북이 됩니다. 계약서에 이 선을 어디에 긋느냐가 앞으로 기업 AI 계약의 핵심 조항이 될 것입니다.
원문은 이 루프에서 빠지는 영역도 인정합니다. 브리지워터의 투자 리서치 프로세스처럼 회사의 '알파' 그 자체인 워크플로는 결코 제3자에게 맡겨지지 않을 것이고, 거기서는 사내 구축이 계속 우세할 것이라고. 덜 민감한 기능에서는 CLL을 완성한 벤더의 제안이 이렇게 들릴 것입니다. "세계 최고의 [해당 직무 담당자]를 처음부터 고용하시겠습니까?"
책임의 이동
4부의 마지막 문단은 짧지만 이 글에서 가장 멀리 나간 주장입니다.
CLL은 더 큰 책임(accountability)을 연다. 더 많은 결정, 엣지 케이스, 결과를 본 벤더는 능력을 제공하는 것 이상을 할 수 있다. 품질이 쌓일수록 애플리케이션 제공자는 작업의 품질 자체를 점점 더 보증할 수 있다. 전문성이 복리로 쌓일수록, 벤더가 소유할 수 있는 결과의 몫도 커진다.
옛 SaaS는 '도구'를 팔았습니다. 도구를 잘못 써서 생긴 손실은 고객의 몫이었습니다. 원문은 스코어북이 충분히 쌓이면 벤더가 결과 를 팔 수 있다고 말합니다. 분쟁 처리 소프트웨어를 파는 것이 아니라 '회수율'을 파는 것, 청구 소프트웨어가 아니라 '수금 기간'을 파는 것. 이것이 「지능이 상품이 될 때」 특집의 마지막 질문, "결과를 원하는가, 과정을 원하는가"의 기업용 버전입니다.
5부. 연구소가 다 먹지 않을까?
플랫폼 소유자가 응용까지 이기지는 않는다
이제 2월의 공포로 돌아옵니다. 앤트로픽과 OpenAI는 분명히 스택 위쪽으로 올라오고 있습니다. 하니스와 에이전트를 만들기 쉽게 하는 도구를 쏟아내고 있고, 원문의 표현으로는 "원시 지능 제공자로서 그러는 게 그들에게 최선"입니다. 많은 사람이 이걸 보고 '연구소에서 안전한 응용 계층은 없다'고 결론지었습니다. 원문은 동의하지 않고, 역사 두 토막을 꺼냅니다.
아마존은 인프라를 소유했고 레드시프트를 내놨지만, 스노우플레이크가 AWS 위에서 카테고리를 정의하는 사업을 세우는 것을 지켜봤다. 마이크로소프트는 운영체제, 생산성 제품군, 기업 계약, 유통망을 소유했고 다이내믹스 CRM을 내놨지만, 그중 어느 것도 갖지 않은 회사에 CRM을 내줬다.
두 이야기를 조금 더 자세히 보겠습니다. 스노우플레이크는 2012년 7월 창업해 처음부터 AWS 위에 데이터 웨어하우스를 짓기로 했습니다. 넉 달 뒤인 11월, AWS가 자체 데이터 웨어하우스 레드시프트 를 테라바이트당 연 1,000달러 미만이라는 파격가로 발표했습니다. 투자자들은 "아마존이 너희 점심을 먹어 치울 텐데 왜 투자하느냐"고 물었습니다. 스노우플레이크는 2년을 더 스텔스로 버틴 뒤 2014년 10월에야 모습을 드러냈고, 2020년 9월 소프트웨어 회사 사상 최대 규모의 IPO를 했습니다. 지금도 스노우플레이크의 워크로드 대부분은 AWS 위에서 돕니다. 플랫폼은 응용을 죽이지 못했고, 오히려 응용이 플랫폼의 최대 고객이 됐습니다.
CRM 쪽은 더 극적입니다. 마이크로소프트는 윈도우, 오피스, 기업 라이선스 계약, 전 세계 유통망을 다 가진 상태에서 2000년대 초부터 CRM에 여러 번 도전했고, 2016년에는 다이내믹스 365로 다시 묶었습니다. 그런데 2021년 IDC 기준 CRM 점유율은 세일즈포스 23.8%, 마이크로소프트 5.3%였습니다. 원문의 문장대로, '그 모든 것을 하나도 안 가진 회사'에게 응용 시장을 내준 것입니다.
두 축의 좌표: 하니스 강도 × 프런티어 강도
그러나 원문은 '모든 앱이 안전하다'고 말하지 않습니다. 노출 정도가 다르고, 그것을 가르는 두 축이 있다고 합니다.
크게 보기원문 그림 3. 하니스 강도(가로) × 프런티어 강도(세로). 주황으로 칠한 오른쪽 두 사분면이 독립 AI 앱의 기회. 그림: Primary Venture Partners, 원문에서 인용 목적 전재
가로축은 제품의 얼마만큼이 모델이고 얼마만큼이 그 주위의 하니스인지를 묻는다. 세로축은 오늘의 모델이 그 일을 이미 충분히 감당하는지를 묻는다. 하니스가 무거운 두 사분면이 독립 AI 애플리케이션의 가장 강한 기회다.
각 사분면의 논리는 이렇습니다.
사분면
원문의 예시
무슨 일이 벌어지나
연구소 위험
상품 영역 (모델 중심, 모델이 이미 충분)
통화 녹취, 마케팅 카피
모델이 좋아지고 오픈 웨이트 모델이 따라오면 차별화가 압축된다. "마케팅 카피 쓰는 데 세계적 수학자는 필요 없다"
높음, 혹은 아무도 못 지킴
모델 지배 프런티어 (모델 중심, 모델이 아직 자람)
코딩, 디자인
제품이 곧 모델이다. 연구소가 직접 들어온다(클로드 코드, 코덱스)
높음
방어 가능 구역 (하니스 중심, 모델이 충분)
계약서 수정 표시, 카드 분쟁
무거운 짐이 모델 밖에 있다. 통합, 워크플로, 데이터 구조, 플레이북, 평가, 실행. 모델 발전은 바닥을 높이지만 주위의 시스템을 지우지 않는다
낮음
롱샷 (하니스 중심, 모델이 아직 부족)
기업 시뮬레이션, 공급망 재계획
하니스도 무겁고 모델도 버겁다. 위험하지만 성공하면 가장 크다. 원문이 '최적 타격 지점'으로 표시한 곳
낮음
연구소가 오른쪽으로 옮겨와 그 무거운 짐을 직접 지지 않겠느냐는 질문에 원문은 이렇게 답합니다.
어떤 시장에서는 분명히 그럴 것이다. 하니스가 무거운 제품은 깊은 통합, 도메인 특화 온톨로지와 플레이북, 구현 작업, 롱테일 예외 지원, 그리고 결국 워크플로 자체에 대한 책임을 요구한다. 이 요구는 기능과 산업마다 엄청나게 다르다. 수평적 지능 계층을 개선하고 배포하도록 최적화된 연구소에는 비교 우위가 없다.
원문의 좌표에 업무를 놓아 보세요. 원문의 예시 일곱 개에 이 글에서 셋을 보탰고, 슬라이더로 여러분의 업무도 놓을 수 있습니다.
연구소도 자기 워크플로는 사서 쓴다
원문의 가장 재치 있는 증거는 연구소가 자기 회사를 어떻게 굴리는지입니다.
한 가지 단서는 연구소들이 스스로를 어떻게 운영하느냐다. 앤트로픽은 세일즈포스, 공(Gong), 클레이(Clay) 위에서 자기 영업 스택을 돌리고, 클로드는 그 사이를 잇는 결합 조직이다. 모델을 만드는 사람들조차 워크플로는 남들처럼 산다.
이 대목의 출처는 2026년 SaaStr AI 연례 행사에서 앤트로픽의 산업 부문 총괄 엘리너 도프먼이 한 발표입니다(도프먼 역시 원문 감사 명단에 있습니다). 발표에 따르면 앤트로픽은 2026년 1월 영업 조직을 처음부터 다시 짰는데, 세일즈포스·공·클레이·린데이터·아이언클래드·인터콤·슬랙·지라 같은 기존 도구를 하나도 걷어내지 않고 클로드를 '이음새'로 넣었습니다. 아침 브리핑, 통화 준비, 후속 조치, 경쟁사 정보, 자료 생성이라는 다섯 개의 클로드 스킬이 도구 사이를 오갑니다. 그 결과 2026년 신규 기업 고객의 54%가 셀프서브 경로로 들어왔습니다.
모델을 만드는 회사가 CRM을 직접 만들지 않고 세일즈포스를 씁니다. 원문이 하고 싶은 말이 이 한 문장에 다 들어 있습니다.
6부. 어떤 회사를 고르나 — 실사 질문 9개와 여섯 가지 모양
두 가지를 본다
원문 후반부는 투자자로서의 선별 기준입니다. 씨드 단계에서는 아직 고객 간 학습이 복리로 쌓이는지 볼 수 없으니, 두 가지를 봅니다.
시장 매력도. 그 일이 얼마나 중대한가? 더 나은 전문성이 얼마나 큰 경제적 가치를 여는가? 인건비·지출·위험의 풀이 충분히 큰가? 결과를 관찰하고 채점할 수 있는가?
전문성 힘의 잠재력. 축적된 경험이 시스템을 측정 가능하게 더 낫게 만드는가? 루프가 얼마나 빨리 도는가? 어떤 학습이 고객을 넘어 지속되거나 일반화되는가?
원문은 이것을 실사 질문 9개로 쪼갭니다.
크게 보기원문 그림 4. 실사 쇼트리스트 9문항. (원문 그림에서 '구매자 성숙도' 칸의 설명이 'ROI' 칸과 같은 문장으로 잘못 반복돼 있습니다. 아래 위젯에서는 문항 제목에 맞게 보완했습니다.) 그림: Primary Venture Partners, 원문에서 인용 목적 전재
이 질문은 투자자용으로 쓰였지만, AI를 도입하는 기업에도 그대로 씁니다. "우리가 자동화하려는 이 업무는 결과가 객관적으로 확인되는가? 결정을 처음부터 끝까지 한 시스템 안에서 포착할 수 있는가? 누가 채점하는가?" 이 질문에 답이 없다면, 그 업무에 깔린 에이전트는 백 번을 돌아도 첫 번째와 같습니다. 직접 채점해 보세요.
프라이머리가 찾는 여섯 가지 모양
원문은 이 틀에서 나오는 여섯 가지 회사의 '모양'을 열거합니다.
모양
원문의 설명
원문이 든 예 / 이 글의 보충
새 센서
가장 가치 있는 컨텍스트 중 일부는 아직 존재하지 않는다. 일을 하는 부산물로 새 데이터셋을 만드는 제품. 데이터 수집은 첫걸음이고, 더 오래가는 기회는 그 주위의 온톨로지와 워크플로를 소유하는 것
인스파이렌(Inspiren): 노인 요양 시설 방에 설치한 센서 'AUGi'가 거주자를 막대 인간 골격으로만 표현해 낙상을 예측. 2026년 9월 10일 7,000만 달러 시리즈 C, 누적 2억 2,500만 달러. 그래놀라(Granola): 회의 녹취에서 노트를 만드는 앱, 2026년 3월 15억 달러 가치로 1억 2,500만 달러 조달
풀루프 결정 시스템
중요한 워크플로를 깊이 소유하고 결정 전체를 끝에서 끝까지 보는 제품. 연구소도, 사람에게 넘기는 코파일럿도 볼 수 없는 '의견 있는 스코어북'의 전제 조건
카사프(분쟁), 탭스(청구). '초안만 써 주는' 코파일럿은 결과를 못 보므로 배우지 못한다
구현·데이터 현대화
에이전트 시스템은 밑에 깔린 데이터·통합·워크플로만큼만 좋다. 특히 자체 개발한 레거시가 많은 기업 스택은 에이전트용으로 만들어지지 않았다. 구현을 더 빠르고 믿을 만하게 만드는 새 도구 카테고리
2부의 FDE 폭증이 바로 이 수요. 사람으로 메우던 것을 도구로 바꾸는 회사
효율·지출 관리
AI가 의미 있는 손익 항목이 되면서, 어디에 쓰고 있고 어디서 인력을 대체하고 있으며 실제로 ROI가 나는지 보는 시야가 필요하다
클라우드 시대의 핀옵스(FinOps)가 AI 시대에 반복되는 것
일의 미래
큰 회사는 공식 시스템과 '누구에게 물어야 하는지 아는 사람들'로 굴러간다. 에이전트가 들어오면 사람과 에이전트의 협업, 권한, 인센티브 관리가 새 시스템 문제가 된다
여섯 모양의 공통점을 원문은 한 문장으로 묶습니다. "구매자가 수십 년 동안 벤더에게 원해 온 것과 같다. 워크플로가 분명한 가치를 만들어야 한다. 전문성이 설치 기반 전체에 걸쳐 복리로 쌓여야 한다. 시스템이 더 중대한 일을 맡을수록 벤더가 결과에 더 큰 책임을 져야 한다."
7부. 2026년 한국에서 이 글을 읽는 법
원문은 뉴욕의 투자자가 미국 스타트업을 보며 쓴 글입니다. 그 틀을 한국의 기업과 개발자가 어떻게 쓸 수 있을까요. 세 가지 각도로 보겠습니다.
첫째, '똑똑한 신입' 진단은 한국이 더 뼈아프다
한국 기업의 AI 도입은 2024년부터 2026년까지 '챗봇 → RAG → 에이전트'의 순서로 움직였습니다. 대부분의 프로젝트가 2단계, 즉 사내 문서를 검색해 답하는 단계에서 멈췄습니다. 원문의 진단을 빌리면 그 이유가 보입니다. 문서를 먹인 것은 컨텍스트 를 준 것이고, 그것만으로는 '문서는 다 읽었지만 손이 없는' 신입입니다. 결재 시스템, ERP, 그룹웨어에 닿는 하니스 가 없고, 답이 맞았는지 채점하는 스코어북 은 더더욱 없습니다.
특히 한국은 SOP와 실제 업무의 간극이 큰 편입니다. 규정은 촘촘하지만, 실제 일은 '담당 과장님이 아는 방식'으로 돌아갑니다. 이것이 원문의 튜링 CFO 인용이 한국에서 더 크게 울리는 이유입니다. 그리고 역설적으로 그 간극이 큰 곳일수록 스코어북의 가치가 큽니다. 담당자의 머릿속에만 있던 '예외 처리의 감'을 결정 흔적과 채점으로 남기면, 그 사람이 이동하거나 퇴직해도 판단이 남습니다. 이 블로그의 「동료가 퇴사해도 그의 '판단'은 남는다」가 이 문제를 정면으로 다룹니다.
둘째, 하니스가 무거운 한국형 업무는 널려 있다
원문의 좌표에서 오른쪽, 즉 하니스가 무거운 업무를 찾아보면 한국의 공공과 규제 산업이 그 자리에 잔뜩 있습니다. 코어닷투데이가 광역의회에 구축한 의정 지원 AI가 한 예입니다. 회의록, 조례, 질의·답변, 예산 자료를 GraphRAG로 엮어 질문에 근거와 맥락을 함께 제시하는 시스템인데, 이 일에서 모델이 하는 일은 사실 마지막 한 조각입니다. 무거운 짐은 회의록과 조례 사이의 관계를 정의하는 온톨로지, '어느 회기의 어느 발언이 이 조례 개정의 근거인가'를 잇는 플레이북, 그리고 의원실 보좌진이 답의 정확도를 채점하는 절차에 있습니다. 모델이 다음 세대로 바뀌어도 이 구조는 남고, 오히려 더 좋아집니다. 원문이 '방어 가능 구역'이라 부른 그 자리입니다.
같은 논리가 제조 현장의 품질 판정, 병원의 청구 심사, 보험의 손해사정, 지자체의 민원 분류에 적용됩니다. 결과가 객관적이고(불량 여부, 심사 통과 여부, 지급액), 몇 주 안에 확인되고, 조직마다 비슷한 판단이 반복됩니다. 원문의 실사 질문으로 재면 '시장 매력도'가 높은 업무들입니다. 다만 한국에서는 이 업무들의 데이터가 흩어져 있어 원문이 말한 1단계(연결·정리·표준화) 에 시간이 걸립니다. 그래서 국내에서도 FDE에 해당하는 역할, 즉 고객사에 들어가 배관을 잇는 엔지니어의 수요가 2026년 들어 눈에 띄게 늘었습니다.
셋째, 계약서에 '무엇이 넘어가는가'를 쓰는 시대
4부의 구분, 즉 '원시 데이터는 안 넘어가지만 과정 지식은 넘어간다'는 앞으로 국내 기업 AI 계약의 핵심 쟁점이 될 것입니다. 개인정보보호법과 산업 보안 규정 때문에 한국 기업은 데이터 반출에 민감합니다. 그런데 벤더가 우리 회사에서 배운 '예외 처리 규칙'을 다음 고객에게 쓰는 것은 데이터 반출인가요? 원문의 답은 '아니다, 그것이 CLL의 본질이다'입니다. 고객 입장에서는 그 대가로 '50번째 고객의 이점', 즉 앞선 49개 고객이 겪은 예외를 첫날부터 처리하는 시스템을 받습니다. 이 거래가 공정한지는 계약서가 '과정 지식'의 범위를 얼마나 정확히 정의하느냐에 달려 있습니다.
도입하는 쪽의 체크리스트
원문의 틀을 기업의 AI 도입 순서로 바꾸면 이렇습니다.
1. 결과가 보이는 업무를 고른다
'생산성 향상'이 아니라 회수액·처리 기간·불량률·재작업 건수처럼 이미 재고 있는 숫자와 직결된 업무. 결과가 몇 달 뒤에야 보이는 업무는 뒤로 미룬다.
2. 결정을 끝에서 끝까지 한 곳에 모은다
촉발(접수)부터 해결(처리 완료)까지 시스템 두세 개에 흩어져 있다면, 에이전트 전에 그 흐름을 하나로 잇는다. 이것이 원문의 1단계이자 FDE의 일이다.
3. 스코어북을 먼저 만든다
에이전트를 깔기 전에, 지금 사람이 내리는 결정을 여섯 층으로 기록하기 시작한다. 특히 ⑤ 전문가 채점과 ⑥ 결과. 이 장부가 있어야 에이전트가 들어왔을 때 첫날부터 비교가 된다.
4. 규정이 아니라 예외를 센다
한 달 동안 '규정대로 안 한' 건수를 세어 본다. 그 수가 많을수록 스코어북의 가치가 크고, 그 예외 목록이 곧 에이전트의 첫 플레이북이 된다.
5. 벤더에게 '50번째 고객'을 묻는다
"우리가 몇 번째 고객이고, 앞선 고객에게서 무엇이 넘어오나? 우리에게서 배운 것 중 무엇이 다음 고객에게 넘어가나?" 답이 없으면 그 벤더는 컨설팅 회사다.
원문은 설득력 있지만, 벤처캐피털의 투자 논리라는 점을 잊으면 안 됩니다. 원문 자체와 원문 댓글, 그리고 최근 연구에서 나오는 반론을 정리합니다.
반론 1. 누가 '성공'을 정의하는가
원문 아래 달린 첫 댓글은 이 글의 가장 약한 고리를 정확히 짚었습니다. 독자 마르타 아빌레스 몬탈보는 이렇게 썼습니다.
계속 배우는 루프는 전문성을 복리로 쌓을 수 있지만, 성공에 대한 나쁜 정의도 복리로 쌓을 수 있다. 명시적으로 그어야 할 경계는 국지적 판단과 재사용 가능한 학습 사이의 선이다. 누가 '수용된 결과'를 정의하고, 누가 채점을 뒤집을 수 있고, 어떤 수정이 다음 고객의 출발 가정이 되도록 허용되는가? 거기서 '전문성의 힘'은 능력이 아니라 책임이 된다.
3부의 카사프 예시로 돌아가 봅시다. 분석가가 20년 고객에게 100달러를 환불해 준 것이 '옳았다'고 채점한 근거는 고객이 남았다는 결과였습니다. 그런데 만약 그 은행의 경영진이 '분쟁 비용 최소화'를 성공으로 정의했다면? 같은 결정이 '틀렸다'고 채점되고, 다음 플레이북은 '오래된 고객이어도 거절'이 됩니다. 루프는 그 정의를 의심하지 않습니다. 더 빨리, 더 많은 고객에게 퍼뜨릴 뿐입니다. 스코어북의 ⑤번 층은 누가 쓰느냐에 따라 자산이 되기도, 편향의 증폭기가 되기도 합니다.
반론 2. 메모리로 배워도 망각은 사라지지 않는다
원문은 '고객 간 일반화'를 낙관적으로 그립니다. 그러나 2026년 4월 「계속 학습이 메모리로 옮겨갈 때」 논문의 결론은 조심스럽습니다. 가중치 대신 외부 메모리로 배우면 안정성과 가소성의 딜레마가 사라지는 것처럼 보이지만, 그 문제는 메모리 수준에서 다시 나타납니다. 상세한 궤적을 그대로 저장하면 앞으로의 과제에는 잘 옮겨가지만 심각한 망각이 생기고, 어려운 사례에서는 다른 고객의 경험이 오히려 해가 되는 부정적 전이가 관찰됐습니다. 원문의 언어로 바꾸면, 탭스가 고객 A에게서 배운 'AP 포털 처리법'이 고객 B에게 잘못된 기본값이 될 수 있다는 뜻입니다. 8월의 「하니스 계속 학습」 논문이 '하니스 수준 망각'이라는 이름을 따로 붙이고, 후보 학습을 바로 채택하지 않고 평가기를 거치게 한 이유가 이것입니다. 원문의 CLL 그림에는 이 '보호 장치'가 없습니다.
반론 3. 모델이 좋아지면 하니스의 절반은 녹는다
원문은 "모델 발전은 바닥을 높이지만 주위의 시스템을 지우지 않는다"고 말합니다. 절반만 맞습니다. 2024년의 하니스에는 모델이 못 하는 것을 대신하는 부분(긴 문서 쪼개기, 형식 맞추기, 재시도 루프)과 모델이 알 수 없는 것을 대신 아는 부분(회사의 예외, 시스템 접속, 결과 기록)이 섞여 있었습니다. 앞의 절반은 모델이 좋아지면 녹습니다. 이 블로그의 「플랜 모드는 죽었다」 특집이 그 사례입니다. 원문의 주장이 성립하는 것은 뒤의 절반, 즉 모델이 아무리 좋아져도 알 수 없는 것 을 담은 하니스뿐입니다. 자기 회사의 하니스가 어느 쪽인지 정직하게 나눠 보는 것이 첫 과제입니다.
반론 4. '결과를 판다'는 말의 무게
4부의 '책임의 이동'은 매력적이지만, 벤더가 결과를 보증한다는 것은 벤더가 손실을 물어 준다는 뜻입니다. 분쟁 처리에서 잘못 거절한 100달러는 은행이 고객에게 물어 주지만, 규제 당국의 제재는 은행이 받습니다. 2026년 현재 대부분의 AI 벤더 계약은 '결과 보증'과 거리가 멀고, 책임의 이동은 스코어북이 아니라 보험과 규제가 정합니다. 원문은 방향을 말한 것이지 현재를 말한 것이 아닙니다.
반론 5. 이 글은 포트폴리오를 위한 글이다
원문에 등장하는 카사프, 탭스, 인스파이렌은 모두 프라이머리의 포트폴리오 회사이고, 감사 명단의 여러 인물은 그 회사들의 창업자와 고객입니다. 원문 끝에는 "이 테마로 창업하는 분은 연락 달라"는 이메일도 있습니다. 이 글은 논문이 아니라 투자 테제이고, 인용된 성과 수치는 모두 회사 발표입니다. 이 특집이 원문의 수치를 그대로 옮긴 대목마다 그 점을 표시한 이유입니다.
맺으며: 옛것이 새것이 되려면
원문의 마지막 문단은 이렇습니다.
AI의 첫 단계는 지능을 만드는 것이었다. 다음은 그 지능을 가치 있는 전문성으로 마구(harness)를 채워 부리는 것이다. 기업 구매자는 여전히 예전과 같은 것에 돈을 낼 것이다. 워크플로, 전문성, 책임. AI로 달라지는 것은 응용 계층이 드디어 SaaS가 늘 약속하던 전문성을 제품화할 수 있다는 점이다.
1999년 세일즈포스가 '소프트웨어의 종말'을 선언했을 때, 진짜로 끝난 것은 소프트웨어가 아니라 '설치'였습니다. 2026년 2월 시장이 'SaaS의 종말'을 외쳤을 때, 정말로 끝나 가는 것은 SaaS가 아니라 '전문성이 제품 밖에 사는 방식'입니다. 사람 수대로 돈을 받던 빈 그릇은 위험합니다. 그러나 결정과 결과를 기록하고, 그 기록에서 배우고, 배운 것을 다음 고객에게 넘기는 시스템은, 모델이 좋아질수록 더 좋아집니다.
원문이 던진 질문은 결국 하나입니다. "이 회사는 배치할 때마다 강해지는 전문성 우위를 만들 수 있는가?" 이 질문은 스타트업에만 해당하지 않습니다. AI를 도입하는 모든 조직, 그리고 AI와 함께 일하는 모든 담당자에게 같은 질문이 돌아옵니다. 여러분의 판단은 지금 어디에 기록되고 있습니까? 그 기록에서 누가 배우고 있습니까?