coredot.today
[특집] 엔지니어의 '소모율'이 연봉을 따라잡을 때 — 토큰 예산은 누가, 얼마나, 어떻게 정하는가
블로그로 돌아가기
토큰 예산토큰맥싱tokenmaxxing우버메타클로드노믹스애덤 모세리젠슨 황클라우드제로램프FinOps굿하트의 법칙AI 코딩코딩 에이전트엔지니어링 매니지먼트사내 게이트웨이특집

[특집] 엔지니어의 '소모율'이 연봉을 따라잡을 때 — 토큰 예산은 누가, 얼마나, 어떻게 정하는가

2026년 봄, 같은 규모의 두 회사가 엔지니어 한 명에게 허락한 월 토큰 한도는 5,000달러와 200달러였다. 25배 차이. 3월에 젠슨 황은 '연봉 50만 달러 엔지니어라면 토큰을 25만 달러어치는 써야 한다'고 했고, 4월에 메타의 사용량 순위표는 30일간 60조 토큰을 태우다 닫혔으며, 6월에 우버는 1인당 월 1,500달러 상한을 걸었다. 넉 달 만에 '토큰을 최대로'가 '토큰을 최소로'로 뒤집힌 것이다. 이 글은 그 소동의 한가운데 있는 질문 하나를 붙든다 — 엔지니어 한 명에게 얼마를 쓰게 할 것인가, 그리고 그걸 누가 어떻게 정하는가. 1969년 멀틱스의 '자원 예산'부터 구글의 사내 계산 자원 경매, 클라우드 FinOps까지 60년 된 문제의 계보를 따라가고, 에이전트 코딩의 토큰이 왜 예측 불가능한지(같은 과제에서 최대 30배 차이)를 논문으로 풀며, 한도라는 숫자 하나 밑에 깔려야 하는 여섯 층의 통제 구조와 다섯 가지 정책의 득실, 굿하트의 법칙이 순위표를 무너뜨린 과정, 손익분기 계산, 그리고 네이버·LG·삼성 등 한국 기업의 실제 선택까지 다섯 개의 인터랙티브 도구와 함께 정리했다.

코어닷투데이2026-10-0758분

미터기처럼 돌아가는 토큰 게이지 앞의 엔지니어 — 저울 한쪽에는 급여 봉투, 다른 쪽에는 쓴 토큰크게 보기

프롤로그: 25배

2026년 5월, 클라우드 비용 관리 회사 클라우드제로(CloudZero)의 엔지니어링 총괄 빌 버클리가 블로그에 글 하나를 올렸다. 제목이 내용 전부였다. 「나는 왜 엔지니어들에게 매달 5,000달러어치 클로드 코드 토큰을 주는가」.

글에서 가장 많이 인용된 것은 제목이 아니라 중간에 지나가듯 적힌 한 문장이었다.

"비슷한 규모, 비슷한 단계의 어느 회사 엔지니어링 총괄은 지금 조정 기간이라며 엔지니어당 월 200달러로 상한을 걸고 있다. … 서로 닮은 점이 더 많은 두 엔지니어링 조직 사이에 25배의 격차가 있다."

같은 직군, 같은 도구, 같은 모델. 그런데 한 회사는 한 사람에게 한 달 약 675만 원을 쓰게 하고, 다른 회사는 27만 원에서 막는다. 연봉 테이블이라면 있을 수 없는 편차다. 사무실 임대료도, 노트북 사양도, 클라우드 계정 권한도 회사마다 이 정도로 벌어지지는 않는다.

이 25배가 2026년의 풍경을 요약한다. 아무도 정답을 모른다. 그리고 모르는 채로 각자 숫자를 정하고 있다.

  • 3월, 엔비디아의 젠슨 황은 연봉 50만 달러 엔지니어가 토큰을 25만 달러어치도 쓰지 않았다면 "깊이 우려할 것"이라고 말했다.
  • 4월, 메타에서 직원이 만든 토큰 사용량 순위표 '클로드노믹스'가 외부에 알려졌다. 30일간 60조 토큰. 이틀 뒤 순위표는 닫혔다.
  • 6월, 우버는 에이전트 코딩 도구 하나당 월 1,500달러 상한을 걸었다. 한 해 예산을 넉 달 만에 다 쓴 뒤였다.
  • 7월, 메타의 애덤 모세리는 "1~2년 안에 뛰어난 엔지니어의 소모율이 연봉과 같아질 수 있다"며 그때는 상한이 필요할 것이라고 했다.
  • 9월, 네이버가 임직원 1인당 월 1,000달러 한도의 엔터프라이즈 계정을 제공한다는 보도가 나왔다.

토큰 값이 왜 떨어지는데 청구서는 커지는지는 코어닷이 이미 다뤘다(제번스의 역설과 추론 경제학). 한 세션 안에서 토큰이 어디로 새는지도 다뤘다(클로드 코드 세션 경제학). 이 글은 그 다음 질문을 붙든다. 엔지니어 한 명에게 얼마를 쓰게 할 것인가. 그리고 그 숫자를 누가, 무엇을 근거로 정하는가. 기술 문제처럼 보이지만, 들여다보면 60년 묵은 조직 문제다.

💡 이 글은 학교는 손실 함수다 — 채점할 수 없는 일을 찾아서의 후속편이다. 그 글에서 필 첸은 다음 10년의 핵심 기술을 "문제 선정과 자원 배분 — 중요한 문제에 토큰과 시간을 배분하는 것"이라 했다. 이번 글은 그 '배분'을 회사 쪽에서 본다.


1부. 넉 달 — '토큰을 최대로'에서 '토큰을 최소로'까지

3월: 토큰이 채용 조건이 되다

2026년 3월 엔비디아 GTC 주간, 젠슨 황은 팟캐스트 올인(All-In)에서 이렇게 말했다. "연봉 50만 달러짜리 엔지니어가 토큰을 최소 25만 달러어치 쓰지 않았다면 나는 깊이 우려할 것이다." 5,000달러어치밖에 안 썼다면? 그는 칩 설계자가 종이와 연필로 일하는 것에 비유했다. 기조연설에서는 한 걸음 더 나갔다. "연봉의 절반쯤을 토큰으로 얹어 줄 것이다. 그래야 열 배로 증폭된다. 이제 이것이 실리콘밸리의 채용 도구가 됐다 — '그 자리에는 토큰이 얼마나 딸려 옵니까?'"

벤처 투자자 토마시 퉁구스는 같은 달 추론 비용을 급여·보너스·주식에 이은 엔지니어 보상의 '네 번째 구성 요소'라 불렀다. Y 콤비네이터의 스타트업 가이드에는 "인원을 늘리지 말고 토큰을 늘려라"는 문장이 실렸다. 이 분위기에 이름이 붙었다. 토큰맥싱(tokenmaxxing).

4월: 순위표가 무너지다

메타 사내에는 직원이 만든 대시보드가 있었다. 이름은 '클로드노믹스(Claudeonomics)'. 8만 5,000명이 넘는 직원의 토큰 사용량을 집계해 상위 250명을 보여 줬고, '토큰 레전드', '캐시 위저드' 같은 칭호를 붙였다. 포춘 보도에 따르면 30일간 집계된 사용량은 60조 토큰을 넘었고, 1위 사용자는 2,810억 토큰을 썼다. 당시 최상위 모델 정가로 환산하면 약 140만 달러, 한 사람이 한 달에 쓴 양이다.

일부 직원이 에이전트를 몇 시간씩 그냥 돌려 두었다는 증언이 뒤따랐다. 보도가 나간 지 이틀 만에 대시보드는 "외부 유출"을 이유로 닫혔다.

같은 달, 우버의 최고기술책임자 프라빈 네팔리 나가는 디 인포메이션에 이렇게 말했다. "원점에서 다시 그리고 있다. 필요하리라 생각했던 예산은 이미 날아갔다." 보도들을 종합하면 우버는 2025년 12월 클로드 코드를 전사에 풀었고, 직원들에게 AI를 "가능한 한 많이" 쓰라고 독려했으며, 사용량 순위표도 운영했다. 에이전트 코딩 사용자는 한 달 사이 엔지니어의 32%에서 84%로 뛰었고, 많이 쓰는 사람은 월 500~2,000달러가 나왔다.

6월: 상한이 내려오다

6월 2일 블룸버그는 우버가 에이전트 코딩 도구 하나당 월 1,500달러 상한을 도입했다고 보도했다. 클로드 코드와 커서가 각각 따로 계산되므로 두 도구를 다 채우면 월 3,000달러다. 내부 대시보드로 추적하고, 승인을 받으면 넘길 수 있다. 개발자 사이먼 윌리슨은 이튿날 계산을 올렸다. 두 도구를 상한까지 쓰면 연 3만 6,000달러, 우버 엔지니어 보상 중앙값 33만 달러의 약 11%.

비슷한 시기에 아마존은 사내 사용량 순위표 '키로랭크'를 접었고, 깃허브 코파일럿은 정가 기준 토큰 크레딧 과금으로 전환하며 기업·비용센터·사용자 단위 예산 기능을 붙였다. 박스의 에런 레비는 "하룻밤 사이에 나타났다. 아무도 토큰맥싱을 예산에 넣지 않았다"고 말했다. 쇼피파이의 토비 뤼트케도 순위표가 "즉시 나쁜 효과로 이어진다"며 직원에게 자기 백분위만 보여 주는 방식으로 바꿨다고 전해진다. 반대말도 생겼다. 토큰미니마이징(tokenminimizing).

7~8월: 질문이 바뀌다

7월, 마이크로소프트는 부서별 '토큰 예산 목표'를 도입했다. 총괄 부사장 제이 파리크의 메모에는 이런 문장이 있었다. "토큰맥싱은 우리가 최적화하는 대상이 아니다. 토큰을 줄이는 것도 아니다. 우리는 토큰당 더 큰 영향을 최적화한다."

8월 우버의 2분기 실적 자료에는 그 사이 무슨 일이 있었는지가 적혀 있다. "용도별로 더 나은 기본값을 정하고, 일부 작업을 저가 또는 오픈 가중치 모델로 옮기고, 직원이 자기 지출을 더 분명히 이해하고 관리하게 함으로써 토큰 지출을 최적화하고 있다. 그 결과 도입이 계속 늘었는데도 토큰당 비용이 지난 몇 달간 내려갔고, 전체 AI 지출을 대체로 안정적으로 유지할 수 있었다." CTO 나가는 X에 썼다. "이른바 토큰맥싱 시대의 끝에 다가가고 있다. … 접근을 제한해서가 아니라, 효율을 엔지니어링 문제로 다뤘기 때문이다."

왼쪽 회사는 토큰 세 개가 든 동전 지갑을, 오른쪽 회사는 토큰이 넘치는 통을 건넨다 — 같은 직군, 25배크게 보기

그래서 지금 다들 얼마나 쓰나

지출 관리 회사 램프(Ramp)가 2026년 6월 공개한 벤치마크가 가장 넓은 그림을 준다. 자사 토큰 지출 관리 고객사의 4월 데이터다.

지표값읽는 법
회사당 월 토큰 지출 중앙값2,246달러대부분의 회사에서 토큰은 아직 작은 항목이다
회사당 월 지출 평균140,842달러평균이 중앙값의 63배 — 소수가 엄청나게 쓴다
상위 10% / 상위 1% 회사73,030달러 / 831,338달러꼬리가 길다
직원 1인당 월 지출 중앙값46달러가운데 50%가 3~352달러, 100배 넘는 폭
토큰 사용량 (2025.1 → 2026.4)+1,001%같은 기간 지출은 +497% — 단가는 내렸다
프리미엄 모델 비중토큰의 45.8%, 비용의 55.9%1년 전 비용 비중은 5.7%였다

중앙값 46달러와, 우버의 1,500달러, 클라우드제로의 5,000달러, 젠슨 황의 월 2만 달러가 한 시대에 공존한다. 직접 눈금 위에 올려 보자.

눈금자가 보여 주는 것은 합의의 부재다. 가장 낮은 기준점과 가장 높은 기준점 사이가 네 자릿수 벌어져 있다. 성숙한 비용 항목은 이렇게 생기지 않는다.


2부. 왜 하필 '사람당 예산'인가 — 좌석이 미터기로 바뀌다

정액 좌석의 시대가 끝났다

2024년까지 개발 도구 비용은 좌석(seat) 단위였다. IDE 라이선스든 코드 자동완성이든 한 사람당 월 10~40달러. 누가 많이 쓰든 적게 쓰든 값이 같았고, 예산은 인원수만 곱하면 나왔다. 재무팀이 엔지니어 개개인의 사용 습관을 궁금해할 이유가 없었다.

에이전트가 이 구조를 깼다. 2025년 여름이 분기점이다. 커서는 6월에 '월 500회 요청'을 달러 크레딧 풀로 바꿨다가 깜짝 청구가 속출하자 7월 4일 "명확히 소통하지 못했다. 전적으로 우리 책임"이라며 환불했다. 앤트로픽은 7월 말 클로드 코드에 주간 한도를 도입하며 이유를 밝혔다. 24시간 백그라운드로 돌리는 사용자가 있고, 한 명은 월 200달러 요금제에서 수만 달러어치 모델 사용량을 썼다는 것이다. 같은 해 8월 테크크런치는 코드 생성 스타트업들의 매출총이익률이 "중립이거나 마이너스"라는 투자자의 말을 실었다.

2026년에는 과금 단위 자체가 바뀌었다. 6월에 깃허브 코파일럿이 정가 기준 토큰 크레딧으로 전환했고, 오픈AI 코덱스도 토큰 기반 크레딧으로 옮겨 갔다. 좌석은 미터기가 됐다. 미터기가 달리면 "누가 얼마나 썼나"가 처음으로 의미 있는 질문이 된다.

토큰은 어디로 가는가 — 세 줄 요약

상세한 메커니즘은 세션 경제학 편에 있으니 여기서는 예산을 이해하는 데 필요한 세 가지만 짚는다.

① 매번 다시 읽는다
에이전트는 한 턴마다 대화 전체를 다시 보낸다. 앤트로픽 문서의 예시 세션은 입력 1,200, 출력 5,300 토큰에 캐시 읽기 94만 토큰이다. 새로 쓴 글자의 약 150배를 '다시 읽는' 데 쓴다. 그래서 누적 비용은 턴 수의 제곱에 가깝게 자란다. 한 분석에서는 긴 대화 끝에 캐시 읽기가 총비용의 87%였다.
② 에이전트는 배수다
앤트로픽은 자사 연구 시스템을 설명하며 에이전트가 채팅의 약 4배, 다중 에이전트가 약 15배의 토큰을 쓴다고 밝혔다. 클로드 코드 문서는 에이전트 팀이 표준 세션의 약 7배라고 적는다. 일하는 방식을 바꾸면 소모량이 자릿수로 바뀐다.
③ 평균은 작고 꼬리는 길다
앤트로픽 문서 기준 클로드 코드의 평균은 개발자 1인당 활성일 하루 약 13달러, 월 150~250달러이고 90%가 하루 30달러 아래다. 상한이 문제 되는 사람은 소수다. 그런데 그 소수가 예산을 좌우한다.

진짜 문제: 예측이 안 된다

예산이라는 제도는 지출을 미리 어림할 수 있다는 전제 위에 선다. 에이전트 코딩은 이 전제를 흔든다. 2026년 4월 공개된 논문 「AI 에이전트는 당신의 돈을 어떻게 쓰는가(How Do AI Agents Spend Your Money?)」(에릭 브리뇰프슨·앨릭스 펜틀랜드 등이 참여한 연구진, arXiv:2604.22750)가 이를 숫자로 보여 줬다. 프론티어 모델 여덟 개를 실제 저장소 버그 수정 벤치마크(SWE-bench Verified)에 돌리고 토큰을 전부 계측한 연구다.

논문의 그림무엇을 보여 주나예산에 주는 의미
그림 1에이전트 코딩은 단발 코드 추론의 약 3,500배, 여러 턴 코드 채팅의 약 1,200배 토큰을 쓴다. 캐싱을 해도 비용을 끄는 것은 출력이 아니라 입력이다'채팅 시절' 지출로 에이전트 예산을 짜면 자릿수가 틀린다
그림 2문제별 비용 분포의 오른쪽 꼬리가 길다. 같은 과제를 다시 돌려도 최대 30배 차이가 난다한 번의 실행 비용은 주사위다. 실행당 상한이 필요한 이유
그림 3정확도는 중간 비용대에서 정점을 찍고, 그 뒤로는 포화하거나 떨어진다많이 쓴 실행이 좋은 실행이 아니다
그림 4비싼 실행에는 같은 파일을 반복해서 열고 고치는 패턴이 많다낭비에는 관측 가능한 모양이 있다
그림 5전문가가 매긴 난이도는 비용을 약하게만 예측한다(켄달 타우 0.32)'어려운 일이니 많이 들겠지'라는 어림이 잘 안 맞는다
본문모델에게 자기 비용을 예측시켜도 상관이 최대 0.39. "모든 모델이 실제 토큰 사용량을 체계적으로 과소평가한다"에이전트에게 견적을 물어봐도 낮게 부른다

같은 해 1월의 논문 「토크노믹스」는 다중 에이전트 개발 프레임워크에서 토큰의 59.4%가 코드 리뷰 단계에서 쓰인다는 것을 보였다. "에이전트 소프트웨어 공학의 주된 비용은 최초의 코드 생성이 아니라 자동화된 다듬기와 검증에 있다."

정리하면 이렇다. 좌석 시절에는 지출이 인원수의 함수였다. 지금은 일하는 방식의 함수이고, 그 함수에는 큰 잡음이 섞여 있다. 사람마다 다르고, 과제마다 다르고, 같은 과제도 돌릴 때마다 다르다. 그래서 회사들은 처음으로 '사람당 얼마'를 정해야 하게 됐는데, 근거로 삼을 평균이 믿을 만하지 않다.

한국어 사용자가 하나 더 알아야 할 것

토큰은 글자가 아니다. 같은 내용이라도 언어에 따라 토큰 수가 다르다. 2023년 옥스퍼드 연구진의 논문(「언어 모델 토크나이저는 언어 간 불공정을 만든다」, NeurIPS 2023)은 같은 문장을 여러 언어로 옮겨 토큰 수를 쟀고, 영어 대비 일본어가 2.3배, 중국어 간체가 1.9배라는 '할증'을 보고했다. 논문의 표현으로 "토큰화 할증은 곧바로 비용 할증으로 이어진다." 2026년 7월 한 업체가 정렬된 지문 세 개로 잰 값에서는 클로드에서 한국어가 같은 내용의 영어보다 약 1.9배 많은 토큰을 썼다. 표본이 작은 측정이지만 방향은 일관된다.

코드는 영어에 가깝게 토큰화되므로 코딩 에이전트 지출 전체가 두 배가 되지는 않는다. 다만 요구사항 문서, 리뷰 코멘트, 프롬프트를 한국어로 길게 쓰는 팀이라면 달러 한도가 같아도 체감 한도는 더 낮다. 하나 더. 앤트로픽은 가격표에 클로드 4.7 이후의 새 토크나이저가 같은 텍스트에 약 30% 더 많은 토큰을 만든다고 적어 두었다. 단가표가 그대로여도 토크나이저가 바뀌면 값이 바뀐다.


3부. 60년 된 문제 — 계산에 값을 매기고 나눠 주는 일

토큰 예산은 새로워 보이지만, '공유 계산 자원을 누구에게 얼마나 줄 것인가'는 컴퓨터만큼 오래된 문제다. 지금이 네 번째 반복이다.

첫 번째: 메인프레임과 '자원 예산'

1960년대 컴퓨터는 방 하나를 차지했고, 한 대를 수백 명이 나눠 썼다. MIT의 시분할 시스템 멀틱스(Multics)를 만든 코르바토와 솔처는 1972년 회고 논문에서 이렇게 적었다. 멀틱스는 1969년 10월 "비용 회수(cost-recovery) 과금 방식으로" 일반에 공개됐다. 시스템 관리자는 "새 사용자를 등록하고, 자원 할당량을 부여하고, 정기 청구서를 생성"했고, 프로젝트 관리자는 "프로젝트를 대신해 시스템 자원 예산을 관리할 권한을 위임받았다."

개인 할당량, 프로젝트 예산, 권한 위임. 57년 전 문서에 2026년 토큰 예산의 부품이 전부 들어 있다. 그들의 비전은 계산을 "전력 회사나 전화 회사와 비슷한" 공공재로 만드는 것이었다.

1960년대 전산실 — 천공 카드를 든 학생들의 줄과, 계산 시간 장부에 도장을 찍는 직원크게 보기

두 번째: 무제한의 유혹

1996년 12월 1일, 5시간에 9.95달러를 받던 AOL이 월 19.95달러 무제한 요금제를 내놓았다. 하루 접속 세션은 380만에서 900만으로 뛰었고, 모뎀 회선이 감당하지 못해 통화 중 신호가 이어졌으며, 회사는 환불과 소송에 시달렸다.

교훈은 두 겹이다. 무제한은 잠재 수요를 드러낸다. 그리고 정액제를 내놓은 쪽이 용량을 감당하지 못하면 미터기가 돌아온다. 2025년 여름 AI 코딩 도구들에서 일어난 일이 정확히 이것이다. 순서만 반대였다. 이번에는 무제한이 먼저 나왔고, 수만 달러어치를 쓰는 사용자가 드러난 뒤에 미터기가 달렸다.

세 번째: 클라우드와 FinOps

2006년 AWS가 나오면서 서버는 구매 품의 대상에서 신용카드 결제 대상이 됐다. 엔지니어가 몇 분 만에 서버를 띄울 수 있게 되자 속도가 붙었고, 이듬해부터 청구서 충격이 왔다. 지출 결정이 재무팀의 책상에서 엔지니어의 키보드로 내려왔는데, 엔지니어는 청구서를 보지 않았기 때문이다.

업계가 내놓은 답이 FinOps다. 2019년 재단이 출범했고, 핵심 원칙은 삭감이 아니라 가시성이었다. 쓴 사람이 자기 지출을 본다. 단가가 아니라 단위 경제성(결과 하나당 비용)을 본다. 2026년 FinOps 재단의 조사에서 응답 조직의 98%가 AI 지출을 관리 대상에 넣었다고 답했다. 2년 전에는 31%였다. 재단을 만든 J.R. 스토먼트는 5월에 이렇게 썼다. "토큰 경제학의 목적은 토큰 소비를 최소화하는 것이 아니다. 토큰 소비를 가치에 연결하는 것이다."

그리고 구글의 실험: 할당량을 경매로

이 계보에서 가장 흥미로운 문서는 2009년 구글 엔지니어들이 발표한 논문 「시장 경제를 이용한 전 지구적 클러스터의 계산 자원 공급」이다. 문제는 지금과 닮았다. 사내 팀들에게 계산 자원을 수동으로 할당했더니 인기 클러스터는 모자라고 비인기 클러스터는 남았다. 팀마다 진짜 필요가 얼마인지 운영자는 알 수 없었다. 논문의 한 문장이 문제의 핵심을 짚는다.

"이 선호는 사용자들은 잘 알고 있지만, 시스템 운영자는 반드시 알지 못한다."

해법은 주기적 경매였다. 팀들이 배정받은 예산으로 자원에 입찰하고, 혼잡한 자원일수록 시작 가격이 높다. 논문은 가격이 "사용자가 가용 자원을 가장 잘 활용하도록 시스템을 설계할 동기를 제공한다"고 썼다.

토큰 예산에 그대로 옮겨 보자. 어떤 엔지니어가 5,000달러를 값지게 쓸 수 있고 어떤 엔지니어가 200달러도 낭비하는지, 본인과 가까운 동료는 알지만 재무팀은 모른다. 일괄 상한은 이 정보를 버리는 정책이다. 좋은 정책은 그 정보를 끌어내는 장치를 가져야 한다. 5부에서 이 문장으로 돌아온다.


4부. 아키텍처 — 한도라는 숫자 하나 밑에 깔려야 하는 것

"1인당 월 1,500달러"는 문장으로는 한 줄이다. 그런데 이 한 줄이 실제로 지켜지려면 요청 한 건 한 건이 지나가는 길목마다 장치가 있어야 한다. 이것을 통제면(control plane)이라 부르자. 여섯 층이다.

이 여섯 층은 추상이 아니다. 2026년 가을 현재 주요 제공사와 도구가 실제로 내놓은 기능에 하나씩 대응한다.

층제공사·도구의 실제 기능주의할 점
① 신원엔터프라이즈 요금제의 SSO 연동, 사용자·그룹 단위 계정개인 카드로 결제한 구독은 이 층 바깥에 있다
② 게이트웨이LiteLLM·Portkey·Helicone 같은 프록시, 클라우드 사업자의 AI 게이트웨이국내 게이트웨이 시장은 "아직 형성되는 단계"(디일렉, 2026-09)
③ 예산 원장앤트로픽: 조직·그룹·개인 단위 지출 한도, 엔터프라이즈용 월별 개인 한도 상향과 증액 요청 승인 대기열. 오픈AI: 조직·프로젝트 하드 리밋. 커서: 팀 한도(개인·그룹 한도는 엔터프라이즈). 깃허브: 기업·비용센터·사용자 예산오픈AI 문서는 "집행이 즉시 이뤄지지는 않는다"고 적는다. 한도는 약간 넘칠 수 있다
④ 정책기본 모델 지정, 실행 1회당 상한(클로드 코드의 최대 예산 플래그), 추론 강도 기본값기본값이 지출의 대부분을 결정한다
⑤ 관측·귀속사용량 대시보드, 요청 태그, 팀별 분석개인 순위표로 쓰는 순간 6부의 문제가 시작된다
⑥ 성과 연결표준이 없다. FinOps 재단도 '토큰당 비용'은 정의했지만 '결과당 비용'의 공식 정의는 아직 없다가장 중요하고 가장 비어 있는 층

요금소를 지나는 로봇 배달부들 — 미터기, 장부, 그리고 작은·중간·큰 모델로 갈라지는 세 갈래 길크게 보기

우버가 8월에 밝힌 조치를 이 구조에 대 보면 흥미롭다. "용도별 더 나은 기본값"은 ④ 정책, "저가·오픈 모델로 이전"도 ④, "직원이 자기 지출을 이해하고 관리"는 ⑤ 관측이다. 6월의 상한은 ③ 원장이다. 우버는 ③을 먼저 걸었고, 실제로 지출을 안정시킨 것은 ④와 ⑤였다. 코인베이스의 브라이언 암스트롱도 6월에 비슷한 목록을 내놓았다. 기본값, 라우팅, 캐싱, 군더더기 없는 컨텍스트, 가시성. 그 결과 사용량은 최고치인데 지출은 정점의 절반 가까이로 내려갔다고 했다. "목표는 사용을 억누르는 것이 아니다. 지수적 성장을 지속 가능하게 만드는 인프라를 짓는 것이다."

순서의 교훈이 여기 있다. 상한은 가장 빨리 걸 수 있는 장치지만 가장 거친 장치다. 아래층(신원·게이트웨이)이 없으면 상한은 집행되지 않고, 위층(관측·성과)이 없으면 상한은 근거 없는 숫자가 된다.


5부. 다섯 가지 정책 — 같은 팀에 다른 규칙을 적용하면

이제 본론이다. 얼마를, 어떤 규칙으로 줄 것인가. 2026년에 실제로 관찰되는 정책은 다섯 갈래로 나뉜다.

정책실제 사례장점약점
일괄 상한우버(도구당 월 1,500달러), 익명의 '월 200달러' 회사예측 가능, 설명하기 쉬움가장 잘 쓰는 사람부터 막힌다
무제한도입 초기의 우버·메타, 데이터브릭스(보도 기준)학습이 빠르다, 아무도 안 막힌다지출이 커지면 유지 불가
무제한 + 순위표메타 클로드노믹스, 아마존 키로랭크, 초기 쇼피파이도입률이 빨리 오른다사용량 자체가 목표가 된다
팀 공동 예산부서별 토큰 예산 목표(마이크로소프트)팀 사정에 맞게 내부 배분공유지의 비극, 회계연도 말 몰아 쓰기
기본 한도 + 근거 있는 상향클라우드제로(넉넉한 한도), LG전자(기본 예산 + 초과 시 품의), 넷마블(직무별 차등)잘 쓰는 사람을 안 막고 낭비도 안 늘린다'누가 잘 쓰는가'를 알아야 한다

말로만 보면 감이 안 온다. 성향이 서로 다른 엔지니어 12명에게 다섯 정책을 차례로 적용해 보자. 한도 슬라이더도 움직여 보라.

모형에서 확인할 것은 세 가지다.

첫째, 일괄 상한은 평균을 지키고 꼬리를 자른다. 한도를 낮출수록 '달러당 가치'가 가장 높은 사람의 수요부터 잘린다. 클라우드제로의 버클리가 정확히 이 점을 말했다. "대부분의 사람에게 상한은 구속력이 없다. 상한을 밀어붙이는 소수에게 상한은 가능하게 하는 장치다." 그리고 같은 글의 다른 문장. "토큰 청구서가 가장 큰 엔지니어가 가장 생산적인 엔지니어는 아니다." 두 문장은 모순이 아니다. 많이 쓰는 사람 안에 최고와 최악이 섞여 있다는 뜻이다. 모형의 K와 L이 그 둘이다.

둘째, 공동 예산은 공유지의 비극을 부른다. 팀 총액만 정해 두면 먼저, 많이 쓰는 사람이 몫을 가져간다. 여기에 회계연도 효과가 겹친다. 하버드의 리브먼과 머호니는 미국 연방 조달 데이터를 분석해 회계연도 마지막 주의 지출이 주 평균의 4.9배이고, 그 주에 발주된 IT 프로젝트 중 최하 품질 등급의 비율이 25.8%로 연중 전체(3.0%)의 여덟 배가 넘는다는 것을 보였다(아메리칸 이코노믹 리뷰, 2017). '안 쓰면 깎인다'는 예산은 나쁜 지출을 만든다. 월 단위로 소멸하는 토큰 한도에도 같은 힘이 작용한다.

공동 우물에 빨대를 꽂고 대부분을 마셔 버리는 큰 로봇, 작은 컵을 들고 줄 선 엔지니어들크게 보기

셋째, 다섯 번째 정책만이 정보를 쓴다. '기본 한도 + 근거 있는 상향'이 순가치가 가장 높게 나오는 이유는 단순하다. 누가 잘 쓰는지에 대한 정보를 배분에 반영하는 유일한 정책이기 때문이다. 2009년 구글 논문의 문장을 다시 가져오면, 그 정보는 "사용자는 잘 알지만 운영자는 모른다." 모세리가 한 말도 같은 방향이다. 상한은 그 엔지니어가 "투자 대비 효과가 양(+)인 방식으로 쓸 수 있다는 신뢰에 비례"해야 한다는 것이다.

문제는 그 '신뢰'의 근거다. 근거 없이 상향을 해 주면 목소리 큰 사람이 가져가고, 사용량을 근거로 삼으면 순위표와 같은 함정에 빠진다. 다음 장이 그 함정이다.


6부. 측정의 함정 — 순위표는 왜 무너졌나

굿하트와 캠벨

1975년 영국은행의 경제학자 찰스 굿하트는 통화 정책에 관한 논문에서 이렇게 썼다. "관찰된 어떤 통계적 규칙성도, 통제 목적으로 압력이 가해지면 무너지는 경향이 있다." 이듬해 사회과학자 도널드 캠벨은 더 길게 말했다. "어떤 정량적 사회 지표든 사회적 의사결정에 많이 쓰일수록, 부패 압력에 더 취약해지고, 그것이 감시하려던 사회 과정을 더 왜곡하고 타락시키기 쉽다."

메타의 클로드노믹스가 교과서적 사례다. 토큰 사용량은 원래 'AI를 실제로 쓰고 있는가'의 꽤 괜찮은 대리 지표였다. 그것을 순위와 칭호로 만들자 지표가 목표가 됐다. 엔지니어링 리더 매체 리드데브의 2026년 8월 조사에 따르면 조직의 58%가 AI의 영향을 토큰 사용량으로 측정하는데, 그중 57%가 그 방식이 효과가 없다고 답했다. 효과 있다는 응답은 19%였다. 같은 기사에 실린 한 엔지니어링 리더의 목록이 지표가 어떻게 조작되는지를 보여 준다.

"아무 일 없이 켜 둔 에이전트, 엔지니어가 이미 답을 아는 질문, 필요 이상으로 잘게 쪼갠 작업, 사소한 일에 고른 가장 비싼 추론 등급."

모세리의 표현은 더 짧다. "토큰 소각로를 만드는 건 어렵지 않다. 그리고 그건 별 가치를 만들지 않는다."

토큰을 용광로에 퍼 넣어 순위표의 막대를 키우는 사람들 — 옆에서는 토큰 한 줌으로 다리를 완성한 엔지니어가 눈에 띄지 않는다크게 보기

학계도 이 단어를 받아들였다. 2026년 7월 논문 「토큰맥싱에 가장 좋은 프로그래밍 언어」는 토큰맥싱을 "비용만큼의 가치가 있는지와 무관하게 LLM 지출을 늘리려는 목적으로 에이전트에게 일을 시키는 것"으로 정의했다. 그리고 덤으로 재미있는 측정을 하나 내놓았다. 에이전트는 이미 올바른 해답에 도달한 뒤에도 중앙값 기준 1,173~7,311 토큰을 더 내놓는다. 사람이 조작하지 않아도 낭비는 기본값으로 섞여 있다.

많이 쓰면 좋아지는가 — 논문들의 답

'더 많은 토큰 = 더 좋은 결과'라는 가정 자체를 검증한 연구가 있다.

프린스턴대 연구진의 2024년 논문 「중요한 AI 에이전트(AI Agents That Matter)」는 에이전트 평가가 정확도만 보고 비용을 보지 않는다고 비판했다. 절 제목부터 "AI 에이전트 평가는 비용 통제가 되어야 한다"다. 논문의 그림 1은 코딩 벤치마크에서 정확도와 비용을 두 축에 놓은 산점도인데, 복잡한 최신 에이전트들이 단순한 기준선(실패하면 재시도, 값싼 모델로 시작해 실패할 때만 상위 모델로 승급)보다 비싸면서 더 정확하지도 않았다. 초록의 문장은 이렇다. "최신 에이전트들은 불필요하게 복잡하고 비싸며, 학계는 정확도 향상의 출처에 대해 잘못된 결론에 도달했다."

같은 팀의 2025년 후속 연구 HAL(종합 에이전트 리더보드)은 규모를 키웠다. 모델 9개, 벤치마크 9개, 2만 1,730회 실행, 약 4만 달러.

정확도-비용 최적선 위에 있는 모델
3분의 1 미만
가장 비싼 모델이 최적선에 오른 벤치마크
9개 중 1개
추론 강도를 올려도 정확도가 같거나 낮아진 조합
36개 중 21개

극단적 사례도 실려 있다. 웹 탐색 벤치마크에서 한 조합은 171달러, 다른 조합은 1,577달러가 들었는데 정확도 차이는 2%포인트였다. 9배 비싼 쪽이 9배 좋지 않았다.

2부에서 본 논문의 그림 3도 같은 말을 한다. 정확도는 중간 비용대에서 정점을 찍는다. 그리고 앤트로픽의 다중 에이전트 글에서 흔히 인용되는 문장 — "토큰 사용량이 성능 분산의 80%를 설명한다" — 은 특정 탐색형 벤치마크에서의 결과다. 토큰이 성능을 사는 과제가 있고, 사지 못하는 과제가 있다. 어느 쪽인지 구분하는 능력이 곧 배분 능력이다.

체감은 측정이 아니다

마지막 함정은 사람 쪽에 있다. METR의 2025년 무작위 대조 시험에서 숙련 개발자들은 AI로 20% 빨라졌다고 느꼈지만 실제로는 19% 느렸다. 2026년 2월 갱신(개발자 57명, 과제 800여 개)에서는 방향이 바뀌어 복귀 참가자가 18% 빨라진 것으로 나왔지만 신뢰구간이 0을 포함해 유의하지 않았다. 더 중요한 것은 METR 스스로 밝힌 한계다. 개발자의 30~50%가 "AI 없이 하기 싫은 과제는 아예 제출하지 않았다"고 말했고, 에이전트 여러 개를 동시에 돌리는 사람의 시간 측정은 "신뢰할 수 없다"고 했다. 측정 방법이 일하는 방식의 변화를 따라가지 못하고 있다.

조직 수준 데이터도 깔끔하지 않다. 패로스 AI가 개발자 1만 명 이상을 분석한 2025년 보고서에서 AI 도입 팀은 병합한 변경이 98% 늘었지만 리뷰 시간도 91% 늘었고, "회사 수준에서 AI 도입과 개선 사이에 유의한 상관을 관찰하지 못했다." 우버의 최고운영책임자 앤드루 맥도널드는 5월 팟캐스트에서 같은 고백을 했다. 토큰 지출과 성과를 잇는 "그 연결 고리가 아직 없다. 선을 긋기가 매우 어렵다."

바닥까지 굴러 내려간 긴 영수증과 선반 위의 완성품 몇 개 — 둘 사이에 선을 긋는 분석가크게 보기

그러면 무엇을 재야 하나

완벽한 지표는 없다. 다만 덜 속는 방법은 있다.

✕
재지 말 것: 개인별 토큰 사용량 순위
입력을 재서 성과로 읽는 순간 굿하트가 작동한다. 메타·아마존·쇼피파이가 모두 접었다. 개인에게는 자기 수치와 분포상 위치만 보여 주면 충분하다.
①
결과 하나당 비용을, 품질 지표와 짝지어
병합된 변경 한 건, 해결된 장애 한 건에 든 토큰. 단독으로 보면 '작게 쪼개 많이 병합하기'로 조작되므로 2주 내 재수정률, 리뷰 반려율과 반드시 나란히 본다.
②
사람이 아니라 작업 유형별로
마이그레이션, 테스트 작성, 장애 분석, 신규 기능. 유형별 중앙값과 꼬리를 보면 어디에 토큰이 값을 하는지 드러난다. 개인 비교보다 조작 유인이 훨씬 약하다.
③
낭비의 모양을 직접 찾는다
같은 파일 반복 열기, 캐시 적중률 급락, 사람 입력 없이 몇 시간 도는 세션, 사소한 작업에 최상위 추론 등급. 논문이 보여 준 대로 비싼 실행에는 관측 가능한 패턴이 있다.
→
목표 문장: "토큰당 더 큰 영향"
마이크로소프트 메모의 표현이 지금까지 나온 것 중 가장 정확하다. 더 많이도 아니고 더 적게도 아니다. 분자를 키우는 것이 목표이고, 분모는 그 수단이다.

7부. 손익분기 — 그 한도는 비싼가

상한을 정할 때 가장 흔한 실수는 토큰을 도구 비용과 비교하는 것이다. 월 20달러짜리 구독에 익숙한 눈에 월 1,500달러는 터무니없어 보인다. 그런데 비교 대상이 틀렸다. 토큰이 대체하거나 증폭하는 것은 다른 도구가 아니라 사람의 시간이다.

버클리의 계산이 가장 단순하다. 미국 엔지니어 1인의 총비용(급여·복리후생·간접비)을 연 25만 달러로 잡는다. 월 5,000달러 한도는 연 6만 달러, 인건비의 24%다. 엔지니어 네 명이 상한을 다 채우면 한 명을 더 뽑는 값이 된다. 그의 논리는 이렇다. "AI가 기존 엔지니어 네 명의 산출을 끌어올린다면, 한 명 값으로 네 명분의 추가 작업을 얻는다." 그리고 한도를 1만 달러로 올리지 않는 이유. "토큰은 구속 조건이 아니다. 엔지니어가 구속 조건이다." 돈을 더 줘도 사람이 그만큼 더 값지게 쓸 수 없다는 뜻이다.

같은 계산을 여러 기준점에 대 보면 다음과 같다.

기준점연간 토큰인건비 대비본전에 필요한 생산성 향상
월 200달러 상한 (총비용 25만 달러 기준)2,400달러약 1%약 1%
클로드 코드 평균 월 150~250달러1,800~3,000달러약 1%약 1%
우버: 두 도구 상한 (보상 중앙값 33만 달러 기준)36,000달러약 11%약 11%
클라우드제로 월 5,000달러 (총비용 25만 달러 기준)60,000달러24%24%
젠슨 황: 연봉 50만 달러에 25만 달러250,000달러50%50%
모세리의 가정: 소모율 = 고용 비용고용 비용과 동일100%100% (두 배)

표의 오른쪽 열이 진짜 질문이다. 그만큼 생산성이 오르는가, 그리고 그것을 측정했는가. 6부에서 본 대로 체감은 믿을 수 없고 조직 수준 측정은 아직 엉성하다. 그래서 월 200달러(1%)는 거의 무조건 본전이고, 월 5,000달러(24%)는 측정 없이는 믿음의 영역이다. 직접 숫자를 넣어 보자.

참고할 만한 극단값이 두 개 있다. 램프의 AI 지수에 따르면 AI에 가장 많이 쓰는 상위 1% 기업도 직원 1인당 월 지출이 약 7,449달러로 "엔지니어의 통상 월급의 절반에 못 미친다." 그리고 오픈AI가 9월에 공개했다고 보도된 내부 수치로는 연구자의 정가 기준 사용량 중앙값이 하루 600달러 이상, 상위 10%가 하루 7,000달러 이상이다. 모세리가 말한 '소모율이 연봉과 같아지는 세계'가 일부 조직에서는 이미 현재형이라는 뜻이다. 물론 자기 모델을 원가로 쓰는 회사의 숫자를 그대로 가져올 수는 없다.

계산기를 만져 보면 한 가지가 분명해진다. 한도의 적정선은 달러 금액이 아니라 비율로 생각해야 한다. 그리고 그 비율이 한 자릿수일 때와 두 자릿수일 때 필요한 통제 수준이 다르다. 1%짜리 지출에 여섯 층의 통제면을 까는 것은 과하고, 24%짜리 지출을 측정 없이 푸는 것은 무모하다.


8부. 한국의 선택

한국 기업들도 2026년에 같은 문제를 통과하고 있다. 공개된 사례를 모으면 이렇다.

회사알려진 방식출처·주의
네이버임직원 1인당 월 1,000달러 한도의 클로드 엔터프라이즈 계정 제공디일렉(2026-09-21) 단독 보도
LG전자매달 기본 토큰 예산 제공, 초과 사용 시 추가 사용 품의인사이트코리아(2026-07-20)
삼성전자AI가 줄인 노동량과 투입된 토큰 양을 비교해 성과를 측정하는 제도 도입같은 기사. 세부는 미공개
넷마블직무별 차등 한도같은 기사
안랩코파일럿 1인당 월 3,000크레딧같은 기사
웹케시그룹월 1억 5,000만~2억 원, 전년 대비 3,144% 증가. 7월 이후 통제 도입디지털데일리(2026-07-01)
LG CNS그룹 차원 클로드 엔터프라이즈 계약, 토큰 사용량 대시보드 운영디지털데일리·서울경제
당근2025년 3월부터 AI 도구 비용 100% 지원중앙일보(2026-03-05)

서울경제는 5월에 익명의 최고기술책임자가 한 달에 토큰 1,000만 원어치를 썼고 팀 전체로는 6,000만 원이 나왔다는 사례를 전했다. 언론은 이 흐름에 '토큰 다이어트'라는 이름을 붙였다.

원탁 회의 — 큰 병에서 팀원마다 다른 크기의 컵으로 토큰을 따라 주는 팀 리드크게 보기

미국 사례를 한국에 옮길 때 조정해야 할 것이 네 가지 있다.

첫째, 분모가 다르다. 손익분기는 인건비 대비 비율이다. 총비용이 연 25만 달러인 엔지니어에게 월 1,500달러는 7%지만, 총비용이 1억 5,000만 원인 엔지니어에게 같은 금액(약 200만 원)은 16%다. 토큰 값은 세계 어디서나 달러로 같은데 인건비는 그렇지 않다. 미국 회사의 한도를 그대로 가져오면 훨씬 공격적인 베팅이 된다. 거꾸로, 네이버의 월 1,000달러가 미국 기준으로 보이는 것보다 과감한 숫자라는 뜻이기도 하다.

둘째, 환율이 예산을 흔든다. 10월 초 원/달러 환율은 1,350원대다. 달러로 정한 한도는 원화 예산에서 환율만큼 출렁이고, 원화로 정한 한도는 실질 토큰량이 출렁인다. 어느 쪽으로 정하든 반기에 한 번은 다시 봐야 한다.

셋째, 한국어는 토큰을 더 먹는다. 2부에서 본 대로다. 한국어 문서를 많이 읽고 쓰는 업무일수록 같은 달러로 할 수 있는 일이 줄어든다.

넷째, 통제면의 아래층이 덜 깔려 있다. 국내 AI 게이트웨이 시장은 이제 형성되는 단계라는 것이 9월 보도다. 한컴이 통합 게이트웨이를, NDS가 오픈소스 프록시를 쓴다는 사례가 알려졌지만 다수 기업은 아직 팀별 계약과 개인 결제가 섞여 있다. 크래프톤과 현대차가 승인 절차를 도입한 이유로 '중복 구독 제거'가 꼽힌 것이 이 단계를 보여 준다. 4부의 여섯 층 중 ①과 ②가 먼저다.


9부. 그래서 무엇을 할 것인가

조직이라면: 단계별로

지출 규모에 따라 필요한 장치가 다르다. 과하게 깔 필요도, 맨손으로 버틸 이유도 없다.

인건비의 1% 안팎
풀어 두고 보이게만 한다. 넉넉한 기본 한도, 사내 계정 일원화, 본인이 자기 지출을 보는 화면. 이 단계의 목표는 절감이 아니라 학습이다. 한도를 조이면 가장 싸게 배울 수 있는 시기를 놓친다.
인건비의 3~10%
기본값을 고친다. 기본 모델을 한 단계 낮추고, 실행 1회당 상한을 걸고, 저장소·작업 유형별 귀속을 붙인다. 우버와 코인베이스가 지출을 안정시킨 것이 이 단계의 조치다. 개인 순위표는 만들지 않는다.
인건비의 10% 이상
근거로 차등한다. 기본 한도는 같게, 상향은 결과당 비용과 품질 지표를 근거로. 승인 절차는 하루 안에 끝나야 한다. 이 단계에서는 토큰 예산이 채용 계획과 같은 표에 올라가야 한다 — 다음 한 명을 뽑을 것인가, 지금 네 명의 한도를 올릴 것인가.

피해야 할 것도 세 가지로 정리된다. 사용량을 칭찬하지 말 것. 월말에 소멸하는 한도로 몰아 쓰기를 부르지 말 것. 그리고 상한부터 걸지 말 것 — 상한은 가장 쉬운 조치지만, 우버의 경험이 보여 주듯 실제로 지출을 잡은 것은 기본값과 가시성이었다.

개인이라면: 토큰 영수증

이전 글에서 필 첸은 면접에서 지원자마다 같은 문제에 쓰는 토큰과 시간이 크게 다르다고 썼다. 이번 글의 논문들이 그 관찰을 뒷받침한다. 같은 과제에서 실행 간 30배 차이가 나고, 그 차이의 상당 부분은 반복 열람 같은 관측 가능한 패턴에서 온다.

회사가 한도를 정하는 시대에 개인이 할 일은 한도 안에서 가장 많은 것을 얻는 사람이 되는 것이다. 그러려면 자기 영수증을 읽을 줄 알아야 한다. 어떤 작업에 얼마가 들었는지, 그중 얼마가 다시 읽기였는지, 어디서 세션을 끊고 새로 시작했어야 했는지. '근거 있는 상향'을 받는 사람은 결국 그 근거를 스스로 내놓을 수 있는 사람이다. 모세리의 말대로 한도가 "신뢰에 비례"하게 된다면, 그 신뢰는 영수증으로 쌓인다.


결론: 숫자가 아니라 장치

프롤로그의 25배로 돌아가자. 월 5,000달러와 월 200달러 중 어느 쪽이 옳은가.

이 글을 다 쓰고 난 뒤의 답은 질문이 틀렸다는 것이다. 두 회사의 차이는 숫자가 아니라 그 숫자 뒤에 있는 장치의 차이일 가능성이 높다. 한 회사는 누가 그 돈을 값지게 쓰는지 볼 수 있다고 믿고, 다른 회사는 아직 볼 수 없으니 묶어 두는 것이다. 200달러 회사의 총괄은 스스로를 "조정 기간"이라 불렀다. 정직한 표현이다.

60년의 계보가 같은 것을 말한다. 멀틱스는 할당량과 프로젝트 예산을 만들었다. AOL은 무제한이 수요를 드러낸다는 것을 보여 줬다. FinOps는 통제의 첫 단계가 삭감이 아니라 가시성이라는 것을 가르쳤다. 구글의 경매는 필요를 아는 사람이 운영자가 아니라 사용자라는 것을 일깨웠다. 그리고 2026년의 넉 달은 사용량을 칭찬하면 사용량이 늘어난다는 것을, 굿하트가 50년 전에 이미 말했음을 다시 확인시켰다.

토큰 예산은 결국 '누가 잘 쓰는지를 조직이 얼마나 아는가'의 함수다. 모르면 낮게 묶을 수밖에 없고, 알면 높이 풀 수 있다. 그러니 다음 분기에 정할 것은 한도가 아니라, 그 앎을 만들어 낼 장치다.

마이크로소프트 메모의 한 줄을 다시 적는다. 더 많이도, 더 적게도 아니다. 토큰당 더 큰 영향.


참고 자료

2026년의 사건들

  • Bill Buckley (CloudZero), "Why I Give My Engineers $5,000 Per Month Of Claude Code Tokens" (2026-05-07) — https://www.cloudzero.com/blog/engineer-ai-spend-5000-per-month/
  • Bloomberg, "Uber Caps Usage of AI Tools Like Claude Code to Cut Costs" (2026-06-02); TechCrunch, "Uber caps employee AI spending after blowing through budget in four months" (2026-06-02)
  • Simon Willison, "Uber caps usage" (2026-06-03) — https://simonwillison.net/2026/Jun/3/uber-caps-usage/
  • Uber, Q2 2026 Prepared Remarks (2026-08-05); Fortune, "Uber CTO: tokenmaxxing era is over" (2026-08-07)
  • Fortune, "Meta killed employee AI token dashboard" (2026-04-09)
  • TechCrunch, "Meta's Adam Mosseri says AI token budgets could soon be capped per engineer" (2026-07-14)
  • Business Insider, 젠슨 황 올인 팟캐스트·GTC 발언 (2026-03-20); TechCrunch, "Are AI tokens the new signing bonus?" (2026-03-21)
  • Slashdot, "Microsoft Tells Engineers Tokenmaxxing Is Not What We Are Optimizing For" (2026-08-04)
  • LeadDev, "The tokenmaxxing hype didn't last long" (2026-08-17); TNW, "Tokenminimizing" (2026-06-17)
  • Semafor, "Nobody has budgeted for tokenmaxxing, Box's Levie says" (2026-06-10)

데이터와 가격

논문

에이전트의 토큰 구조

  • Anthropic, "How we built our multi-agent research system" (2025-06-13); "Building effective agents" (2024-12-19)
  • Philip Zeyliger, "Expensively Quadratic: the LLM Agent Cost Curve" (2026-02-03) — https://blog.exe.dev/expensively-quadratic
  • Faros AI, "The AI Productivity Paradox" (2025-07)

한국

  • 디일렉, 네이버 1인당 월 1,000달러 한도 보도 (2026-09-21); AI 게이트웨이 시장 (2026-09-22)
  • 인사이트코리아, "토큰 다이어트" (2026-07-20); 서울경제 (2026-05-08); 디지털데일리 (2026-07-01, 2026-06-09)
  • AI타임스, 메타 토큰 대시보드 후속 (2026-06-13)