AI 저작권공정이용Thomson Reuters v. ROSSBartz v. AnthropicKadrey v. MetaGEMARAG리걸테크학습 데이터저작권법 제35조의5개인정보보호법 AI 특례Cloudflare지상파 네이버 소송
[특집] '쉬우면 베껴도 된다'는 없다 — Thomson Reuters v. ROSS 항소심과 RAG·리걸테크 저작권 지도
9월 29일 미국 제3순회항소법원이 AI와 공정이용에 관한 첫 항소심 판결을 냈습니다. 법률 리서치 스타트업 ROSS가 웨스트로의 판례 요지(헤드노트)로 AI를 훈련한 것은 공정이용이 아니라는 결론입니다. 판결문을 읽어 보면 핵심은 'AI 학습이냐'가 아니라 '원본 시장을 대체하느냐'와 '꼭 필요했느냐'에 있었습니다. 법원은 원본 판례는 자유롭게 쓸 수 있었는데 편해서 헤드노트를 베꼈다며 이렇게 썼습니다. '필요와 달리 편의는 복제의 정당화 사유가 아니다.' 생성형 학습을 공정이용으로 본 Bartz·Kadrey 판결, 독일 GEMA v. Suno, 한국의 지상파 3사 v. 네이버 소송과 개인정보 AI 특례까지 엮어, 검색·요약형 AI 서비스가 어디서 위험해지는지 지도로 그렸습니다.
이 글은 공개된 판결문과 보도 자료를 읽고 정리한 일반 정보이며 법률 자문이 아닙니다. 구체적인 서비스·계약에 대해서는 변호사와 상의하세요. 미국 판결은 한국 법원을 구속하지 않지만, 같은 질문을 먼저 다룬 사례로 참고할 가치가 있습니다.
들어가며: 첫 항소심 판결이 나왔다
생성형 AI와 저작권을 둘러싼 소송은 미국에서만 수십 건이 진행 중이지만, 지금까지 나온 판단은 모두 1심이었습니다. 2026년 9월 29일, 미국 제3순회항소법원이 AI와 공정이용(fair use)에 관한 첫 항소심 판결을 냈습니다. 사건은 Thomson Reuters v. ROSS Intelligence. 법률 정보 서비스 웨스트로(Westlaw)를 운영하는 톰슨 로이터가, 웨스트로의 판례 요지(헤드노트)로 AI를 훈련한 법률 리서치 스타트업 ROSS를 상대로 낸 소송입니다. 결론은 공정이용이 아니다였습니다.
이 판결은 "AI 학습은 공정이용인가"라는 질문에 대한 답이 아닙니다. 판결문은 첫머리에서 이렇게 말합니다. "사실 이것은 평범한 저작권 사건일 뿐이다." 법원이 본 것은 두 가지였습니다. ROSS의 제품이 웨스트로를 대체하려 했는가, 그리고 헤드노트를 꼭 베껴야 했는가. 그리고 ROSS는 문장을 새로 만드는 생성형 AI가 아니라, 질문에 맞는 판례 문단을 찾아 돌려주는 검색형 시스템이었습니다. 국내에서 법률·입법·문서 AI를 만드는 우리에게 이 판결이 남 일이 아닌 이유입니다.
✅
결론 먼저.
· 판결의 축은 '학습'이 아니라 '대체'와 '필요'입니다. 원본(판례)은 자유롭게 쓸 수 있었는데 편해서 남의 요약(헤드노트)을 베꼈고, 그 결과물이 원본 서비스를 대체하려 했습니다.
· 생성형 모델의 학습은 1심에서 공정이용 쪽으로 기울었지만(Bartz·Kadrey), 원본을 대신하는 검색·요약 서비스는 더 위험합니다. 미국의 Cohere 사건(요약이 원본을 대체할 수 있다)도 같은 방향입니다.
· 학습 데이터의 값도 매겨지기 시작했습니다. Anthropic은 해적판 책 학습에 대해 약 48만 권, 15억 달러에 합의했고, 독일 법원은 AI 음악 서비스 Suno의 학습과 출력 모두 침해로 봤습니다.
· 한국에는 텍스트·데이터 마이닝 예외 조항이 없습니다. 공정이용(제35조의5)의 4요소로 판단하며, 지상파 3사 v. 네이버 소송(11월 5일 8차 변론)이 첫 기준이 될 수 있습니다.
· 실무 원칙: 원본에서 직접 만들고, 출처로 돌려보내고, 원본을 대체하는 기능은 피하고, 필요하면 라이선스.
웨스트로의 편집자들은 판결문을 읽고 핵심 법리를 짧게 정리한 헤드노트를 씁니다. 판결문 자체는 누구나 쓸 수 있는 공공 자료지만, 헤드노트는 편집자가 무엇을 골라 어떻게 표현할지 정한 결과물입니다. ROSS는 웨스트로의 라이선스를 얻지 못하자 다른 법률 리서치 회사를 통해 헤드노트를 바탕으로 만든 '질문-답변 메모' 약 2만 5천 개를 받아 AI를 훈련했습니다.
1심의 스테파노스 비바스 판사(항소법원 판사로 지방법원 사건을 맡음)는 2025년 2월 판결을 이렇게 시작했습니다. "똑똑한 사람은 자기가 옳을 때를 알고, 지혜로운 사람은 자기가 틀렸을 때를 안다." 2023년의 자기 판단을 뒤집고 헤드노트 2,243개에 대해 톰슨 로이터의 손을 들어줬다는 뜻입니다. 그리고 덧붙였습니다. "독자에게 밝혀 두자면, 오늘 내 앞에 있는 것은 생성형이 아닌 AI뿐이다." 항소심은 이 판결을 중간 상고(interlocutory appeal)로 받아 9월 29일 확정(AFFIRMED)했습니다. 재판부는 레스트레포·몬트고메리-리브스·보브 판사였고, 몬트고메리-리브스 판사가 의견을 썼습니다. 소수 의견은 없습니다. 서비스를 이미 접은 ROSS는 10월 2일 연방대법원에 상고 허가를 신청하겠다고 밝혔습니다(보도 기준).
2. 판결의 핵심: 네 가지 요소
미국 저작권법의 공정이용은 네 가지 요소를 따집니다. 항소심의 판단을 하나씩 보겠습니다.
먼저, 헤드노트는 저작물인가. 그렇다고 봤습니다. 판결문의 비유가 재미있습니다. 법리를 표현하는 방법은 하나가 아니라서(바나나 의상을 만드는 방법이 여러 가지인 것처럼) 표현과 아이디어가 합쳐졌다고 볼 수 없다는 것입니다. 다만 웨스트로의 분류 체계(Key Number System)는 ROSS가 다투지 않아 판단하지 않았고, 판결문을 그대로 옮긴 헤드노트도 판단을 열어 두었습니다.
요소
항소심 판단
이유
① 이용의 목적·성격
ROSS에 불리
상업적이고 "기껏해야 최소한으로만 변형적". 두 회사 모두 헤드노트를 "법률 리서치 플랫폼을 만들고 최적화하는 데" 썼고, ROSS는 "웨스트로를 대체하려" 했다. AI 학습은 중간 단계일 뿐이다. 구글 북스 판결과 다르다
② 저작물의 성격
ROSS에 '약간' 유리
공표됐고 허구보다는 사실에 가까운 저작물
③ 이용 분량
ROSS에 불리 (1심을 뒤집음)
ROSS는 2,800만 개 중 0.08%만 썼다고 했지만, 헤드노트 하나하나가 별개의 저작물이라 각각을 통째로 베낀 것. 무엇보다 베낄 필요가 없었다
④ 시장에 미치는 영향
ROSS에 불리
웨스트로 구독을 끌어들이는 헤드노트의 가치, 법률 리서치 플랫폼 시장, 그리고 "AI 학습용으로 헤드노트를 라이선스하는 시장이 빠르게 형성되고 있다"
이 판결에서 가장 많이 인용될 문단은 세 번째 요소에 있습니다.
"ROSS는 원본 판결문에 접근할 수 있었고, AI 훈련에 필요한 메모를 만들기 위해 판결문을 자유롭게 복제할 수 있었다. ROSS는 헤드노트를 베끼는 것이 메모를 만드는 '쉬운' 방법이었기 때문에 그렇게 하지 않았다. … 필요와 달리, 편의는 복제의 정당화 사유가 아니다."
("Unlike necessity, ease is not a justification for copying.")
오라클 v. 구글이나 세가 v. 어콜레이드 같은 '중간 복제' 판례들은 보호받지 못하는 기능적 요소에 닿기 위해 복제가 꼭 필요했던 경우였다고 선을 그었습니다. ROSS는 그렇지 않았습니다. 판결문은 또 ROSS가 투자자·학생 계정으로 웨스트로에 접속한 일을 들어 "때때로 악의로 행동했다"고 각주에 적었습니다.
판결문의 각주 7은 미국 법무부(DOJ)가 9월 1일 OpenAI 저작권 소송에 낸 의견서를 언급합니다. 법무부는 그 의견서에서 LLM 학습은 "지극히 변형적"이며, 라이선스 없이는 학습을 사실상 금지하는 광범위한 책임을 지우는 것은 "문제가 있고 법적으로도 틀렸다"고 주장했습니다. 항소법원은 이렇게 구별했습니다.
"Bartz와 OpenAI 사건의 AI 모델과 달리 ROSS의 AI 플랫폼은 독창적인 표현을 생성할 수 없고, 이 사건의 증거는 변형성에 대해 반대 결론을 뒷받침한다. … 여기서 ROSS는 웨스트로의 상업적 대체물을 만들 목적으로 AI를 훈련했다."
그리고 한 문장을 덧붙였습니다. "법무부는 이 문제를 지켜보고 있고 자기 이익을 주장할 줄 알지만, 이 사건에서는 그러지 않았다." 이 각주를 "생성형 AI는 괜찮다"는 선언으로 읽으면 안 됩니다. 법원은 생성형 학습에 대해 판단하지 않았고, 다만 ROSS 사건은 그것과 다르다고 했을 뿐입니다. 그 차이의 핵심이 '독창적 표현을 만드느냐, 원본을 대신하느냐'입니다.
아래 점수판에서 주요 판결의 네 요소를 나란히 비교해 보세요. '검색·대체형 vs 생성형' 보기를 켜면 패턴이 보입니다.
Bartz v. Anthropic(1심, 2025년 6월): 알서프 판사는 학습이 "지극히 변형적"이라 공정이용이라고 봤지만, 해적판 사이트에서 받은 책으로 영구적인 중앙 도서관을 만든 것은 공정이용이 아니다라고 했습니다. 이 판단 뒤에 합의가 이뤄졌습니다.
Kadrey v. Meta(1심, 2025년 6월): 메타가 이겼지만 채프리아 판사는 이것이 학습이 합법이라는 뜻이 아니라 "원고들이 잘못된 주장을 했다"는 뜻일 뿐이라고 못 박았고, AI 결과물이 원저작물 시장을 희석시킨다는 '시장 희석' 논리가 앞으로 결정적일 수 있다고 했습니다.
Advance Local v. Cohere(2025년 11월, 소송 초기 판단): 뉴욕 연방법원은 Cohere의 각하 신청을 기각하며, 원문을 대체하는 요약이 침해일 수 있다는 주장이 그럴듯하다고 봤습니다.
ANI v. OpenAI(인도 델리 고등법원, 2026년 7월, 보도 기준): 학습은 일응 공정한 거래(fair dealing)로 보고 가처분을 기각했는데, 문제 된 출력은 암기가 아니라 검색(RAG)에서 나온 것으로 보인다고 짚었습니다.
Bartz v. Anthropic 합의 최종 승인(2026-07-20, 마르티네스-올긴 판사): 15억 달러, 대상 작품 48만 2,460권, 작품당 약 3,000달러(법정 최소 배상액 750달러의 4배). 4월 기준 91.3%가 청구됐고, 이의 54건은 모두 기각됐습니다. Anthropic은 해적판 사이트에서 받은 원본 파일과 그 사본을 모두 파기해야 합니다. 합의는 과거의 입력만 정리하며, 출력에 대한 청구는 포함하지 않습니다. 첫 지급은 11월 15일께로 예정돼 있습니다.
GEMA v. OpenAI(뮌헨 지방법원, 2025-11-11): GPT-4·4o가 독일 작사가 아홉 명의 가사를 재현할 수 있다며, 모델의 암기 자체를 복제로 봤습니다. 독일의 텍스트·데이터 마이닝 예외는 적용되지 않는다고 했고, OpenAI는 항소했습니다.
GEMA v. Suno(같은 법원, 2026-07-31): 미국에서 이뤄진 학습에도 미국법을 적용해, 결과물에서 원곡을 알아볼 수 있으므로 공정이용이 아니라고 봤습니다. 법원은 바로 이 점으로 Bartz·Kadrey와 구별했습니다. Suno는 항소를 포함해 검토 중이라고 밝혔습니다. 미국에서 학습했다고 유럽 법원을 피할 수 없다는 신호입니다.
Cloudflare: 2025년 7월 AI 크롤러를 신규 도메인에서 기본 차단하고 '크롤링당 과금'을 시작했고, 2026년 9월 15일 검색 노출은 유지하면서 학습만 거부하는 설정을, 9월 30일에는 이용할 때마다 과금하는 'Pay Per Use' 베타를 내놓았습니다. 웹 콘텐츠도 '쓰는 만큼 내는' 쪽으로 가고 있습니다.
아래 타임라인에서 미국·유럽·인도·한국의 흐름을 함께 보세요.
5. 한국은 어디쯤 와 있나
법 조문. 한국 저작권법에는 텍스트·데이터 마이닝(TDM) 예외 조항이 없습니다. AI 학습의 적법성은 공정이용 조항(제35조의5)으로 판단합니다. 조문은 저작물의 일반적인 이용 방법과 충돌하지 않고 저작자의 정당한 이익을 부당하게 해치지 않는 경우 이용할 수 있다고 하며, 판단 기준으로 미국과 같은 네 가지(목적·성격, 저작물의 종류·용도, 이용 분량과 중요성, 시장·가치에 미치는 영향)를 듭니다. 미국 판결의 논리가 한국 법원에서도 그대로 쓰일 수 있는 구조입니다.
정부 안내. 문화체육관광부는 2026년 2월 '생성형 AI 학습 저작물 공정이용 안내서'를 냈습니다(영문판 5월). 상업적 이용이나 웹 크롤링이라는 이유만으로 공정이용이 자동 배제되지는 않는다는 내용입니다. 반면 1월에는 창작자 단체 16곳이 국가 AI 행동계획의 저작권 관련 입법 과제에 반대했습니다. AI 학습 데이터에 대한 보상 제도는 아직 시행된 것이 없습니다.
소송. KBS·MBC·SBS 지상파 3사는 2025년 1월 네이버를 상대로 뉴스 콘텐츠를 AI 학습에 썼다며 소송을 냈습니다(저작권 침해, 부정경쟁, 불법행위, 사당 2억 원 청구와 학습 금지). 9월 8일 7차 변론에서 네이버는 공정이용을 예비적 항변으로 내세웠고, 8차 변론은 11월 5일입니다(보도 기준). 1~2회 더 변론을 거치면 연말이나 내년 초 1심 판결이 나올 수 있습니다. 같은 3사는 2026년 2월 OpenAI도 제소했습니다.
개인정보. 저작권과 별개로, 학습 데이터에 개인정보가 들어 있으면 개인정보보호법이 걸립니다. 8월 20일 국회 본회의를 통과한 AI 특례는 적법하게 수집한 개인정보를 AI 개발에 쓸 수 있게 하되, 가명·익명 정보로는 목적을 이룰 수 없을 때만, 공익·사회적 이익을 위해, 개인정보위의 심의·승인을 거쳐 허용합니다. 공포 6개월 뒤 시행으로, 보도 기준 2027년 3월입니다.
6. RAG·리걸테크를 만드는 사람에게
ROSS 판결을 RAG 서비스에 비춰 보면 질문이 분명해집니다. 우리 서비스는 원본에서 직접 만들었나, 남이 정리해 둔 것을 편해서 가져왔나? 그리고 사용자를 원본으로 데려가나, 원본을 대신하나? 아래 도구에 데이터 출처와 이용 방식을 넣어 보세요.
정리하면 이렇습니다.
원칙
이렇게
이렇게 하지 않기
원본에서 직접
판례·법령 원문, 공공 데이터, 고객사 자체 문서로 색인·요약을 만든다
상용 DB의 요약·주석·분류를 편해서 가져온다(ROSS)
출처로 돌려보내기
답변에 원문 링크와 출처를 붙이고, 인용은 판단에 필요한 만큼만
원문 전체를 재구성해 원본을 볼 이유를 없앤다
대체 피하기
원본 서비스와 다른 목적(내부 검색, 업무 보조)으로 설계한다
"○○ 대신 쓰세요"를 목표로 경쟁 서비스의 콘텐츠를 학습한다
계약과 신호 존중
이용약관·라이선스를 확인하고, 학습 거부 신호를 따른다
로그인 공유·우회 접속으로 데이터를 확보한다(ROSS의 '악의' 각주)
개인정보 분리
가명·익명 처리를 기본으로, 원본 개인정보는 특례 요건 안에서만
고객 문서 속 개인정보를 그대로 학습에 쓴다
마치며
ROSS 판결은 AI 기업에 불리한 판결로 보도되지만, 판결문을 읽으면 오히려 선이 또렷해집니다. 법원은 AI라서 특별히 엄격하지도, 특별히 관대하지도 않았습니다. "평범한 저작권 사건"으로 보고, 원본을 대체하려 했는지와 꼭 그래야 했는지를 물었을 뿐입니다. 그 질문은 생성형이든 검색형이든, 미국이든 한국이든 같습니다. 편해서 가져온 데이터가 있다면 지금 다시 보세요. 판결의 말처럼, 편의는 정당화 사유가 아닙니다.