AI Notes

Sony·Warner Chappell의 Anthropic 소송: AI 저작권 위험은 왜 ‘학습’보다 데이터 경로에서 갈리는가

음악 출판사들이 Anthropic을 상대로 제기한 새 소송은 아직 판결이 아닙니다. 소장이 나눈 데이터 취득, 훈련, 출력, 권리정보의 쟁점을 따라가며 AI팀이 작품 단위 provenance를 어떻게 기록해야 하는지 설명합니다.

Sony·Warner Chappell의 Anthropic 소송: AI 저작권 위험은 왜 ‘학습’보다 데이터 경로에서 갈리는가 대표 이미지
Share:

원문 링크: WordPress 원문

AI NOTES · KO KOREAN EDITION

KO · 한국어 / EN · English BILINGUAL PAIR

Sony Music Publishing과 Warner Chappell Music을 포함한 음악 출판사들은 2026년 8월 28일 미국 캘리포니아 북부연방지방법원에 Anthropic과 공동창업자 두 명을 상대로 소장을 냈습니다. 출판사들은 Claude 개발 과정에서 저작권이 있는 음악저작물이 허락 없이 취득·복제·학습·출력됐다고 주장합니다. Anthropic은 TechCrunch에 해당 주장을 받아들이지 않으며 법정에서 적극적으로 다투겠다고 밝혔습니다.

이 사건을 “AI 학습은 합법인가, 불법인가”라는 한 문장으로 줄이면 정작 실무에 필요한 질문을 놓칩니다. 새 소장은 판결이 아니며, 학습이라는 단어 하나도 데이터 취득, 정제, 모델 훈련, 출력, 권리정보 처리라는 여러 행위를 가립니다. 지금 AI를 만드는 팀이 확인할 것은 어느 편의 구호가 아니라, 한 작품이 시스템에 들어와 결과로 나가기까지의 경로를 실제 기록으로 설명할 수 있는지입니다.

먼저 확인할 것은 ‘소송이 제기됐다’는 사실과 아직 결정되지 않은 것입니다

소장 표지에는 사건번호 5:26-cv-09217, 제출일 2026년 8월 28일, 관할 법원과 당사자가 적혀 있습니다. 원고에는 Sony Music Publishing (US) LLC, Warner Chappell Music, Inc.와 여러 계열 출판사가 포함됩니다. 피고는 Anthropic PBC, Dario Amodei, Benjamin Mann입니다. 이 문서는 원고가 무엇을 주장하고 어떤 구제를 요구했는지 보여 주는 1차 법률 자료입니다.

그러나 소장이 접수됐다는 사실은 소장 속 문장들이 증명됐다는 뜻이 아닙니다. 저작물이 어떤 데이터 묶음에 포함됐는지, 각 피고가 무엇을 알고 지시했는지, 특정 복제가 공정이용인지, 출력이 보호받는 표현을 침해했는지, 손해가 얼마인지는 앞으로 증거와 법률 논쟁을 거쳐야 합니다. Anthropic의 짧은 공개 답변도 세부 반박 근거까지 제시한 변론서는 아닙니다.

따라서 현재 가장 정확한 문장은 이렇습니다. 음악 출판사들이 여러 데이터 취득·훈련·출력 경로를 저작권 침해라고 주장하는 소송을 제기했고, Anthropic은 그 주장을 다투겠다고 했으며, 법원은 이 새 사건의 책임과 구제액을 아직 판단하지 않았습니다.

소장은 하나의 주장이 아니라 네 갈래의 책임을 나눠 적었습니다

48쪽 소장은 네 가지 청구원인을 구분합니다. 첫 번째는 모든 피고를 상대로 한 토렌트 방식의 직접 침해 주장입니다. 두 번째는 Dario Amodei와 Benjamin Mann을 상대로 다른 사람의 토렌트 행위에 대한 기여침해를 주장합니다. 세 번째는 Anthropic을 상대로 스크래핑, 제3자 데이터셋, 물리 자료의 스캔, 모델 훈련, 출력 등 여러 경로에서 직접 침해가 있었다고 주장합니다. 네 번째는 Anthropic이 저작권 관리정보를 제거하거나 바꿨다는 주장입니다.

이 구분이 중요한 이유는 한 갈래에서의 판단이 다른 갈래의 답을 자동으로 만들지 않기 때문입니다. 파일을 어떤 경로로 얻었는지에 관한 쟁점과, 적법하게 보유한 사본을 분석에 쓴 행위가 공정이용인지에 관한 쟁점은 같지 않습니다. 모델이 일반적인 음악 구조를 학습했다는 설명과, 특정 가사가 출력에서 실질적으로 비슷하게 재현됐다는 주장을 검토하는 방법도 다릅니다.

언론 제목은 이 갈래들을 “노래로 AI를 학습했다”는 한 문장으로 합치기 쉽습니다. 하지만 제품과 데이터 책임자는 적어도 취득, 보관, 정제, 훈련, 평가, 출력, 권리정보라는 단계로 나눠 보아야 합니다. 그래야 어느 단계에서 허락, 출처, 통제, 삭제, 감사 증거가 필요한지 결정할 수 있습니다.

‘인터넷에서 볼 수 있다’와 ‘훈련에 쓸 권리가 있다’는 같은 문장이 아닙니다

웹에서 열리는 콘텐츠에는 서로 다른 조건이 섞여 있습니다. 권리자가 직접 공개한 작품, 라이선스 계약 아래 표시되는 가사, 공공영역 자료, 제한된 이용을 허용한 데이터셋, 무단 복제본, 출처가 불명확한 재배포물이 같은 검색 결과에 나타날 수 있습니다. 브라우저로 읽을 수 있다는 사실만으로 대량 복제, 재배포, 상업적 모델 훈련까지 모두 허용됐다고 결론 내릴 수 없습니다.

이번 소장에서 원고들은 허가받은 가사 서비스에 보이는 표현을 Anthropic이 별도 허락 없이 가져갔다고 주장합니다. 이 주장은 앞으로 검증돼야 하지만, 실무자가 지금 받아들일 수 있는 교훈은 분명합니다. publicly available 이라는 데이터 분류는 접근성만 설명할 뿐, 권리 상태나 취득 경로를 충분히 설명하지 못합니다.

데이터 목록에는 URL만 저장해서도 부족합니다. 수집 시점의 이용조건, 제공자, 라이선스 범위, 원본과 파생본의 식별자, 수집 방식, 제외 요청을 처리할 방법, 이후 어느 훈련 실행에 들어갔는지가 이어져야 합니다. 출처를 모르는 큰 말뭉치는 당장 값싸 보이지만, 나중에 작품 단위 질문이 들어오면 가장 비싼 데이터가 될 수 있습니다.

출처, 라이선스, 훈련, 출력은 하나의 ‘학습’이라는 말로 합치지 말고 각각 기록해야 합니다. 출처, 라이선스, 훈련, 출력은 하나의 ‘학습’이라는 말로 합치지 말고 각각 기록해야 합니다.

미국 저작권청도 공정이용을 데이터 출처와 목적에서 떼어 보지 않았습니다

미국 저작권청은 2025년 생성형 AI 학습 보고서에서 특정 소송의 결론을 대신 내리지 않았습니다. 대신 현행 저작권법과 공정이용 원칙으로 사실관계를 따져야 한다는 분석 틀을 제시했습니다. 저작권청은 어떤 작품을, 어떤 출처에서, 어떤 목적으로 사용했는지, 출력에 어떤 통제가 있는지, 기존 시장에 어떤 영향을 주는지가 함께 중요하다고 설명합니다.

이 틀은 “모든 AI 학습은 공정이용” 또는 “모든 AI 학습은 침해”라는 두 극단과 다릅니다. 연구·분석처럼 원작의 표현 시장을 대체할 가능성이 낮은 사용과, 상업적으로 방대한 저작권 보호 표현물을 모아 경쟁하는 표현물을 생산하려는 사용은 같은 조건이 아닙니다. 특히 저작권청은 불법적 접근이 결합된 이런 상업적 이용은 기존 공정이용의 경계를 넘을 수 있다고 보았습니다.

그렇다고 이 보고서가 이번 사건의 판결문은 아닙니다. 법원은 당사자가 낸 증거, 적용되는 법, 각 행위의 목적과 시장 효과를 별도로 판단합니다. 저작권청 보고서의 가치는 승자를 미리 알려 주는 데 있지 않습니다. AI팀이 “학습했으니 끝”이 아니라 출처·목적·통제·시장이라는 네 질문을 데이터 설계에 넣어야 한다는 기준을 주는 데 있습니다.

훈련 데이터와 모델 출력은 연결되지만 같은 증거는 아닙니다

특정 표현이 훈련 자료에 있었다는 주장과, 모델이 그 표현을 출력했다는 주장은 서로 관련될 수 있습니다. 그러나 하나가 다른 하나를 자동으로 증명하지는 않습니다. 모델 출력은 프롬프트, 모델 버전, 시스템 지침, 샘플링 설정, 후처리, 안전장치에 따라 달라집니다. 한 번 나온 문장이 전체 모델의 일반적 동작을 대표하는지도 따져야 합니다.

반대로 출력 필터가 잘 작동한다고 해서 데이터 취득 단계의 권리 문제가 사라지는 것도 아닙니다. 출력 차단은 공개되는 결과의 위험을 줄일 수 있지만, 어떤 사본을 어떻게 얻고 보관했는지에 관한 질문에는 답하지 못합니다. 데이터 취득이 적법해도 출력에서 특정 작품과 실질적으로 비슷한 표현이 반복된다면 별도의 검토가 필요합니다.

제품팀은 이 두 층의 증거를 따로 보존해야 합니다. 훈련 쪽에는 데이터셋 버전, 작품 식별자, 라이선스와 수집 기록, 정제 결과, 훈련 실행 ID가 필요합니다. 출력 쪽에는 모델 버전, 평가 프롬프트의 목적, 재현 조건, 유사성 검토, 차단 또는 수정 이력이 필요합니다. 저작권이 있는 가사를 재현하도록 유도하는 프롬프트를 공개 체크리스트처럼 배포하는 방식은 피하고, 권한이 확인된 평가 자료와 제한된 테스트 환경을 써야 합니다.

저작권 관리정보는 장식이 아니라 권리 연결을 유지하는 데이터입니다

소장의 네 번째 청구는 저작권 관리정보, 즉 CMI를 따로 다룹니다. 작품명, 저작자명, 권리자명, 저작권 표시처럼 작품과 권리자를 연결하는 정보가 여기에 포함될 수 있습니다. 원고들은 Anthropic의 텍스트 정제 과정에서 이런 정보가 제거되거나 바뀌었다고 주장합니다. 이 주장도 법정에서 입증돼야 합니다.

데이터 엔지니어링에서는 반복되는 머리말, 꼬리말, 표기 문구를 노이즈로 보고 제거하기 쉽습니다. 문제는 사람이 보기엔 반복 문구여도 권리와 출처를 확인하는 데 필요한 정보일 수 있다는 점입니다. 본문만 남기는 정제기가 나중에 작품을 식별하고 제외하거나 라이선스를 계산할 단서까지 지울 수 있습니다.

그래서 정제 전 원본, 정제 규칙, 삭제된 필드, 원본과 파생본을 잇는 매핑을 함께 보존해야 합니다. 모델 입력에는 불필요한 문자열을 줄이더라도 감사 저장소에서는 권리정보를 잃지 않는 이중 구조가 필요합니다. 데이터 최소화와 출처 보존은 서로 반대가 아닙니다. 목적에 따라 접근권한과 보존기간을 다르게 설계하면 됩니다.

원본 레코드와 권리 근거, 모델 실행, 감사 이력을 안정적인 식별자로 연결해야 합니다. 원본 레코드와 권리 근거, 모델 실행, 감사 이력을 안정적인 식별자로 연결해야 합니다.

실무용 provenance ledger에는 일곱 개의 질문이 이어져야 합니다

첫째, 무엇을 수집했는지 작품 또는 레코드 단위로 식별해야 합니다. 둘째, 어디에서 얻었는지 원본 제공자와 실제 최종 URL 또는 전달 경로를 남겨야 합니다. 셋째, 언제 어떤 방식으로 수집했는지 기록해야 합니다. 넷째, 어떤 권리 근거로 어떤 용도를 허용받았는지 라이선스 범위를 연결해야 합니다.

다섯째, 어떤 변환을 거쳤는지 정제·중복제거·필터링 버전과 삭제된 필드를 남겨야 합니다. 여섯째, 어느 모델과 평가에 사용했는지 실행 이력을 연결해야 합니다. 일곱째, 권리자가 이의를 제기하거나 라이선스가 바뀌었을 때 어떤 사본, 파생본, 학습 실행, 검색 색인, 캐시와 평가세트를 찾아 조치할 수 있는지 정해야 합니다.

이 장부는 거대한 스프레드시트 하나를 뜻하지 않습니다. 원본 객체 저장소, 데이터 카탈로그, 라이선스 레지스트리, 훈련 실행 추적, 모델 레지스트리, 출력 평가 기록을 안정적인 식별자로 연결하면 됩니다. 중요한 것은 도구 이름이 아니라 질문에 답할 수 있는 연결입니다.

가령 한 데이터 공급자가 100만 개 텍스트 레코드를 제공했다고 가정해 보겠습니다. 계약이 상업적 언어모델 훈련을 허용하지만 제3자 재배포와 원문 출력은 허용하지 않는다면, 팀은 훈련 사용과 제품 출력 통제를 구분해야 합니다. 이후 일부 레코드의 권리 상태가 바뀌면 해당 레코드가 들어간 데이터셋 버전과 모델을 찾을 수 있어야 합니다. 이 연결이 없다면 재훈련이 필요한지, 검색 색인만 지우면 되는지, 출력 필터로 충분한지조차 판단하기 어렵습니다.

라이선스는 중요한 해법이지만 불완전한 출처를 자동으로 고치지는 않습니다

미국 저작권청은 음악과 스톡 사진처럼 가치가 높은 콘텐츠를 큰 단위로 허가할 수 있는 분야에서 자발적 라이선스가 작동할 가능성을 언급했습니다. 여러 권리를 모아 거래하면 수많은 개별 계약을 줄일 수 있습니다. 음악 출판 분야는 권리자와 관리 조직이 비교적 명확한 편이어서 이런 시장이 발전하기 좋은 조건도 있습니다.

하지만 라이선스 계약을 하나 샀다고 해서 과거에 섞인 모든 데이터의 상태가 깨끗해지는 것은 아닙니다. 계약이 적용되는 작품, 권리 종류, 지역, 기간, 모델, 출력 방식, 재라이선스, 삭제 의무가 다를 수 있습니다. 같은 곡도 작곡·가사에 관한 음악저작권과 특정 녹음물에 관한 권리가 나뉠 수 있습니다.

구매팀은 “AI 학습 가능”이라는 짧은 문구보다 범위를 읽어야 합니다. 데이터팀은 계약 식별자를 작품과 데이터셋에 연결해야 합니다. 제품팀은 계약이 허용하지 않는 원문형 출력이나 제3자 제공을 막아야 합니다. 법무팀은 예외가 생겼을 때 실제 기술 시스템에서 조치가 가능한지 확인해야 합니다. 계약과 기술이 분리되면 라이선스는 보유하고도 준수 여부를 증명하지 못합니다.

작은 팀도 거대한 법무 시스템 없이 위험을 줄일 수 있습니다

처음부터 모든 작품의 복잡한 권리 지도를 완성하기는 어렵습니다. 대신 출처가 불명확한 대규모 말뭉치를 기본값으로 쓰지 않는 결정부터 내릴 수 있습니다. 모델 실험에는 공공영역, 직접 생성, 명시적 라이선스, 목적에 맞는 공개 데이터셋처럼 설명 가능한 자료를 우선합니다. 데이터 공급 계약에는 원천 출처, 허용 범위, 분쟁 통지, 삭제 지원, 하위 공급자 정보를 요구합니다.

프로토타입과 운영 제품도 나눠야 합니다. 내부 개념검증에서 허용한 데이터가 고객에게 결과를 제공하는 상업 서비스에 자동 승격되면 안 됩니다. 운영 전에는 데이터셋과 모델 버전을 고정하고, 대표적인 권리 위험 평가를 실행하며, 원문형 출력에 대한 제한과 사람 검토 지점을 정해야 합니다.

무엇보다 “모델이 알아서 기억하지 않는다”거나 “웹에 있던 자료다”라는 추정에 기대면 안 됩니다. 확실하지 않은 데이터는 사용을 멈추거나 좁은 용도로 격리하고, 권리 근거가 확인되면 승격하는 편이 안전합니다. 이 접근은 혁신을 멈추자는 뜻이 아니라, 나중에 설명할 수 없는 의존성을 줄이자는 뜻입니다.

다음 뉴스에서 봐야 할 것은 자극적인 총액보다 증거의 연결입니다

소장은 고의 침해에 대해 17 U.S.C. §504(c)가 정한 작품당 최대 15만 달러의 법정손해배상 등 법이 허용하는 최대 구제를 요청합니다. 원고들은 영향을 받은 카탈로그를 ‘수만 곡’ 규모라고 주장하지만, 이는 검증된 침해 작품 수나 판결이 아닙니다. 이 숫자를 단순히 곱하면 매우 큰 이론적 총액이 나옵니다. 그러나 청구 가능한 작품 수, 등록 상태, 책임, 고의성, 손해 산정, 다른 구제와의 관계가 결정되지 않았으므로 그 곱셈을 확정 부채처럼 쓰면 안 됩니다.

앞으로 더 중요한 자료는 법원의 명령, 피고의 정식 답변, 증거개시 범위, 작품 목록과 데이터셋의 연결, 과거 판결을 이번 사건에 어떻게 적용하는지입니다. Anthropic이 더 구체적인 데이터 출처와 통제 방식을 공개하는지도 봐야 합니다. 음악 출판사들이 주장한 각 경로가 하나의 사실 묶음으로 유지될지, 취득·훈련·출력·CMI별로 갈라질지도 핵심입니다.

설명 가능한 provenance ledger는 데이터 구매, 모델 운영, 출력 통제와 권리자 요청을 이어 줍니다. 설명 가능한 provenance ledger는 데이터 구매, 모델 운영, 출력 통제와 권리자 요청을 이어 줍니다.

결론은 ‘AI 대 창작자’가 아니라 설명 가능한 데이터 공급망입니다

이번 소송은 음악 산업과 AI 산업 중 한쪽을 즉시 선택하라는 사건이 아닙니다. 아직 판결이 나오지 않은 소송을 그렇게 소비하면 법적 불확실성도, 기술적 문제도 제대로 보이지 않습니다. 다만 소장이 던진 질문은 이미 운영 질문이 됐습니다. 어떤 자료를 어디에서 얻었고, 무엇을 제거했으며, 어떤 모델에 썼고, 결과를 어떻게 통제했는지 설명할 수 있는가입니다.

좋은 provenance ledger는 소송이 생긴 뒤 변호사에게 넘길 문서가 아닙니다. 데이터 구매, 모델 훈련, 제품 출시, 권리자 요청을 같은 식별자로 연결하는 제품 기능입니다. 데이터의 양만 경쟁하던 시기에는 출처 기록이 느린 절차처럼 보였지만, 권리와 공급망이 제품 신뢰를 좌우하는 지금은 설명 가능한 경로 자체가 속도와 선택권을 지키는 기반입니다.

Sources

Disclaimer

이 글은 공개된 소장, 기관 보고서, 기업 공개자료와 보도를 바탕으로 한 기술·운영 해설입니다. 법률 자문이나 소송 결과 예측이 아닙니다. 소장의 주장은 법원에서 아직 판단되지 않았으며, 실제 데이터 사용과 저작권 판단은 구체적인 사실관계, 계약, 관할법과 최신 법원 기록을 확인해야 합니다.

다음 액션

실전 운영/리서치 사례를 주간으로 받아보려면 블로그를 북마크하고, 필요한 주제는 문의로 남겨주세요.

관련 글

← 블로그로 돌아가기