coredot.today
유명 Suno 곡의 프롬프트는 왜 그렇게 짧았나 — 공개 프롬프트 13곡 분석과 유출로 드러난 Suno의 안쪽
블로그로 돌아가기
SunoAI 음악프롬프트 엔지니어링사례 연구MERTDAC-VAE학습 데이터저작권사운드 브랜딩

유명 Suno 곡의 프롬프트는 왜 그렇게 짧았나 — 공개 프롬프트 13곡 분석과 유출로 드러난 Suno의 안쪽

Suno에서 380만 회 재생된 「Stone」의 Style 프롬프트는 네 단어였다. Billboard 라디오 차트에 오른 Xania Monet의 지시문은 네 줄이었다. 반면 The Verge가 '실제로 흥미롭다'고 평가한 「Semiramis' Dream」에는 한 줄짜리 정답 프롬프트가 아예 없다. 유명 Suno 곡 13개의 프롬프트를 원문 확인·일부 확인·비공개로 등급을 나눠 분석하고, 2026년 7월 404 Media가 보도한 소스코드 유출에서 확인된 것(38만 시간 규모의 수집 파이프라인)과 확인되지 않은 것(MERT25·DAC-VAE 주장)을 가른다.

코어닷투데이2026-09-0357

짧은 프롬프트의 힘크게 보기

들어가며: 네 단어와 38만 시간

hljs language-text
indie-pop soulful dreamy psychedelic

Suno에서 약 380만 회 재생을 기록하고 창작자 imoliver에게 Hallwood Media와의 음반 계약을 안겨준 「Stone」의 Style 프롬프트 전문이다. 네 단어. 믹스 용어도, BPM도, 악기 목록도 없다.

그리고 2026년 7월, 404 Media는 해커가 빼낸 Suno의 2023~2024년 소스코드에서 학습 데이터 수집 파이프라인의 주석을 확인했다고 보도했다. YouTube Music 클립 201만 개, 데이터셋 시간 합계 약 38만 시간. 연속 재생으로 43년이 넘는 분량이다.

이 글은 이 두 숫자 사이를 다룬다. 앞부분에서는 유명 Suno 곡들의 프롬프트를 실제로 공개된 것과 재구성한 것으로 엄격히 나눠 분석한다. 뒷부분에서는 유출 자료에서 무엇이 확인됐고 무엇이 SNS의 추측인지 가른다. 두 이야기는 결국 같은 결론으로 모인다. Suno를 잘 쓴다는 것은 좋은 문장을 쓰는 일이 아니라, 무엇을 넣고 무엇을 고르는지의 문제라는 것이다.

한 가지 먼저 밝혀둔다. 유명 Suno 곡의 '최종 원문 프롬프트'가 완전히 공개된 사례는 예상보다 적다. Suno 안에서 인기를 얻은 곡은 공개 페이지에 Style 문자열이 남아 있지만, 외부 차트와 TikTok에서 성공한 곡은 인터뷰에서 일부만 밝혀졌거나 아예 비공개다. 그래서 모든 프롬프트에 증거 등급을 붙였다.

등급의미해당 사례
A — 원문 확인원곡 생성에 쓰인 프롬프트 또는 Suno 공개 페이지의 Style 문자열을 확인Soul of the Machine, MAYBE?!, Stone, Suno-native 3곡
B — 일부 확인인터뷰에서 프롬프트 구성요소나 일부 문구만 공개Xania Monet, I Run
C — 음향 방향 확인제작자가 사운드는 설명했지만 정확한 문구는 비공개The Puerto Rico Song
D — 원문 비공개보도된 장르·제작법을 바탕으로 학습용 프롬프트만 재구성Celebrate Me, Find Your Rest, Semiramis' Dream, A Million Colors

D등급의 재구성 프롬프트는 실제 원문이 아니다. 곡의 방향을 배우기 위한 학습 자료로만 읽어야 한다.

1부. 열 곡의 사례

왜 중요한가등급핵심 교훈
Soul of the Machine초기 Suno v3의 대표 바이럴 데모A연주 형식+세부 장르+이야기 한 줄로 방향 설정
MAYBE?!첫 Summer of Suno 우승작A정서적 대비와 리듬 단서가 긴 프롬프트보다 중요
StoneSuno 대표 스트리밍 곡, 창작자 음반 계약A일관된 디스크립터 네 개로 정체성 형성
How Was I Supposed to Know?Billboard 라디오 차트에 오른 AI 가수B실제 경험의 가사+단순한 지시+수백 회 선별
Celebrate Me2026년 iTunes·TikTok 대형 바이럴D자기 긍정 훅, 복고 소울, 숏폼 사용 장면 설계
The Puerto Rico Song여행 콘텐츠와 결합한 대중적 밈C익숙한 두 시대 스타일을 결합해 즉시 인식
Find Your RestGospel 차트 성공 사례D프롬프트보다 훅과 메시지를 먼저 설계
Semiramis' Dream비평가가 주목한 하이브리드 제작DSuno+사람 보컬+오디오 입력+Ableton 왕복
I Run바이럴과 보컬 유사성 논란이 동시에B보컬 프롬프트에는 권리·정체성 관리가 필수
A Million Colors최초로 알려진 TikTok Viral 50 진입 Suno 곡D명확한 시대 코드와 화음이 숏폼에 효과적

① Rolling Stone — Soul of the Machine (A등급)

hljs language-text
solo acoustic Mississippi Delta blues about a sad AI

2024년 Rolling Stone이 Suno v3를 소개하며 직접 입력한 문장이다. 생성 4일 만에 3만 6천 회 이상 재생됐다고 보도됐다. 음악적으로 완벽해서가 아니라, 한 줄로 설득력 있는 보컬·기타·장르 문법을 뽑아냈다는 점이 이 곡을 역사적인 사례로 만들었다.

짧지만 세 슬롯이 모두 차 있다.

  • solo acoustic — 밴드 편곡이 아닌 독창과 어쿠스틱 악기로 범위를 제한
  • Mississippi Delta blues — 단순히 blues가 아니라 시대·지역·연주 문법까지 지정
  • about a sad AI — 가장 오래된 인간적 장르에 가장 현대적인 화자를 붙인 역설

The Verge는 같은 곡을 두고 템포가 늘어지고 코드 진행이 부자연스럽다고 짚었다. 짧은 프롬프트는 놀라운 초안을 만들지만, 편곡의 긴장까지 설계하지는 못한다. 재사용할 수 있는 공식은 이렇다.

hljs language-text
[연주 형식] + [지역·시대가 박힌 세부 장르] + about [정서적으로 낯선 화자]

② AroundOnce — MAYBE?! (A등급)

hljs language-text
Electronic, sweet female voice, eerie, swing,
dreamy, melodic, electro, sad, emotional

Suno가 주최한 첫 Summer of Suno 대회의 최우수 곡. 창작자 AroundOnce는 1만 달러를 받았고, Reddit 게시물에서 이 곡을 사람이 쓴 가사로 표시했다. 당시 주간 트렌딩 1위, 약 25만 재생. Suno 원곡 페이지와 공식 플레이리스트에 위 Style 문자열이 그대로 남아 있다.

이 프롬프트의 강점은 양면성이다. sweet female voiceeerie, dreamysad가 한 곡 안에서 맞선다. 밝기만 하거나 어둡기만 한 전자 팝보다 기억에 남는 이유다. 그리고 swing 한 단어가 정박 전자 음악을 흔들리는 리듬으로 바꿔놓는다.

흥미로운 점이 하나 있다. 비공식 Suno 프롬프트 가이드들은 대개 장르 최대 두 개, 정서 최대 두 개를 권한다. 「MAYBE?!」는 분위기 단어를 다섯 개 넘게 썼다. 규칙은 절대적인 문법이 아니라 조건 충돌을 줄이려는 경험칙이고, 여러 단어가 같은 음악적 세계를 가리키면 중복돼도 좋은 결과가 나온다.

③ imoliver — Stone (A등급)

hljs language-text
indie-pop soulful dreamy psychedelic

네 단어가 각자 다른 역할을 맡으면서 충돌하지 않는다.

단어기능
indie-pop곡의 기본 구조와 대중성. 지나치게 실험적으로 흐르는 것을 막는 닻
soulful보컬의 감정과 프레이징. 인간적인 중심
dreamy공간감과 부드러운 질감
psychedelic비현실적인 음색과 전개 가능성

「Stone」은 프롬프트 길이와 결과의 완성도가 비례하지 않는다는 가장 분명한 증거다. 아래 두 프롬프트를 비교해 보자.

hljs language-text
indie-pop soulful dreamy psychedelic
hljs language-text
high-resolution studio-quality modern indie pop with warm mids,
wide stereo imaging, psychedelic reverb, emotional vocal delivery,
dynamic analog saturation, controlled sub-bass...

후자는 정보가 많지만 정체성은 오히려 흐려진다. 네 단어가 모두 같은 방향을 가리킨다는 것이 「Stone」의 힘이다.

④ Xania Monet — How Was I Supposed to Know? (B등급)

hljs language-text
slow tempo R&B
female soulful vocals
light guitar
heavy drums

Xania Monet은 시를 써온 Telisha "Nikki" Jones가 만든 AI R&B 프로젝트다. 이 곡은 Jones가 여덟 살 때 아버지를 잃은 경험에서 출발했고, Xania Monet은 Billboard 라디오 에어플레이 차트에 진입한 최초의 알려진 AI 가수로 보도됐다. 위 네 줄은 CBS와 People 인터뷰에서 Jones가 실제로 쓰는 지시의 예로 공개한 것이다. 다만 이 곡 최종본에 들어간 완전한 한 줄인지, 여러 곡에서 반복해 쓰는 구성요소인지는 확인되지 않았다.

주목할 것은 light guitarheavy drums의 대비다. 기타는 가사와 보컬을 방해하지 않고, 드럼이 감정적 무게를 진다. 그런데 이 사례의 진짜 핵심은 프롬프트가 아니다. Jones는 자신의 시를 가사로 넣은 뒤 Suno가 만드는 두 결과를 비교하고, 표현을 바꿔가며 때로는 수백 개의 버전을 생성해 고른다고 설명했다.

hljs language-text
실제 경험에서 나온 가사
+ 네 개의 일관된 음악 지시
+ 수백 개 결과 중 강한 보컬과 멜로디 선별

⑤ IngaRose — Celebrate Me (D등급, 원문 비공개)

2026년 4월 미국·영국·프랑스·캐나다·뉴질랜드 iTunes 판매 차트 1위, TikTok 약 30만 개 영상에 사용, 8월 기준 Spotify 재생 2,300만 회 이상. 다만 iTunes 판매 차트 1위는 Billboard Hot 100이나 전체 스트리밍 1위와는 다른 지표다. IngaRose 측은 가사가 사람이 쓴 실제 이야기이고 Suno로 스템과 편곡을 다듬었다고 소개하지만, 원본 프롬프트는 공개되지 않았다.

아래는 보도된 장르·보컬 질감·곡 전개를 바탕으로 만든 학습용 재구성이다.

hljs language-text
Retro-soul and adult contemporary R&B ballad,
powerful raspy female alto with emotionally expressive phrasing,
warm piano, restrained live drums and gospel-inflected backing vocals,
intimate vulnerable verses rising into a triumphant self-affirmation chorus,
polished but organic production with warm mids and spacious vocals.

이 곡에서 배울 것은 음악보다 먼저 보이는 사용 장면이다. 자기 자신을 축하하고 살아남은 시간을 인정하는 내용은 생일, 회복, 졸업, 자기 돌봄 영상에 그대로 붙는다. 제목 자체가 행동을 제안하고, 성숙한 소울 발라드라는 문법이 메시지에 무게를 준다. 바이럴 곡의 프롬프트는 "좋은 음악"뿐 아니라 "사람들이 어떤 장면에서 이 음악을 쓸 것인가"까지 고려한다.

⑥ Saxboy Billy — The Puerto Rico Song (C등급)

Bill Stiteler가 Puerto Rico 여행 후 직접 쓴 가사를 Suno에 넣어 만든 곡이다. 2026년 5월 보도 당시 TikTok 4만 6천 개 이상의 게시물에 사용됐고, O-Town, Charlie Puth, Luke Combs, Jennifer Love Hewitt가 립싱크나 관련 영상을 올렸다. ABC가 프롬프트를 묻자 Stiteler는 자신의 "secret sauce"라며 공개하지 않았다. 대신 TMZ에는 자기 여행 노래들의 방향을 이렇게 설명했다.

hljs language-text
cheesy 1980s sitcom theme music mixed with yacht rock vibes

1980년대 시트콤 주제가와 yacht rock은 둘 다 밝고 친근하며 약간 촌스럽다. 충돌하지 않고 서로를 강화한다. 가사는 추상적인 여름 노래가 아니라 실제 장소와 비행 경험에서 출발했다. 그리고 완벽하게 세련되지 않은 것이 오히려 강점이었다. 브랜드 음악에서도 모든 곡을 웅장하게 만드는 것보다 콘텐츠 성격에 맞는 의도적인 촌스러움이 더 강할 수 있다.

⑦ Solomon Ray — Find Your Rest (D등급)

Christopher "Topher" Townsend가 운영하는 AI Gospel·Southern Soul 프로젝트. 「Find Your Rest」는 Billboard Gospel 관련 차트에서 주목받았고, AI가 만든 종교 음악의 진정성 논쟁을 촉발했다. Townsend가 지역 방송 인터뷰에서 밝힌 제작 순서는 이렇다.

1. 훅과 메시지
먼저 사람에게 전하고 싶은 한 문장과 훅을 만든다. Style 프롬프트는 여기서 출발하지 않는다.
2. 구조화
ChatGPT로 노래 구조를 정리하고, 정리된 가사를 Suno에 넣는다.
3. 반복 생성
마음에 드는 버전이 나올 때까지 생성한다.
4. 후처리
이후 프로듀서처럼 세부를 수정한다.

공개된 곡 메타데이터(약 73 BPM, Gospel·Soul)와 제작 설명을 바탕으로 한 학습용 재구성은 아래와 같다. 원래 프롬프트에 이 수치가 입력됐다는 뜻은 아니다.

hljs language-text
Slow Southern soul-gospel at approximately 73 BPM,
warm resonant male baritone with comforting devotional delivery,
Hammond organ, restrained live drums, soft electric piano and gospel choir,
intimate weary verses gradually opening into a reassuring communal chorus,
organic church-room ambience, clear front-and-center vocals.

행사·브랜드 음악을 만들 때도 "어떤 음악을 만들까?"보다 먼저 물어야 할 질문이 있다. 관객이 이 노래를 듣고 어떤 한 문장을 기억해야 하는가.

⑧ 1010Benja — Semiramis' Dream (D등급, 한 줄 프롬프트 없음)

2026년 공개된 이 곡은 AI 음악을 비판적으로 다뤄온 매체에서도 실제로 흥미로운 작품으로 평가받았다. The Verge는 감염성 강한 jungle beat, 사람의 리드 보컬, 빠르게 잘린 보컬과 AI 어린이 합창단의 조합을 주목했고, 합창단이 완전히 설득력 있지는 않다는 단서도 달았다.

제작 과정에는 한 줄짜리 정답 프롬프트가 없다.

hljs language-text
Patrick Holder가 비트 제작
→ 1010Benja가 직접 리드 보컬 녹음
→ 보컬과 비트를 Suno에 입력
→ 생성 결과를 골라 Ableton에서 편집
→ 다시 Suno로 보내 변형
→ 이 과정을 수백 회 반복

학습용 Style 재구성은 아래와 같지만, 이 곡의 완성도를 좌우한 것은 문장이 아니라 위 왕복이다.

hljs language-text
Hyperpop-inflected jungle and drum & bass,
frantic chopped breakbeats, rapidly mutating digital textures,
uncanny children's choir surrounding a clearly human lead vocal,
euphoric yet disorienting, abrupt transitions, explosive energy.

많은 사람이 Suno의 고급 사용법을 "더 좋은 문장을 쓰는 것"이라고 생각한다. 「Semiramis' Dream」은 최상급 결과에서 텍스트 프롬프트는 전체 공정의 일부에 불과하다는 것을 보여준다.

⑨ HAVEN. — I Run (B등급)

Harrison Walker와 Jacob Donaghue가 쓰고 제작한 곡에 Suno를 써서 Walker의 목소리를 여성적으로 변형한 바이럴 사례다. 제작진이 언론에 공개한 프롬프트에는 soulful vocal samples라는 문구가 포함됐고, 전체는 비공개다.

성공과 위험이 동시에 나타났다. 가공된 보컬이 실제 영국 R&B 가수의 목소리와 비슷하게 들린다는 반응이 퍼졌고, 해당 가수의 레이블이 로열티 지분을 요구했으며, 곡은 주요 스트리밍 서비스에서 내려갔다. 이후 새 인간 보컬로 다시 녹음됐지만 보컬 유사성과 마케팅 투명성 논쟁은 계속됐다.

!
따라 하면 안 되는 것
"soulful female vocal", "smooth British R&B voice", "recognizable neo-soul phrasing"처럼 특정 실존 가수를 연상시키기 쉬운 모호한 방향을 쓰면서, 결과물이 누구의 목소리처럼 들리는지 검토하지 않는 것.
대안
사람이 이미 만든 작곡·편곡·퍼포먼스가 있다면 Suno를 전체 곡 생성기가 아니라 음색 변환과 샘플 탐색 도구로 쓴다. 2026년 3월 출시된 Suno v5.5의 Voices는 사용자가 무작위 문장을 읽어 본인 음성임을 확인한 뒤에만 쓸 수 있다. 공개 목적이라면 본인 또는 동의를 받은 가수의 음성에 정체성을 고정하는 편이 안전하다.

⑩ Vinih Pray — A Million Colors (D등급)

2025년 Suno로 생성된 곡 가운데 최초로 알려진 TikTok Viral 50 차트 진입 사례로 보도됐고, 44위까지 올랐다. doo-wop에서 영감을 받은 복고풍으로 소개됐다. 학습용 재구성은 아래와 같다.

hljs language-text
Warm 1950s-inspired doo-wop and soul-pop,
gentle romantic lead vocal with close four-part harmony responses,
walking upright bass, brushed drums and soft piano,
concise sing-along chorus with a highly repeatable melodic phrase,
lightly aged mono-style production with subtle tape warmth.

이 곡은 복잡한 장르 혼합 대신 하나의 분명한 시대 코드를 쓴다. 숏폼에서는 새로운 장르를 설명하는 음악보다 첫 몇 초 안에 "어떤 세계의 노래인지" 알아들을 수 있는 음악이 강하다.

프롬프트가 공개된 Suno-native 벤치마크 3곡

외부 차트의 대형 히트는 아니지만, Suno 안에서 많이 재생되거나 경연에서 주목받았고 Style 문자열이 공개 페이지에 남아 있는 곡들이다.

Soul_Diego — Ain't Got a Nickel Ain't Got a Dime (Suno Showcase)

hljs language-text
up tempo Memphis soul 1970's

세 단위로 리듬(up tempo), 지역 하위 장르(Memphis soul), 시대 미학(1970's)을 모두 고정한다. 「Soul of the Machine」과 같은 좁고 강한 장르 앵커 전략이다.

Nanashi_Zero — I Spent 3000 Credits on This Song (약 140만 재생)

hljs language-text
Catchy Instrumental intro, electro swing, sweet female vocal, witch house

첫 구간의 기능, 핵심 리듬 장르, 보컬 캐릭터, 어두운 전자 질감을 각각 하나씩 지정한다. sweet female vocalwitch house의 상반된 조합이 개성을 만든다. 제목은 대량 생성과 선별이라는 실제 공정을 풍자한다.

Feline Music — Eye of the Storm (Suno Song Contest 3 스위스 우승작)

hljs language-text
Electric Violin, Modern Violin, Electric Dance Music, Dubstep, Adult Female Voice

정서나 믹스 품질을 거의 쓰지 않고 대표 악기와 장르 충돌에 집중한다. 핵심 악기가 하나뿐이라 바이올린이 곡의 정체성을 확실히 차지한다.

사례를 비교해서 얻은 일곱 가지

① 유명한 곡의 프롬프트는 의외로 짧았다. 실제로 확인된 A등급 프롬프트는 네 단어에서 열 단어 사이다. 비공식 가이드들은 "장르 이름만 말하지 말고 소리를 묘사하라"고 강조하는데, 이는 복잡한 제어가 필요할 때 유용하다. 정확한 결론은 이렇다. 장르명을 쓰지 말라는 것이 아니라, 장르명만으로 부족할 때 결과를 구별해 주는 한두 가지 소리와 감정을 추가하라.

② 기술 용어보다 한 문장으로 설명되는 콘셉트가 중요했다.

한 문장 콘셉트
Soul of the Machine옛 Delta blues 가수가 슬픈 AI를 노래한다
MAYBE?!달콤하지만 기괴하고 슬픈 electro swing
Stone영혼이 느껴지는 몽환적 psychedelic indie-pop
Xania Monet실제 상실의 시를 느린 soulful R&B로 만든다
Puerto Rico Song여행담을 1980년대 시트콤+yacht rock으로 부른다
Find Your Rest지친 사람에게 휴식을 전하는 Southern gospel
Celebrate Me자신이 견뎌온 시간을 축하하는 retro-soul anthem

곡을 한 문장으로 설명하지 못한다면 1,000자의 세부 묘사를 더해도 결과는 흐려진다.

③ 감정적으로 상반된 두 요소가 곡을 기억하게 했다. sweet + eerie, dreamy + sad, retro 장르 + AI 화자, light guitar + heavy drums, campy sitcom + yacht rock, euphoric + disorienting. emotional, beautiful, powerful이라고 적는 것보다 두 감정이나 질감을 대비시키는 편이 훨씬 구체적이다.

④ 사람의 가사가 중요한 성공 요인이었다. 「MAYBE?!」는 사람이 쓴 가사로 공개됐고, Xania Monet은 수년간 써온 시, 「The Puerto Rico Song」은 실제 여행, 「Find Your Rest」는 사람이 구상한 훅, 「Semiramis' Dream」은 실제 보컬과 사람이 만든 비트를 썼다. 반대로 Suno의 자동 가사를 그대로 쓰면 neon, shadows, whispers 같은 익숙한 표현과 반복적인 운율이 나타난다는 지적이 있다.

⑤ 반복 생성은 예외가 아니라 핵심 공정이다. Xania Monet은 수백 개, 「Semiramis' Dream」은 수백 회 왕복, Solomon Ray는 원하는 결과가 나올 때까지. 실무에서는 프롬프트 1개에 생성 2개가 아니라 이렇게 접근해야 한다.

hljs language-text
핵심 프롬프트 1개
→ 보컬만 바꾼 변형 3개
→ 리듬만 바꾼 변형 3개
→ 후렴 전개만 바꾼 변형 3개
→ 가장 좋은 2개를 구간 편집

⑥ 프롬프트보다 오디오 입력과 DAW 편집이 더 중요해지는 단계가 있다. 초기 바이럴 데모는 한 줄로 충분했다. 하지만 정교한 음악적 정체성을 만들려면 실제 보컬이나 허밍, 사람이 만든 비트, Audio Upload, 스템 분리, DAW 재편집, 믹싱·마스터링이 필요했다. 전문적인 결과를 목표로 할수록 Suno는 "한 번에 곡을 완성하는 기계"보다 재료를 만들고 변형하는 생성형 악기에 가까워진다.

⑦ 바이럴 곡은 1~3초 안에 사용 이유를 보여준다. Suno의 공식 숏폼 가이드도 첫 1~3초에 가장 좋은 가사, 후렴, 비트 드롭을 먼저 보여주라고 권한다. 「Puerto Rico Song」은 첫 문장부터 장소, 「Celebrate Me」는 즉시 이해되는 메시지, 「A Million Colors」는 첫 소절부터 doo-wop, 「MAYBE?!」는 독특한 보컬과 swing이 즉시 등장한다.

실전 공식

hljs language-text
1. 한 문장으로 설명되는 사람 중심의 이야기
2. 주 장르 하나
3. 시대·지역·하위 장르 앵커 하나
4. 대표 악기 또는 리듬 단서 하나
5. 보컬 정체성 하나
6. 서로 대비되는 감정이나 질감 두 개
7. Verse에서 Chorus로의 에너지 변화
8. 원하지 않는 가장 가까운 장르를 Exclude
9. 여러 버전을 생성하고 한 변수씩 비교
10. 가장 좋은 10~30초를 중심으로 숏폼 콘텐츠 설계

한 줄 Style 공식으로 줄이면 이렇다.

hljs language-text
[specific genre or era],
[distinctive rhythmic or instrumental identity],
[vocal timbre and delivery],
[one emotional contrast],
[clear energy trajectory],
[production space]

예를 들어 자기 긍정 메시지의 소울 곡이라면 다음처럼 쓴다.

hljs language-text
Late-1970s Memphis soul-pop,
steady mid-tempo backbeat with warm electric piano and live brass,
powerful raspy female alto,
vulnerable but ultimately triumphant,
restrained intimate verses building into a large self-affirmation chorus,
warm organic studio production with clear front-and-center vocals.

한 가지 단서를 더 붙인다. 「MAYBE?!」와 「Stone」은 각각 v3.5와 v3 시기의 결과이고 현재 Suno는 v5.5다. 같은 문구를 넣어도 같은 멜로디·보컬·편곡은 재현되지 않는다. 과거 프롬프트는 복제용 seed가 아니라 방향을 배우는 Style 레시피다.

2부. 유출로 드러난 Suno의 안쪽

유출된 수집 파이프라인크게 보기

앞에서 본 짧은 프롬프트들이 왜 작동하는지 이해하려면, 모델이 무엇을 보고 배웠는지도 알아야 한다. 2026년 7월의 소스코드 유출은 그 일부를 보여줬다. 다만 이 자료를 둘러싼 SNS의 해석에는 확인된 것과 추측이 섞여 있어, 둘을 분리해서 읽어야 한다.

무슨 일이 있었나

2025년 11월
npm 공급망 웜 Shai-Hulud가 Suno 직원 한 명의 개발 환경을 감염시켜 GitHub·클라우드 자격증명을 수집. 공격자(핸들 ellie.191)는 이를 이용해 소스코드, 고객 목록, Stripe 결제 데이터에 접근했다고 404 Media에 밝혔다.
2026년 7월 15일
404 Media가 유출된 2023~2024년 소스코드를 검토해 학습 데이터 수집 대상과 규모를 보도. 코드 주석에는 데이터셋별 시간과 클립 수, 그리고 "non-music will be filtered out"이라는 필터링 지시가 있었다.
Suno 입장
"신속히 억제됐고 주로 더 이상 쓰지 않는 구식 코드에 영향을 미쳤으며 민감한 개인정보는 유출되지 않았다." 일부 고객은 유출된 데이터가 자기 것이 맞고 Suno로부터 통지를 받지 못했다고 밝혔다.
소송과의 연결
UMG와 Sony는 그보다 앞선 5월 21일 Audible Magic 오디오 지문으로 학습 데이터에서 식별했다며 61,026곡을 소송에 추가해 달라고 법원에 요청한 상태였다. Suno는 답변서에서 "수천만 건의 녹음"을 모델에 보여줬다고 이미 인정했다.

확인된 것: 수집 파이프라인의 대상과 규모

404 Media가 확인한 코드 주석에 기재된 수치다. 가장 큰 ytm_tagged를 100%로 놓고 그렸다.

ytm_tagged (태그가 붙은 YouTube Music)
152,162h
youtube_music (클립 2,013,545개)
113,879h
pond5_music (스톡 음악)
62,117h
imslp (악보 라이브러리)
19,514h
genius_hq (가사)
17,615h
deezer
12,287h
jamendo
3,726h
freesound
410h
musescore_lyrics
103h
381,813h
코드 주석의 단순 합계
연속 재생 약 43.6년
201만
youtube_music 클립 수
약 100만h
PodcastIndex 팟캐스트
"다운로드 목표"로 보도됨
2023~24
유출 코드의 작성 시기
Suno: "더 이상 쓰지 않는 구식 코드"

이 합계를 "43.6년 분량의 서로 다른 고유 음악"으로 읽어서는 안 된다.

!
합계가 과대평가될 수 있는 이유
youtube_music과 ytm_tagged는 서로 겹칠 수 있다. 한 곡이 원본·아카펠라·메타데이터 정렬본 등 여러 형태로 들어갔을 가능성이 있다(코드에는 YouTube에서 아카펠라 버전을 검색하는 부분도 있었다). genius_hq, musescore_lyrics 같은 이름은 오디오보다 가사·정렬·파생 데이터셋을 가리킬 수 있다. 팟캐스트 약 100만 시간은 수집 완료가 아니라 목표치다.
그래서 이 자료가 보여주는 것
수집 파이프라인의 대상과 규모다. 최종 학습 데이터의 고유 곡 목록, 모델 버전별 투입 비율, 현재 v5.5에 무엇이 남아 있는지까지는 아니다. 스크립트는 그 기능과 워크플로우가 존재했음을 증명하고, URL 목록은 그 자료가 대상이었음을 보여준다. 어느 쪽도 단독으로는 모든 항목이 배포된 모델에 도달했음을 증명하지 않는다.

확인되지 않은 것: "MERT25가 Suno의 핵심 기술"이라는 주장

유출 직후 X에서 "Suno가 MERT25를 주요 기술로 썼다"는 문구가 확산됐다. 검색 결과상 최초 확산 게시물은 @bdsqlsz 계정으로 연결되고, MERT 논문의 공동 저자인 Ge Zhang의 프로필에는 같은 문구와 함께 "The Long-Living Mert!"라는 반응이 노출돼 있다. Ge Zhang이 원 제보자라기보다는 자신이 공동 개발한 모델이 Suno 내부에서 쓰였다는 주장에 반응하거나 재확산한 것으로 보는 편이 타당하다. 이는 공개된 검색 결과에 근거한 추론이다.

코어닷이 확인한 주요 보도(404 Media, Socket, Variety, Music Business Worldwide, heise)에는 MERT, MERT25, DAC-VAE라는 이름이 등장하지 않는다. 그러니 이 주장은 "가능성"의 층위에서 읽어야 한다.

MERT는 무엇인가. 2023년 발표되고 ICLR 2024에 채택된 Acoustic Music Understanding Model이다. Yizhi Li, Ruibin Yuan, Ge Zhang 등이 저자로 참여했다. BERT 계열의 마스킹 기반 자기지도학습을 쓰고, RVQ-VAE 기반 음향 교사 모델과 CQT 기반 음악 교사 모델이 의사 레이블을 제공한다. 매개변수는 95M~330M이고, 공개된 MERT-v1은 최대 약 16만 시간의 음악으로 학습됐다. 목적은 음악 태깅, 장르 분류, 키·피치·비트·악기·가수 식별 같은 이해 작업이다.

그러나 MERT는 생성 모델이 아니다. 음악을 분석해 표현 벡터로 만드는 인코더다. 텍스트 프롬프트를 받아 몇 분짜리 완성곡을 만드는 전체 시스템과는 역할이 다르다. Suno CEO Mikey Shulman은 2024년 Latent Space 팟캐스트에서 Suno가 Transformer 기반 자기회귀 생성을 택했고, 핵심 차별점은 "오디오를 어떻게 올바르게 토큰화하는가"라고 설명했다. 오디오는 초당 약 5만 번 샘플링되는 연속 신호라서, 품질을 잃지 않고 신호를 찾아 다운샘플링하는 것이 텍스트보다 훨씬 어렵다는 것이다.

따라서 유출 자료에서 MERT 계열 코드가 실제 발견됐다 해도 가능한 역할은 다양하다.

가능한 역할설명
자동 태깅데이터셋의 장르·템포·키·악기를 자동으로 라벨링. `ytm_tagged`라는 이름과 맞물린다
필터링품질이 낮거나 음악이 아닌 데이터를 걸러냄. "non-music will be filtered out" 주석과 맞물린다
중복·유사곡 탐지여러 소스에서 들어온 같은 곡을 찾아 제거
조건 정보 제공음악 구조와 음향 특징을 생성 모델의 조건으로 공급
검색·군집화학습 데이터의 검색과 군집화
평가·보상 모델생성 결과의 품질 평가나 선호 정렬

MERT25라는 명칭 자체는 공개 논문, 공식 MERT 저장소, Suno 공식 기술 설명 어디에도 독립적으로 등장하지 않는다. 내부에서 개조한 변형의 코드명일 수도, 특정 프레임 레이트나 특징 추출 설정을 나타내는 내부 명칭일 수도, 디렉터리 이름일 수도, 게시자가 코드를 해석하며 붙인 축약일 수도, 부정확한 해석일 수도 있다. "Suno 내부에서 MERT 계열 모델을 활용했을 가능성"과 "MERT25가 Suno의 주 생성 엔진"은 전혀 다른 수준의 주장이다.

DAC-VAE 주장은 무엇을 뜻하는가

같은 게시물들에서 DAC-VAE도 언급됐다. DAC-VAE는 Descript Audio Codec의 VAE 변형으로, 잔차 벡터 양자화(RVQ) 대신 VAE 목적함수를 써서 오디오 파형을 연속 잠재 표현으로 압축하고 다시 복원하는 신경망 오디오 코덱이다. Meta가 공개한 구현도 있다.

음악 생성 시스템에 이런 코덱이 들어간다면 긴 고해상도 오디오를 작은 잠재값으로 압축하고, Transformer가 원시 파형 대신 효율적인 오디오 토큰이나 잠재값을 생성하게 하며, 생성된 잠재값을 최종 파형으로 디코딩하는 역할을 한다. Shulman이 말한 "오디오 토큰화"가 정확히 이 층위다.

그러나 코덱은 자동차로 치면 엔진이 아니라 변속기나 압축·복원 장치에 가깝다. DAC-VAE가 발견됐다는 것만으로 텍스트 인코더, 가사 모델, 음악 생성 Transformer, 장기 구조 모델, 보컬·반주 처리, 믹싱·마스터링까지 설명되지는 않는다.

공개 정보를 바탕으로 가능한 구조를 기능적으로 정리하면 다음과 같다. 확인된 Suno 내부 아키텍처 도면이 아니다.

웹 음악 수집 (YouTube Music·Deezer·Pond5·Jamendo·IMSLP 등)
정제·중복 제거·가사/메타데이터 정렬 (Genius·MuseScore)
MERT 계열 음악 분석·태깅·표현 추출 (가능성)
오디오 코덱 또는 VAE 기반 잠재 표현 (DAC-VAE 계열 가능성)
텍스트·가사 조건을 받는 자기회귀 Transformer (CEO 인터뷰로 확인)
오디오 디코더·후처리·믹싱

이것이 프롬프트 작성자에게 뜻하는 것

유출 자료와 사례 분석을 겹쳐 놓으면 세 가지가 보인다.

첫째, 짧은 장르 앵커가 잘 먹히는 이유. 학습 데이터의 상당 부분이 태그가 붙은 스트리밍 음악이고, 파이프라인에 자동 태깅 단계가 있었을 가능성이 높다면, Memphis soul 1970'sMississippi Delta blues 같은 표현은 모델이 학습 중에 본 라벨의 언어와 가깝다. "warm mids, wide stereo imaging" 같은 믹스 용어는 그 라벨 공간에 없을 가능성이 크다.

둘째, 보컬 프롬프트의 위험이 구조적이라는 것. 코드에 YouTube에서 아카펠라 버전을 찾는 부분이 있었다는 보도는, 보컬 퍼포먼스가 별도로 분리되어 학습됐을 가능성을 시사한다. 「I Run」에서 벌어진 일은 우연한 사고가 아니라 이런 데이터 구조에서 예측 가능한 결과다. 공개용 곡이라면 Voices로 본인 또는 동의받은 음성에 정체성을 고정하는 것이 방어선이다.

셋째, 도구 선택의 문제. 이 소송과 유출은 아직 진행 중이다. UMG와 Sony는 판사가 61,026곡 추가에 소극적이었음에도 스트리밍 사이트에서 음원을 뜯어낸 행위(stream ripping)를 별도 청구로 다툴 수 있게 됐다. 상업용 브랜드 음악이라면 학습 데이터 출처가 공개된 대안이나 라이선스가 명시된 서비스를 함께 검토하고, 최종 결과물에 사람의 작곡·편곡·보컬을 얼마나 넣었는지 기록으로 남기는 편이 안전하다.

결론

유명한 Suno 사례들을 비교하면, 성공을 만든 것은 모든 음향 요소를 다 넣은 긴 프롬프트가 아니었다.

hljs language-text
성공 가능성
=
명확한 이야기와 훅
× 일관된 4~6개의 스타일 단서
× 사람의 취향과 선별
× 반복 생성과 편집
× 사용할 장면이 분명한 콘텐츠
× 보컬과 저작권에 대한 투명한 운영

실제로 공개된 「Stone」, 「MAYBE?!」, 「Soul of the Machine」의 프롬프트는 매우 짧다. 가장 음악적으로 복잡한 「Semiramis' Dream」은 한 줄 프롬프트가 아니라 사람이 만든 비트와 보컬, 수백 번의 Suno 변형, Ableton 편집의 결과였다.

그리고 유출 자료가 보여준 것은, 그 짧은 프롬프트 뒤에 38만 시간 규모의 수집 파이프라인이 있었다는 사실이다. MERT25와 DAC-VAE가 그 안에서 정확히 어떤 역할을 했는지는 아직 공개 보도로 확인되지 않았다. 확인된 것과 추측을 구분해 읽는 것 자체가, 이 도구를 쓰는 사람에게 필요한 기술이 됐다.

유명 곡의 프롬프트는 복사할 비밀 주문이 아니다. 어떤 정보를 남기고 어떤 정보를 버렸는가, 어떤 감정과 장르를 대비시켰는가, 생성 이후 사람이 얼마나 선택하고 다시 편집했는가를 배우는 자료다.


참고 자료

사례

유출과 기술