Lyria 3란 무엇인가?
Lyria 3는 Google DeepMind의 최첨단 음악 생성 모델로, 2026년 초 Gemini 앱 내에서 출시되었습니다. 수동 가사 입력이 필요했던 이전 버전인 Lyria 2와 달리 Lyria 3는 자연어 프롬프트만으로 독창적인 가사, 보컬, 악기, 심지어 커버 아트까지 포함된 완전한 30초 음악 트랙을 생성합니다.
이것은 연구 데모가 아닙니다. Google은 Lyria 3를 Gemini 앱과 Dream Track을 통한 YouTube Shorts를 포함하여 수백만 명의 사람들이 이미 사용하고 있는 소비자 대상 제품에 직접 적용했습니다.
Lyria 3는 어떻게 작동하는가?
기본 수준에서 장르, 분위기, 템포, 심지어 가사 언어까지 원하는 것을 설명하면 Lyria 3가 설명에 맞는 트랙을 작곡합니다. 이 모델은 48kHz 샘플링 속도와 16비트 PCM 스테레오 출력을 사용하여 프로덕션 품질의 오디오를 생성합니다.
Lyria 3가 기술적으로 인상적인 이유는 음악 생성의 근본적인 과제를 처리하는 방식 때문입니다. 음악은 연속적이고 다층적입니다. 멜로디, 화성, 리듬, 음색 및 장거리 일관성이 모두 동시에 작동해야 합니다. 노래는 처음부터 끝까지 같은 노래처럼 들려야 합니다. Lyria 3는 미리 만들어진 루프나 구성 요소를 조립하는 대신 처음부터 음악을 생성합니다.
주요 기술 사양
| 기능 | 세부 정보 |
|---|---|
| 출력 품질 | 48kHz, 16비트 PCM 스테레오 |
| 트랙 길이 | 30초 (현재 제한) |
| 입력 유형 | 텍스트, 이미지, 비디오 |
| 출력 포함 | 보컬, 가사, 악기, 커버 아트 |
| 워터마킹 | SynthID가 오디오에 내장됨 |
| 가용성 | Gemini 앱 (모바일 + 데스크톱) |
Lyria 2에 비해 세 가지 주요 개선 사항
1. 자동 가사 생성
Lyria 2에서는 직접 가사를 제공해야 했습니다. Lyria 3는 가사를 직접 작성합니다. "밤늦게 코딩하는 재미있는 록 음악"과 같은 테마를 설명하기만 하면 모델이 음악과 가사를 모두 작곡합니다.
2. 더 큰 창의적 제어
이제 장르, 악기, 보컬, 템포 및 스타일에 대한 세밀한 제어가 가능합니다. 장르를 혼합하고 (예: K팝과 발리우드), 노래 스타일을 지정하고, 영어, 스페인어, 일본어, 한국어, 힌디어, 프랑스어, 독일어, 포르투갈어를 포함한 여러 언어 중에서 선택할 수도 있습니다.
3. 더 높은 오디오 품질
출력이 눈에 띄게 더 현실적이고 음악적으로 복잡합니다. 이것은 스티치 루프가 아닌 여러 악기와 보컬이 포함된 완전한 편곡입니다. 스테레오 믹스는 명확한 패닝, 잘 분리된 악기 및 최소한의 보컬 아티팩트를 특징으로 합니다.
멀티모달 입력: 텍스트 그 이상
텍스트가 Lyria 3가 허용하는 유일한 입력은 아닙니다. 이미지 또는 비디오를 업로드하면 모델이 시각적 콘텐츠와 일치하는 트랙을 생성합니다. 샌프란시스코에서 휴가 사진을 업로드하면 Lyria 3가 바닷바람과 도시의 불빛에 대한 산뜻한 팝 트랙을 작곡할 수 있습니다.
이는 Google이 음악을 텍스트 및 비전과 함께 최고 수준의 양식으로 취급하고 있음을 알려줍니다. 오디오는 더 이상 Gemini 생태계에서 뒷전이 아닙니다.
Lyria RealTime: 라이브 음악 조향
Google DeepMind는 또한 청크 기반 자동 회귀 스트림을 통해 실시간으로 음악을 생성하는 별도의 기능인 Lyria RealTime을 도입했습니다. 오디오는 양방향 WebSocket 연결을 통해 2초 청크로 생성됩니다.
이 모델은 이전 컨텍스트를 되돌아보며 그루브를 유지하고 사용자 컨트롤을 앞으로 보며 스타일과 방향을 조정합니다. 이를 통해 가중 프롬프트를 사용하여 라이브 조향이 가능합니다. 음악이 재생되는 동안 분위기나 악기 편성을 변경할 수 있으며 모델은 2초 이내의 지연 시간으로 조정됩니다.
Music AI Sandbox
직접 제어하려는 음악가를 위해 Google은 Music AI Sandbox를 구축했습니다. 이 도구를 사용하면 다음을 수행할 수 있습니다.
- 간단한 허밍이나 기본 피아노 라인을 가져와 완전한 오케스트라 편곡으로 바꿉니다.
- MIDI 코드를 사용하여 보컬 코러스를 생성합니다.
- 동일한 멜로디를 유지하면서 텍스트 프롬프트로 악기를 변경합니다.
이것은 인간이 참여하는 AI로, 모델은 단순히 쿼리하는 것이 아니라 함께 잼을 하는 대상이 됩니다.
Lyria 3는 누구를 위한 것인가?
- 비디오, 팟캐스트 및 소셜 미디어에 배경 음악이 필요한 콘텐츠 제작자
- 빠른 프로토타입 제작을 위한 창의적인 협력자를 찾는 음악가
- 징글, 광고 음악 및 브랜드 사운드트랙이 필요한 마케터
- Shorts 사운드트랙에 Dream Track을 사용할 수 있는 YouTube 크리에이터
- 기술 없이 음악 제작을 실험하려는 모든 사람
결론
Lyria 3는 정적 AI 음악 도구에서 통합된 에이전트 기반 창의적 시스템으로의 전환을 나타냅니다. 음악, 이미지 및 텍스트가 Gemini 내부의 단일 워크플로로 축소되고 있습니다. 30초 트랙 제한은 일시적입니다. 아키텍처는 더 긴 생성을 지원하며 Google은 Lyria 3를 소비자 장난감에서 인프라로 전환할 API 릴리스를 암시했습니다.
전문 음악가이든 음표를 작성해 본 적이 없는 사람이든 Lyria 3는 문장을 입력하는 것만큼 쉽게 음악 제작에 접근할 수 있도록 해줍니다.