Cos'è Lyria 3?
Lyria 3 è il modello di generazione musicale più avanzato di Google DeepMind, lanciato all'inizio del 2026 all'interno dell'app Gemini. A differenza del suo predecessore Lyria 2, che richiedeva l'inserimento manuale dei testi, Lyria 3 genera brani musicali completi di 30 secondi — inclusi testi originali, voci, strumentazione e persino copertine — a partire da nulla più di un prompt in linguaggio naturale.
Non si tratta di una demo di ricerca. Google ha integrato Lyria 3 direttamente in prodotti destinati ai consumatori che milioni di persone utilizzano già, tra cui l'app Gemini e YouTube Shorts tramite Dream Track.
Come funziona Lyria 3?
A un livello base, descrivi cosa vuoi — un genere, un umore, il tempo, persino la lingua dei testi — e Lyria 3 compone un brano che corrisponde alla tua descrizione. Il modello genera audio a un tasso di campionamento di 48 kHz utilizzando uscita stereo PCM a 16 bit, che è audio di qualità di produzione.
Ciò che rende Lyria 3 tecnicamente impressionante è come affronta la sfida fondamentale della generazione musicale. La musica è continua e multilivello: melodia, armonia, ritmo, timbro e coerenza a lungo raggio devono funzionare simultaneamente. Una canzone deve suonare come la stessa canzone dal primo secondo all'ultimo. Lyria 3 genera musica da zero piuttosto che assemblare loop o componenti pre-fatti.
Specifiche tecniche chiave
| Caratteristica | Dettaglio |
|---|---|
| Qualità di uscita | 48 kHz, stereo PCM a 16 bit |
| Durata del brano | 30 secondi (limite attuale) |
| Tipi di input | Testo, immagini, video |
| Uscita include | Voci, testi, strumentazione, copertina |
| Watermarking | SynthID incorporato nell'audio |
| Disponibilità | App Gemini (mobile + desktop) |
Tre principali miglioramenti rispetto a Lyria 2
1. Generazione automatica dei testi
Con Lyria 2, dovevi fornire i tuoi testi. Lyria 3 li scrive per te — basta descrivere un tema come "una divertente canzone rock su codificare a tarda notte" e il modello compone sia la musica che le parole.
2. Maggiore controllo creativo
Ora hai un controllo dettagliato su genere, strumenti, voci, tempo e stile. Puoi mescolare generi (K-pop incontra Bollywood, ad esempio), specificare stili di canto e persino scegliere tra più lingue tra cui inglese, spagnolo, giapponese, coreano, hindi, francese, tedesco e portoghese.
3. Maggiore qualità audio
L'uscita è notevolmente più realistica e musicalmente complessa. Questi sono arrangiamenti completi con più strumenti e voci — non loop assemblati. Il mix stereo presenta un panning chiaro, strumenti ben separati e artefatti vocali minimi.
Input multimodale: oltre il testo
Il testo non è l'unico input che Lyria 3 accetta. Puoi caricare un immagine o un video, e il modello genererà un brano che corrisponde al contenuto visivo. Carica una foto di vacanza da San Francisco, e Lyria 3 potrebbe comporre un brano pop fresco sull'aria di mare e le luci della città.
Questo ti dice che Google sta trattando la musica come una modalità di prima classe insieme a testo e visione. L'audio non è più un pensiero secondario nell'ecosistema Gemini.
Lyria RealTime: Direzione musicale dal vivo
Google DeepMind ha anche introdotto Lyria RealTime, una capacità separata che genera musica in tempo reale tramite uno stream autoregressivo basato su chunk. L'audio viene prodotto in chunk di due secondi su una connessione WebSocket bidirezionale.
Il modello guarda indietro al contesto precedente per mantenere il groove e in avanti ai controlli dell'utente per regolare stile e direzione. Questo consente una direzione dal vivo utilizzando prompt ponderati — puoi cambiare l'umore o l'istrumentazione mentre la musica suona, e il modello si adatta con meno di 2 secondi di latenza.
Music AI Sandbox
Per i musicisti che vogliono un controllo pratico, Google ha costruito il Music AI Sandbox. Questo strumento ti consente di:
- Prendere un semplice humm o una linea di pianoforte di base e trasformarla in un arrangiamento orchestrale completo
- Utilizzare accordi MIDI per generare cori vocali
- Cambiare strumenti con prompt testuali mantenendo la stessa melodia
Questo è un AI con l'uomo nel loop dove il modello diventa qualcosa con cui improvvisare, non solo qualcosa a cui fare domande.
A chi è destinato Lyria 3?
- Creatori di contenuti che hanno bisogno di musica di sottofondo per video, podcast e social media
- Musicisti in cerca di un collaboratore creativo per prototipazione rapida
- Marketer che necessitano di jingle, musica pubblicitaria e colonne sonore per brand
- Creatori di YouTube che possono utilizzare Dream Track per colonne sonore di Shorts
- Chiunque voglia sperimentare con la creazione musicale senza abilità tecniche
La conclusione
Lyria 3 rappresenta un cambiamento dagli strumenti musicali AI statici verso un sistema creativo integrato e guidato da agenti. Musica, immagini e testo si stanno unendo in un unico flusso di lavoro all'interno di Gemini. Il limite di 30 secondi per i brani è temporaneo — l'architettura supporta generazioni più lunghe, e Google ha accennato a un eventuale rilascio dell'API che trasformerebbe Lyria 3 da un giocattolo per consumatori in un'infrastruttura.
Che tu sia un musicista professionista o qualcuno che non ha mai scritto una nota, Lyria 3 rende la creazione musicale accessibile come digitare una frase.