Qu'est-ce que Lyria 3 ?
Lyria 3 est le modèle de génération de musique le plus avancé de Google DeepMind, lancé début 2026 dans l'application Gemini. Contrairement à son prédécesseur Lyria 2, qui nécessitait la saisie manuelle des paroles, Lyria 3 génère des pistes musicales complètes de 30 secondes, y compris des paroles originales, des voix, des instruments et même des pochettes d'album, à partir d'une simple invite en langage naturel.
Il ne s'agit pas d'une démonstration de recherche. Google a intégré Lyria 3 directement dans des produits destinés aux consommateurs que des millions de personnes utilisent déjà, notamment l'application Gemini et YouTube Shorts via Dream Track.
Comment fonctionne Lyria 3 ?
Au niveau de base, vous décrivez ce que vous voulez (un genre, une ambiance, le tempo, voire la langue des paroles) et Lyria 3 compose une piste qui correspond à votre description. Le modèle génère de l'audio à un taux d'échantillonnage de 48 kHz en utilisant une sortie stéréo PCM 16 bits, qui est un audio de qualité professionnelle.
Ce qui rend Lyria 3 techniquement impressionnant, c'est la façon dont il gère le défi fondamental de la génération de musique. La musique est continue et multicouche : la mélodie, l'harmonie, le rythme, le timbre et la cohérence à long terme doivent tous fonctionner simultanément. Une chanson doit ressembler à la même chanson de la première à la dernière seconde. Lyria 3 génère de la musique à partir de zéro plutôt que d'assembler des boucles ou des composants préfabriqués.
Principales caractéristiques techniques
| Caractéristique | Détail |
|---|---|
| Qualité de la sortie | 48 kHz, stéréo PCM 16 bits |
| Durée de la piste | 30 secondes (limite actuelle) |
| Types d'entrée | Texte, images, vidéo |
| La sortie comprend | Voix, paroles, instruments, pochette d'album |
| Filigrane | SynthID intégré dans l'audio |
| Disponibilité | Application Gemini (mobile + ordinateur) |
Trois améliorations majeures par rapport à Lyria 2
1. Génération automatique de paroles
Avec Lyria 2, vous deviez fournir vos propres paroles. Lyria 3 les écrit pour vous : décrivez simplement un thème comme « une chanson rock amusante sur le codage tard dans la nuit » et le modèle compose à la fois la musique et les mots.
2. Plus de contrôle créatif
Vous avez maintenant un contrôle précis sur le genre, les instruments, les voix, le tempo et le style. Vous pouvez mélanger les genres (K-pop rencontre Bollywood, par exemple), spécifier les styles de chant et même choisir parmi plusieurs langues, dont l'anglais, l'espagnol, le japonais, le coréen, l'hindi, le français, l'allemand et le portugais.
3. Qualité audio supérieure
La sortie est sensiblement plus réaliste et musicalement complexe. Il s'agit d'arrangements complets avec plusieurs instruments et voix, et non de boucles assemblées. Le mixage stéréo offre un panoramique clair, des instruments bien séparés et un minimum d'artefacts vocaux.
Entrée multimodale : au-delà du texte
Le texte n'est pas la seule entrée acceptée par Lyria 3. Vous pouvez télécharger une image ou une vidéo, et le modèle générera une piste qui correspond au contenu visuel. Téléchargez une photo de vacances de San Francisco, et Lyria 3 pourrait composer une chanson pop légère sur la brise de l'océan et les lumières de la ville.
Cela vous indique que Google considère la musique comme une modalité de premier ordre aux côtés du texte et de la vision. L'audio n'est plus une réflexion après coup dans l'écosystème Gemini.
Lyria RealTime : pilotage de la musique en direct
Google DeepMind a également introduit Lyria RealTime, une capacité distincte qui génère de la musique en temps réel via un flux autorégressif basé sur des blocs. L'audio est produit en blocs de deux secondes via une connexion WebSocket bidirectionnelle.
Le modèle regarde en arrière le contexte précédent pour maintenir le rythme et en avant les commandes de l'utilisateur pour ajuster le style et la direction. Cela permet un pilotage en direct à l'aide d'invites pondérées : vous pouvez modifier l'ambiance ou l'instrumentation pendant que la musique joue, et le modèle s'adapte avec moins de 2 secondes de latence.
Bac à sable d'IA musicale
Pour les musiciens qui souhaitent un contrôle pratique, Google a créé le Bac à sable d'IA musicale. Cet outil vous permet de :
- Transformer un simple fredonnement ou une ligne de piano de base en un arrangement orchestral complet
- Utiliser des accords MIDI pour générer des chœurs vocaux
- Changer d'instrument avec des invites textuelles tout en conservant la même mélodie
Il s'agit d'une IA humaine dans la boucle où le modèle devient quelque chose avec lequel vous improvisez, pas seulement quelque chose que vous interrogez.
À qui s'adresse Lyria 3 ?
- Créateurs de contenu qui ont besoin de musique de fond pour des vidéos, des podcasts et des médias sociaux
- Musiciens à la recherche d'un collaborateur créatif pour un prototypage rapide
- Marketeurs qui ont besoin de jingles, de musique publicitaire et de bandes sonores de marque
- Créateurs YouTube qui peuvent utiliser Dream Track pour les bandes sonores de Shorts
- Toute personne qui souhaite expérimenter la création musicale sans compétences techniques
L'essentiel
Lyria 3 représente un passage des outils de musique IA statiques à un système créatif intégré et axé sur l'agent. La musique, les images et le texte convergent en un seul flux de travail dans Gemini. La limite de piste de 30 secondes est temporaire : l'architecture prend en charge une génération plus longue, et Google a laissé entendre une éventuelle publication d'API qui transformerait Lyria 3 d'un jouet grand public en infrastructure.
Que vous soyez un musicien professionnel ou quelqu'un qui n'a jamais écrit une note, Lyria 3 rend la création musicale aussi accessible que la saisie d'une phrase.