¿Qué es Lyria 3?
Lyria 3 es el modelo de generación de música más avanzado de Google DeepMind, lanzado a principios de 2026 dentro de la aplicación Gemini. A diferencia de su predecesor Lyria 2, que requería la entrada manual de letras, Lyria 3 genera pistas musicales completas de 30 segundos — incluyendo letras originales, voces, instrumentales e incluso arte de portada — a partir de nada más que un aviso en lenguaje natural.
Esto no es una demostración de investigación. Google ha integrado Lyria 3 directamente en productos orientados al consumidor que millones de personas ya utilizan, incluyendo la aplicación Gemini y YouTube Shorts a través de Dream Track.
¿Cómo funciona Lyria 3?
A un nivel básico, describes lo que quieres — un género, un estado de ánimo, el tempo, incluso el idioma de las letras — y Lyria 3 compone una pista que coincide con tu descripción. El modelo genera audio a una tasa de muestreo de 48 kHz utilizando salida estéreo PCM de 16 bits, que es audio de calidad de producción.
Lo que hace que Lyria 3 sea técnicamente impresionante es cómo maneja el desafío fundamental de la generación musical. La música es continua y multicapa: melodía, armonía, ritmo, timbre y coherencia a largo plazo deben funcionar simultáneamente. Una canción tiene que sonar como la misma canción desde el primer segundo hasta el último. Lyria 3 genera música desde cero en lugar de ensamblar bucles o componentes prehechos.
Especificaciones técnicas clave
| Característica | Detalle |
|---|---|
| Calidad de salida | 48 kHz, PCM estéreo de 16 bits |
| Duración de la pista | 30 segundos (límite actual) |
| Tipos de entrada | Texto, imágenes, video |
| Salida incluye | Voces, letras, instrumentales, arte de portada |
| Marcas de agua | SynthID incrustado en audio |
| Disponibilidad | Aplicación Gemini (móvil + escritorio) |
Tres mejoras importantes sobre Lyria 2
1. Generación automática de letras
Con Lyria 2, necesitabas proporcionar tus propias letras. Lyria 3 las escribe por ti — solo describe un tema como "una divertida canción de rock sobre programar tarde en la noche" y el modelo compone tanto la música como las palabras.
2. Mayor control creativo
Ahora tienes control detallado sobre el género, los instrumentos, las voces, el tempo y el estilo. Puedes mezclar géneros (K-pop se encuentra con Bollywood, por ejemplo), especificar estilos de canto e incluso elegir entre múltiples idiomas, incluyendo inglés, español, japonés, coreano, hindi, francés, alemán y portugués.
3. Mayor calidad de audio
La salida es notablemente más realista y musicalmente compleja. Estas son arreglos completos con múltiples instrumentos y voces — no bucles ensamblados. La mezcla estéreo presenta paneo claro, instrumentos bien separados y artefactos vocales mínimos.
Entrada multimodal: más allá del texto
El texto no es la única entrada que Lyria 3 acepta. Puedes subir una imagen o un video, y el modelo generará una pista que coincida con el contenido visual. Sube una foto de vacaciones de San Francisco, y Lyria 3 podría componer una pista pop fresca sobre la brisa del océano y las luces de la ciudad.
Esto te indica que Google está tratando la música como una modalidad de primera clase junto con el texto y la visión. El audio ya no es un pensamiento secundario en el ecosistema de Gemini.
Lyria RealTime: Control de música en vivo
Google DeepMind también ha introducido Lyria RealTime, una capacidad separada que genera música en tiempo real a través de un flujo autorregresivo basado en fragmentos. El audio se produce en fragmentos de dos segundos a través de una conexión WebSocket bidireccional.
El modelo mira hacia atrás en el contexto anterior para mantener el ritmo y hacia adelante en los controles del usuario para ajustar el estilo y la dirección. Esto permite un control en vivo utilizando avisos ponderados — puedes cambiar el estado de ánimo o la instrumentación mientras la música está sonando, y el modelo se adapta con menos de 2 segundos de latencia.
Music AI Sandbox
Para los músicos que desean control práctico, Google ha construido el Music AI Sandbox. Esta herramienta te permite:
- Tomar un simple tarareo o una línea básica de piano y convertirla en un arreglo orquestal completo
- Usar acordes MIDI para generar coros vocales
- Cambiar instrumentos con avisos de texto mientras mantienes la misma melodía
Esto es IA con intervención humana donde el modelo se convierte en algo con lo que improvisas, no solo algo que consultas.
¿Para quién es Lyria 3?
- Creadores de contenido que necesitan música de fondo para videos, podcasts y redes sociales
- Músicos que buscan un colaborador creativo para prototipos rápidos
- Marketeros que necesitan jingles, música publicitaria y bandas sonoras de marca
- Creadores de YouTube que pueden usar Dream Track para bandas sonoras de Shorts
- Cualquiera que quiera experimentar con la creación musical sin habilidades técnicas
La conclusión
Lyria 3 representa un cambio de herramientas de música AI estáticas hacia un sistema creativo integrado y dirigido por agentes. La música, las imágenes y el texto se están colapsando en un solo flujo de trabajo dentro de Gemini. El límite de 30 segundos para las pistas es temporal — la arquitectura admite una generación más larga, y Google ha insinuado un eventual lanzamiento de API que convertiría a Lyria 3 de un juguete para consumidores en infraestructura.
Ya seas un músico profesional o alguien que nunca ha escrito una nota, Lyria 3 hace que la creación musical sea tan accesible como escribir una oración.