O Que É Lyria 3?
Lyria 3 é o modelo de geração de música mais avançado da Google DeepMind, lançado no início de 2026 dentro do aplicativo Gemini. Ao contrário de seu predecessor Lyria 2, que exigia a inserção manual de letras, Lyria 3 gera faixas musicais completas de 30 segundos — incluindo letras originais, vocais, instrumentais e até arte de capa — a partir de nada mais do que um comando em linguagem natural.
Isso não é uma demonstração de pesquisa. O Google lançou o Lyria 3 diretamente em produtos voltados para o consumidor que milhões de pessoas já usam, incluindo o aplicativo Gemini e o YouTube Shorts via Dream Track.
Como Funciona o Lyria 3?
Em um nível básico, você descreve o que deseja — um gênero, um humor, o tempo, até mesmo o idioma das letras — e o Lyria 3 compõe uma faixa que corresponde à sua descrição. O modelo gera áudio a uma taxa de amostragem de 48 kHz usando saída estéreo PCM de 16 bits, que é áudio de qualidade de produção.
O que torna o Lyria 3 tecnicamente impressionante é como ele lida com o desafio fundamental da geração musical. A música é contínua e multilayer: melodia, harmonia, ritmo, timbre e coerência de longo alcance precisam funcionar simultaneamente. Uma canção deve soar como a mesma canção do primeiro segundo ao último. O Lyria 3 gera música do zero, em vez de montar loops ou componentes pré-fabricados.
Especificações Técnicas Principais
| Recurso | Detalhe |
|---|---|
| Qualidade de Saída | 48 kHz, 16-bit PCM estéreo |
| Duração da Faixa | 30 segundos (limite atual) |
| Tipos de Entrada | Texto, imagens, vídeo |
| Saída Inclui | Vocais, letras, instrumentais, arte de capa |
| Marcação d'água | SynthID embutido no áudio |
| Disponibilidade | Aplicativo Gemini (móvel + desktop) |
Três Principais Melhorias em Relação ao Lyria 2
1. Geração Automática de Letras
Com o Lyria 2, você precisava fornecer suas próprias letras. O Lyria 3 as escreve para você — basta descrever um tema como "uma divertida canção de rock sobre programar à noite" e o modelo compõe tanto a música quanto as palavras.
2. Maior Controle Criativo
Agora você tem controle detalhado sobre gênero, instrumentos, vocais, tempo e estilo. Você pode misturar gêneros (K-pop encontra Bollywood, por exemplo), especificar estilos de canto e até escolher entre vários idiomas, incluindo inglês, espanhol, japonês, coreano, hindi, francês, alemão e português.
3. Maior Qualidade de Áudio
A saída é notavelmente mais realista e musicalmente complexa. Estas são arranjos completos com múltiplos instrumentos e vocais — não são loops costurados. A mixagem estéreo apresenta um panorama claro, instrumentos bem separados e artefatos vocais mínimos.
Entrada Multimodal: Além do Texto
Texto não é a única entrada que o Lyria 3 aceita. Você pode enviar uma imagem ou um vídeo, e o modelo gerará uma faixa que corresponda ao conteúdo visual. Envie uma foto de férias de São Francisco, e o Lyria 3 pode compor uma faixa pop leve sobre a brisa do oceano e as luzes da cidade.
Isso mostra que o Google está tratando a música como uma modalidade de primeira classe ao lado de texto e visão. O áudio não é mais um pensamento secundário no ecossistema Gemini.
Lyria RealTime: Direção Musical Ao Vivo
A Google DeepMind também introduziu o Lyria RealTime, uma capacidade separada que gera música em tempo real via um fluxo autoregressivo baseado em chunks. O áudio é produzido em pedaços de dois segundos através de uma conexão WebSocket bidirecional.
O modelo olha para trás no contexto anterior para manter o groove e para frente nos controles do usuário para ajustar estilo e direção. Isso permite uma direção ao vivo usando prompts ponderados — você pode mudar o humor ou a instrumentação enquanto a música está tocando, e o modelo se adapta com menos de 2 segundos de latência.
Sandbox de Música AI
Para músicos que desejam controle prático, o Google construiu o Music AI Sandbox. Esta ferramenta permite que você:
- Pegue um simples zumbido ou uma linha básica de piano e transforme em um arranjo orquestral completo
- Use acordes MIDI para gerar coros vocais
- Mude instrumentos com comandos de texto enquanto mantém a mesma melodia
Isso é uma IA com intervenção humana onde o modelo se torna algo com o qual você toca, não apenas algo que você consulta.
Para Quem É o Lyria 3?
- Criadores de conteúdo que precisam de música de fundo para vídeos, podcasts e redes sociais
- Músicos em busca de um colaborador criativo para prototipagem rápida
- Profissionais de marketing que precisam de jingles, música publicitária e trilhas sonoras de marca
- Criadores do YouTube que podem usar o Dream Track para trilhas sonoras de Shorts
- Qualquer um que queira experimentar a criação musical sem habilidades técnicas
A Conclusão
O Lyria 3 representa uma mudança de ferramentas de música AI estáticas para um sistema criativo integrado e orientado por agentes. Música, imagens e texto estão se fundindo em um único fluxo de trabalho dentro do Gemini. O limite de 30 segundos para faixas é temporário — a arquitetura suporta gerações mais longas, e o Google sugeriu um eventual lançamento de API que transformaria o Lyria 3 de um brinquedo de consumidor em infraestrutura.
Seja você um músico profissional ou alguém que nunca escreveu uma nota, o Lyria 3 torna a criação musical tão acessível quanto digitar uma frase.