Was ist Lyria 3?
Lyria 3 ist das fortschrittlichste Musikgenerierungsmodell von Google DeepMind, das Anfang 2026 in der Gemini-App eingeführt wurde. Im Gegensatz zu seinem Vorgänger Lyria 2, der manuelle Texteingaben erforderte, generiert Lyria 3 vollständige 30-sekündige Musikstücke – einschließlich originaler Texte, Gesang, Instrumente und sogar Cover-Art – aus nichts weiter als einer Eingabe in natürlicher Sprache.
Dies ist keine Forschungsdemonstration. Google hat Lyria 3 direkt in verbraucherorientierte Produkte integriert, die bereits Millionen von Menschen nutzen, einschließlich der Gemini-App und YouTube Shorts über Dream Track.
Wie funktioniert Lyria 3?
Auf einer grundlegenden Ebene beschreiben Sie, was Sie möchten – ein Genre, eine Stimmung, das Tempo, sogar die Sprache der Texte – und Lyria 3 komponiert ein Stück, das Ihrer Beschreibung entspricht. Das Modell generiert Audio mit einer 48 kHz Abtastrate unter Verwendung von 16-Bit PCM Stereoausgabe, was Audio in Produktionsqualität ist.
Was Lyria 3 technisch beeindruckend macht, ist, wie es die grundlegende Herausforderung der Musikgenerierung bewältigt. Musik ist kontinuierlich und mehrschichtig: Melodie, Harmonie, Rhythmus, Klangfarbe und langfristige Kohärenz müssen alle gleichzeitig funktionieren. Ein Lied muss vom ersten bis zum letzten Moment wie dasselbe Lied klingen. Lyria 3 generiert Musik von Grund auf neu, anstatt vorgefertigte Loops oder Komponenten zusammenzustellen.
Wichtige technische Spezifikationen
| Funktion | Detail |
|---|---|
| Ausgabequalität | 48 kHz, 16-Bit PCM Stereo |
| Stücklänge | 30 Sekunden (aktuelle Obergrenze) |
| Eingabetypen | Text, Bilder, Video |
| Ausgabe umfasst | Gesang, Texte, Instrumente, Cover-Art |
| Wasserzeichen | SynthID in Audio eingebettet |
| Verfügbarkeit | Gemini-App (mobil + Desktop) |
Drei wesentliche Verbesserungen gegenüber Lyria 2
1. Automatische Texterstellung
Mit Lyria 2 mussten Sie Ihre eigenen Texte bereitstellen. Lyria 3 schreibt sie für Sie – beschreiben Sie einfach ein Thema wie "ein lustiges Rocklied über das Programmieren spät in der Nacht" und das Modell komponiert sowohl die Musik als auch die Worte.
2. Größere kreative Kontrolle
Sie haben jetzt eine feinkörnige Kontrolle über Genre, Instrumente, Gesang, Tempo und Stil. Sie können Genres mischen (K-Pop trifft Bollywood, zum Beispiel), Gesangsstile angeben und sogar aus mehreren Sprachen wählen, darunter Englisch, Spanisch, Japanisch, Koreanisch, Hindi, Französisch, Deutsch und Portugiesisch.
3. Höhere Audioqualität
Die Ausgabe ist merklich realistischer und musikalisch komplexer. Dies sind vollständige Arrangements mit mehreren Instrumenten und Gesang – keine zusammengenähten Loops. Der Stereo-Mix bietet klares Panning, gut getrennte Instrumente und minimale Gesangartefakte.
Multimodale Eingabe: Über Text hinaus
Text ist nicht die einzige Eingabe, die Lyria 3 akzeptiert. Sie können ein Bild oder ein Video hochladen, und das Modell generiert ein Stück, das mit dem visuellen Inhalt übereinstimmt. Laden Sie ein Urlaubsfoto aus San Francisco hoch, und Lyria 3 könnte ein luftiges Popstück über die Meeresbrise und die Lichter der Stadt komponieren.
Dies zeigt, dass Google Musik als eine erstklassige Modalität neben Text und Vision behandelt. Audio ist im Gemini-Ökosystem nicht länger ein Nachgedanke.
Lyria RealTime: Live-Musiksteuerung
Google DeepMind hat auch Lyria RealTime eingeführt, eine separate Funktion, die Musik in Echtzeit über einen chunk-basierten autoregressiven Stream generiert. Audio wird in zwei-Sekunden-Stücken über eine bidirektionale WebSocket-Verbindung produziert.
Das Modell schaut zurück auf den vorherigen Kontext, um den Groove aufrechtzuerhalten, und nach vorne auf die Benutzersteuerungen, um Stil und Richtung anzupassen. Dies ermöglicht eine live Steuerung mit gewichteten Eingaben – Sie können die Stimmung oder Instrumentierung während der Musik ändern, und das Modell passt sich mit weniger als 2 Sekunden Latenz an.
Musik KI Sandbox
Für Musiker, die praktische Kontrolle wünschen, hat Google die Music AI Sandbox entwickelt. Dieses Tool ermöglicht es Ihnen:
- Eine einfache Melodie oder eine grundlegende Klavierlinie in ein vollständiges Orchesterarrangement zu verwandeln
- MIDI-Akkorde zu verwenden, um Gesangschöre zu generieren
- Instrumente mit Texteingaben zu ändern, während die gleiche Melodie beibehalten wird
Dies ist KI mit menschlicher Beteiligung, bei der das Modell zu etwas wird, mit dem Sie jammen können, nicht nur etwas, das Sie abfragen.
Für wen ist Lyria 3 geeignet?
- Inhaltsersteller, die Hintergrundmusik für Videos, Podcasts und soziale Medien benötigen
- Musiker, die einen kreativen Partner für schnelles Prototyping suchen
- Vermarkter, die Jingles, Werbemusik und Markensoundtracks benötigen
- YouTube-Ersteller, die Dream Track für Shorts-Soundtracks nutzen können
- Jeder, der mit der Musikproduktion experimentieren möchte, ohne technische Fähigkeiten
Fazit
Lyria 3 stellt einen Wandel von statischen KI-Musiktools hin zu einem integrierten, agentengestützten kreativen System dar. Musik, Bilder und Text verschmelzen in einem einzigen Workflow innerhalb von Gemini. Die 30-sekündige Stückgrenze ist vorübergehend – die Architektur unterstützt längere Generierungen, und Google hat auf eine zukünftige API-Veröffentlichung hingewiesen, die Lyria 3 von einem Verbraucherspielzeug in eine Infrastruktur verwandeln würde.
Ob Sie ein professioneller Musiker oder jemand sind, der noch nie eine Note geschrieben hat, Lyria 3 macht die Musikproduktion so zugänglich wie das Tippen eines Satzes.