Lyria 3とは?
Lyria 3は、Google DeepMindの最も高度な音楽生成モデルであり、2026年初頭にGeminiアプリ内で発表されました。手動で歌詞を入力する必要があった前身のLyria 2とは異なり、Lyria 3は、自然言語プロンプトのみから、オリジナルの歌詞、ボーカル、インストゥルメンタル、さらにはカバーアートを含む、完全な30秒の音楽トラックを生成します。
これは研究デモではありません。Googleは、Lyria 3を、GeminiアプリやDream Track経由のYouTube Shortsなど、すでに何百万人もの人々が使用している消費者向け製品に直接投入しました。
Lyria 3の仕組み
基本的なレベルでは、ジャンル、ムード、テンポ、さらには歌詞の言語など、必要なものを記述すると、Lyria 3があなたの記述に一致するトラックを作曲します。このモデルは、48 kHzのサンプルレートで、16ビットPCMステレオ出力を使用してオーディオを生成します。これは、制作品質のオーディオです。
Lyria 3が技術的に印象的なのは、音楽生成の根本的な課題をどのように処理するかです。音楽は連続的で多層的です。メロディー、ハーモニー、リズム、音色、そして長距離のコヒーレンスがすべて同時に機能する必要があります。曲は、最初の秒から最後まで同じ曲のように聞こえる必要があります。Lyria 3は、既製のループやコンポーネントを組み立てるのではなく、ゼロから音楽を生成します。
主な技術仕様
| 機能 | 詳細 |
|---|---|
| 出力品質 | 48 kHz、16ビットPCMステレオ |
| トラックの長さ | 30秒(現在の制限) |
| 入力タイプ | テキスト、画像、ビデオ |
| 出力内容 | ボーカル、歌詞、インストゥルメンタル、カバーアート |
| 透かし | SynthIDがオーディオに埋め込まれています |
| 利用可能 | Geminiアプリ(モバイル+デスクトップ) |
Lyria 2からの3つの大きな改善点
1. 自動歌詞生成
Lyria 2では、独自の歌詞を提供する必要がありました。Lyria 3は、あなたのために歌詞を作成します。「深夜のコーディングについての楽しいロックソング」のようなテーマを記述するだけで、モデルは音楽と歌詞の両方を作曲します。
2. より優れたクリエイティブコントロール
ジャンル、楽器、ボーカル、テンポ、スタイルを細かく制御できるようになりました。ジャンルをブレンドしたり(たとえば、K-popとボリウッドを組み合わせる)、歌唱スタイルを指定したり、英語、スペイン語、日本語、韓国語、ヒンディー語、フランス語、ドイツ語、ポルトガル語など、複数の言語から選択したりすることもできます。
3. より高いオーディオ品質
出力は、明らかにリアルで音楽的に複雑になっています。これらは、ステッチされたループではなく、複数の楽器とボーカルを含む完全なアレンジメントです。ステレオミックスは、クリアなパンニング、適切に分離された楽器、および最小限のボーカルアーティファクトを備えています。
マルチモーダル入力:テキストを超えて
テキストは、Lyria 3が受け入れる唯一の入力ではありません。画像またはビデオをアップロードすると、モデルは視覚コンテンツに一致するトラックを生成します。サンフランシスコからの休暇の写真をアップロードすると、Lyria 3は、そよ風と街の明かりについてのさわやかなポップトラックを作曲するかもしれません。
これは、Googleが音楽をテキストやビジョンと並ぶ一流のモダリティとして扱っていることを示しています。オーディオは、Geminiエコシステムではもはや後付けではありません。
Lyria RealTime:ライブ音楽ステアリング
Google DeepMindは、Lyria RealTimeも導入しました。これは、チャンクベースの自己回帰ストリームを介してリアルタイムで音楽を生成する別の機能です。オーディオは、双方向WebSocket接続を介して2秒のチャンクで生成されます。
このモデルは、グルーヴを維持するために以前のコンテキストを振り返り、スタイルと方向を調整するためにユーザーコントロールを前方に見ます。これにより、重み付けされたプロンプトを使用してライブステアリングが可能になります。音楽の再生中にムードや楽器を変更でき、モデルは2秒未満のレイテンシーで適応します。
Music AI Sandbox
ハンズオンコントロールを希望するミュージシャンのために、GoogleはMusic AI Sandboxを構築しました。このツールを使用すると、次のことができます。
- 単純なハミングまたは基本的なピアノラインを取得し、完全なオーケストラアレンジメントに変える
- MIDIコードを使用してボーカルクワイアを生成する
- 同じメロディーを維持しながら、テキストプロンプトで楽器を変更する
これは、モデルが単にクエリするものではなく、ジャムするようになるヒューマンインザループAIです。
Lyria 3は誰のためのものですか?
- ビデオ、ポッドキャスト、ソーシャルメディアのバックグラウンドミュージックが必要なコンテンツクリエーター
- 迅速なプロトタイピングのためのクリエイティブなコラボレーターを探しているミュージシャン
- ジングル、広告音楽、ブランドサウンドトラックが必要なマーケター
- ShortsのサウンドトラックにDream Trackを使用できるYouTubeクリエーター
- 技術的なスキルなしで音楽制作を試したいすべての人
結論
Lyria 3は、静的なAI音楽ツールから、統合されたエージェント駆動型のクリエイティブシステムへの移行を表しています。音楽、画像、テキストは、Gemini内の単一のワークフローに統合されています。30秒のトラック制限は一時的なものです。アーキテクチャはより長い生成をサポートしており、Googleは、Lyria 3を消費者向けのおもちゃからインフラストラクチャに変える最終的なAPIリリースを示唆しています。
あなたがプロのミュージシャンであろうと、音符を書いたことがない人であろうと、Lyria 3は文章を入力するのと同じくらい簡単に音楽制作を可能にします。