什么是 Lyria 3?
Lyria 3 是 Google DeepMind 最先进的音乐生成模型,于 2026 年初在 Gemini 应用程序中推出。与需要手动输入歌词的前代产品 Lyria 2 不同,Lyria 3 可以生成完整的 30 秒音乐曲目——包括原创歌词、人声、乐器,甚至封面艺术——而只需要一个自然语言提示。
这不是一个研究演示。Google 已将 Lyria 3 直接推向数百万用户已经使用的面向消费者的产品,包括 Gemini 应用程序和通过 Dream Track 实现的 YouTube Shorts。
Lyria 3 如何工作?
在基本层面上,你描述你想要的东西——一种流派、一种情绪、节奏,甚至是歌词的语言——Lyria 3 就会创作一首符合你描述的曲目。该模型以 48 kHz 采样率使用 16 位 PCM 立体声输出生成音频,这是制作质量的音频。
Lyria 3 在技术上令人印象深刻的地方在于它如何处理音乐生成的基本挑战。音乐是连续且多层次的:旋律、和声、节奏、音色和长程连贯性都需要同时工作。一首歌从第一秒到最后一秒都必须听起来像同一首歌。Lyria 3 从头开始生成音乐,而不是组装预先制作好的循环或组件。
主要技术规格
| 功能 | 详细信息 |
|---|---|
| 输出质量 | 48 kHz,16 位 PCM 立体声 |
| 曲目长度 | 30 秒(当前上限) |
| 输入类型 | 文本、图像、视频 |
| 输出包括 | 人声、歌词、乐器、封面艺术 |
| 水印 | SynthID 嵌入在音频中 |
| 可用性 | Gemini 应用程序(移动设备 + 桌面设备) |
相比 Lyria 2 的三大改进
1. 自动歌词生成
使用 Lyria 2,你需要提供自己的歌词。Lyria 3 为你编写歌词——只需描述一个主题,例如“一首关于深夜编码的有趣的摇滚歌曲”,该模型就会创作音乐和歌词。
2. 更强的创作控制
你现在可以对流派、乐器、人声、节奏和风格进行细粒度控制。你可以混合流派(例如,K-pop 融合宝莱坞),指定演唱风格,甚至可以从多种语言中进行选择,包括英语、西班牙语、日语、韩语、印地语、法语、德语和葡萄牙语。
3. 更高的音频质量
输出明显更逼真,音乐上也更复杂。这些是具有多种乐器和人声的完整编排——而不是拼接的循环。立体声混音具有清晰的声像、分离良好的乐器和最少的人声伪影。
多模态输入:超越文本
文本不是 Lyria 3 接受的唯一输入。你可以上传图像或视频,模型将生成与视觉内容匹配的曲目。上传一张来自旧金山的度假照片,Lyria 3 可能会创作一首关于海风和城市灯光的轻快流行歌曲。
这告诉你 Google 正在将音乐视为与文本和视觉并列的一流模态。在 Gemini 生态系统中,音频不再是事后才考虑的事情。
Lyria RealTime:实时音乐引导
Google DeepMind 还推出了 Lyria RealTime,这是一种单独的功能,可通过基于块的自回归流实时生成音乐。音频通过双向 WebSocket 连接以两秒的块生成。
该模型回顾之前的上下文以保持节奏,并向前查看用户控件以调整风格和方向。这允许使用加权提示进行实时引导——你可以在音乐播放时更改情绪或乐器,并且模型会在不到 2 秒的延迟内进行调整。
音乐 AI 沙盒
对于想要亲身控制的音乐家,Google 构建了 音乐 AI 沙盒。此工具可让你:
- 将简单的哼唱或基本的钢琴线变成完整的管弦乐编排
- 使用 MIDI 和弦生成人声合唱团
- 使用文本提示更改乐器,同时保持相同的旋律
这是人机协作的 AI,模型成为你可以一起即兴创作的东西,而不仅仅是你查询的东西。
Lyria 3 适合谁?
- 需要视频、播客和社交媒体背景音乐的内容创作者
- 寻找快速原型创作的创意合作者的音乐家
- 需要叮当声、广告音乐和品牌配乐的营销人员
- 可以使用 Dream Track 为 Shorts 配乐的 YouTube 创作者
- 想要在没有技术技能的情况下尝试音乐创作的任何人
结论
Lyria 3 代表了从静态 AI 音乐工具向集成、代理驱动的创意系统的转变。音乐、图像和文本正在 Gemini 内部合并为一个单一的工作流程。30 秒的曲目限制是暂时的——该架构支持更长的生成,并且 Google 已经暗示最终会发布 API,这将把 Lyria 3 从消费者的玩具变成基础设施。
无论你是专业音乐家还是从未写过音符的人,Lyria 3 都能让你像输入句子一样轻松地进行音乐创作。