Google DeepMind 的音乐模型上线了,也是这里最便宜的一首歌

Google 今天早上在 fal 上发布了 Lyria 3.5,现在它已经在声音框里了。给它一段文字,它就写出一首完整的歌:曲子、编排,还有一个人声在唱它自己写的词。再给它一张图片,它就为那张图片配乐。
一首歌 3.5 积分。这里另一个会唱歌的模型 MiniMax Music 2.6 要 5.25。写这篇之前我们在它上面买了两首歌,一首只用文字,一首接了图片,fal 两次都收了 0.1000 美元。
三个做音乐的模型,各自适合什么
Lyria 上一首歌的价格是固定的,无论你要什么。它没有时长档、没有画质档、也没有数量档,所以一分钟的曲子和三分钟的曲子都是 3.5 积分。CassetteAI 是这里最便宜的,它做的是垫在画面下面的背景音乐,不是歌。MiniMax Music 会唱歌,而且它是会唱中文的那个。
| 模型 | 积分 | 你拿到的是什么 |
|---|---|---|
| CassetteAI Music | 每分钟 0.70 | 垫在画面下面的背景音乐,没有人声 |
| Lyria 3.5 | 每首 3.50 | 一整首带演唱的歌,长度你在文字里说了算 |
| MiniMax Music 2.6 | 每首 5.25 | 一整首带演唱的歌,而且它会唱中文 |
这个数字在你按下生成之前就写在按钮上,跟其他所有框一样。
用 Lyria 3.5 生成试试它会唱八种语言,其中没有中文
Google 列出的是英语、德语、西班牙语、法语、印地语、日语、韩语和葡萄牙语。你让它唱一句中文,它唱不出来。这就是 MiniMax Music 2.6 明明更贵却继续留在列表里的原因:中文演唱要用它,而这件事多出来的 1.75 积分就是这件事的成本。
Lyria 其他部分在任何语言下都能用,因为受限的只有「演唱」这一件事。用中文写一段纯器乐的要求,完全没问题。
这里没有时长滑块,长度你在文字里说
这里其他模型的时长都是你用一个控件设的。Lyria 没有,这是模型本身如此,不是我们的框少了什么。Google 自己的说明是把长度写进提示词里:写「a 2-minute track」,或者把段落标出来,比如「[0:00-0:30] Intro: soft piano」。
所以框只把你的文字送过去,别的什么都不送。我们买的那两首歌,一首 2 分 53 秒,一首 1 分 1 秒,来自要求不同长度的两段文字,价格都是 3.5 积分。要一首更长的歌不额外收费。
往框上接一张图片,它就为那张图片配乐
这是这里其他音乐模型都做不到的。把一张静态图接到跑 Lyria 的声音框上,它就会写出一段和这张图的情绪、主题相符的音乐。这是一张参考图,不是一帧画面:图片本身不会出现在文件里,因为文件是一首歌。
一次一张,这是 Google 公开的上限。框上会把它显示成一个参考图标签,和接进镜头的参考图是同一个标签,按钮上的价格不会变。
出来的是什么,里面被打上了什么
一个 44.1 kHz 立体声 MP3,外加它唱的那些词,框会把词和曲子一起留着。每个文件都带着 SynthID,这是 Google 自己的、听不出来的来源水印,用来说明这是机器做的。这是 Google 打的标记,所有地方的 Lyria 文件里都有,不是我们加的。
Google 的安全过滤会拒绝任何模仿真实歌手嗓音的要求,所以你点名要某位歌手,拿到的是一个拒绝,不是一首歌。
还有问题吗
它能唱中文吗
不能。Google 列了八种语言,里面没有中文。要中文演唱就用 MiniMax Music 2.6,一首 5.25 积分。
怎么做一首更长的歌
在文字里说:「a 2-minute track」,或者把段落连时间点一起写出来。这里没有时长控件,因为模型本身没有,而且更长的歌还是 3.5 积分。
接图片要额外收费吗
不要。一张图片,生成按钮上的数字两种情况都是 3.5。我们拿账单对过:买的两首歌都是 0.1000 美元,接图片的和没接的一样。



