AI资讯

8月14日MiniMax推出音乐生成模型MiniMax-Music3,最长生成5分钟歌曲

智能摘要

的线索投递!分钟的完整歌曲。模型采用分层自回归架构:文件。官方称,模型能够在长音频中保持音乐主题、节奏、歌声身份和编曲推进,覆盖前奏、主歌、预副歌、副歌、桥段、器乐间奏和尾奏等结构。

那天是8月14日, 有一家AI公司, 正式去发布了一款音乐生成模型。只要你去输入歌词, 或者输入音乐描述, 它就能够自动生成完整歌曲, 最长能够达到5分钟, 这在AI音乐领域, 是一次重要突破。

音乐创作方式迎来巨变

如今正在发生这种情况, AI音乐生成技术取得的进展, 正促使人们创作音乐的方式发生变化。以往之时, 写歌这件事要有那专业乐理知识, 以及乐器演奏方面的能力才行, 而如今, 只要得到一段描述文字, 系统便就能够帮你生成一首完整的歌曲, 这所代表的意义是, 普通人现在靠着它也能够拥有音乐创作的能力。

这项技术把音乐创作的门槛给降低了, 不论你会不会弹琴作曲, 只要你拥有不错的点子, 还有好的歌词, AI便能助力你将其转化为能够听的歌曲, 这般便利性会激发更多人的创作热情, 还会使得音乐创作变得愈发普及。

输入描述即可生成完整歌曲

依据用户所告知的歌词以及音乐描述, 进而生成歌曲, 这便是这款新模型的核心能力所在。只需要向AI表明你期望的音乐类型, 诸如悲伤的情歌或者激昂的摇滚之类, 它即能够按照你的要求去创作出与之对应的作品。这样的交互方式特别直观, 并不需要任何专业的音乐知识。

有官方宣称, 此模型具备理解并且执行较为复杂的音乐创作指令的能力。你能够描述期望的情感氛围, 还能描述乐器搭配, 甚至可以描述具体的旋律走向。此时, AI都会尽其所能在生成过程当中, 体现这般些的细节细节, 以使最终成品朝着距离你的预期更接近的目标发展。

分层自回归架构提升连贯性

于技术层面而言呵,这款模型运用了分层自回归这一架构。此等架构使得模型于处理音乐之际, 具备更优的层次感以及结构感, 能够进而协调妥善处理不同时间尺度的音乐元素。相较于历来传统的生成方式, 分层自回归能够更为精准地把控音乐的整体结构以及细节表达。

分层自回归架构的优势在哪儿呢, 就是它可以保证音乐具备一致性以及连贯性。模型在生成的时候, 会持续参考已经生成的内容, 以此确保前后节奏一直保持统一, 旋律也没问题, 而且编曲风格同样保持统一, 避免出现听起来像是拼凑出来所以显得很零碎的片段。

最长5分钟完整歌曲输出

当前市面上的多数 AI 音乐工具, 仅能够生成几十秒长度的片段, 然而这款全新的模型, 却能够产出最长达 5 分钟的完整曲子。5 分钟的时长已然能够包容一首流行歌曲的完整架构, 起于开场, 至于结尾, 畅行无阻, 无需再反复地拼接, 抑或是循环播放。

这样一次突破使得基于AI生成出来的音乐拥有了能够实际运用的价值。在无论是被当作背景音乐这一方面或者个人创作出来的作品这一方面, 5分钟所具有的完整时长完全足够去满足绝大多数场景的一些需求的, 它不再单纯只是那种仅是为了炫技的短片段展示了。

输出32kHz立体声WAV文件

于输出格式范畴, 该模型所生成的音频, 是具备32kHz采样率的, 是有着16-bit位深的, 是立体声的WAV文件。此规格尽管无法达到专业录音室的标准, 然而却已足以供日常使用以及分享传播。WAV格式属于无损音频, 确保了音质的原始特性, 不存在额外的压缩损耗。

就普通用户而言, 这般的音质已然是完全足够使用的了。不管是发布于社交媒体之上, 还是在个人设备里进行播放, 32kHz立体声均能够给予良好的听觉感受。这同样展现出了开发团队对于音质实用性以及文件体积二者之间的平衡权衡。

涵盖完整歌曲结构元素

官方表明, 由模型所生成的音乐, 能够将前奏、主歌、预副歌、副歌、桥段、器乐间奏以及尾奏等一系列完整结构予以涵盖。这存在着一种意味, 即人工智能不但能够于较短的时间范围之内生成质量尚可的旋律,而且还能够对歌曲的各个段落进行合理的安排, 从而使得整首歌曲呈现出起承转合的态势, 并非是单调乏味地重复。

当前这种对于歌曲结构的理解, 是AI音乐生成能力得以进阶的关键重要标识。以往AI生成音乐常常遭受指责批评说“千篇一律”, 如今现在能够分辨区分不一样的段落并且做出相对应的变化, 这表明说明模型对于音乐的理解正在朝着走向成熟的方向发展。

在音乐创作这个领域当中, 正在经历着一场技术方面的革命, 你认为由AI所生成的音乐, 能够达到真正做音乐之人的水平吗, 欢迎在评论的区域分享你个人的看法, 要是你感觉这一篇文章是有着用处的, 可别忘了去点赞以及分享哦!

相关文章