Mustango:结合扩散模型, 提高文本生成音乐质量
划重点:
🔸 研究团队提出了一个名为 Mustango 的解决方案,扩展了 Tango 文本到音频模型,旨在通过丰富的说明来控制生成的音乐。
🔸 Mustango 利用音乐领域的知识,结合扩散模型,实现了从文本到音乐的转换。
🔸 研究人员通过广泛的实验表明,Mustango 在音乐质量和可控性方面取得了最新的成果。
在文本到音乐合成领域,生成内容的质量一直在提高,但对音乐方面的可控性仍未得到探索。新加坡科技与设计大学和伦敦玛丽女王大学的研究人员提出了一个名为 Mustango 的解决方案,它扩展了 Tango 文本到音频模型,旨在通过丰富的说明来控制生成的音乐,这些说明包含与和弦、节拍、速度和键相关的具体指令。
研究人员将 Mustango 介绍为一种基于扩散模型的音乐领域知识启发的文本到音乐系统。他们强调了从扩散模型直接生成音乐所面临的独特挑战,强调了在与条件文本对齐和音乐性之间取得平衡的需求。Mustango 使音乐家、制作人和音效设计师能够根据特定条件(如和弦进行、速度和键选择)创建音乐片段。
作为 Mustango 的一部分,研究人员提出了 MuNet,即音乐领域知识启发的 UNet 子模块。MuNet 将音乐专用功能与从文本提示中预测的功能集成到扩散去噪过程中。为了克服现有带有音乐和文本说明的开放数据集的有限可用性,研究人员引入了一种新颖的数据增强方法。该方法涉及改变音乐音频的和谐、节奏和动态方面,并使用音乐信息检索方法提取音乐特征,然后将这些特征附加到现有的文本描述中,从而得到 MusicBench 数据集。
MusicBench 数据集包含超过52,000个实例,通过将节拍、下拍位置、基本和弦进行、键和速度添加到原始文本描述中,丰富了数据集。研究人员进行了广泛的实验,证明了 Mustango 在音乐质量方面达到了最新的水平。他们强调了 Mustango 通过音乐专用文本提示的可控性,展示了在捕捉多个数据集中所需的和弦、节拍、键和速度方面的出色性能。他们评估了这些预测器在没有控制句子的情况下的适应能力,并观察到 Mustango 在这种情况下的表现优于 Tango,表明控制预测器不会影响性能。
实验包括与 Tango 和 Mustango 的变体等基线的比较,证明了所提出的数据增强方法在提高性能方面的有效性。从头开始训练的 Mustango 被认为是表现最好的模型,在音频质量、节奏存在和谐等方面超过了 Tango 和其他变体。Mustango 拥有14亿个参数,比 Tango 多得多。
研究人员将 Mustango 作为文本到音乐合成领域的重要进展。他们解决了现有系统中的可控性差距,并通过广泛的实验证明了他们提出的方法的有效性。Mustango 不仅实现了最新的音乐质量,还提供了增强的可控性,为该领域的发展做出了宝贵的贡献。研究人员发布了 MusicBench 数据集,为未来的文本到音乐合成研究提供了资源。
项目网址:https://github.com/amaai-lab/mustango
https://huggingface.co/spaces/declare-lab/mustango
论文网址:https://arxiv.org/abs/2311.08355v1
大众汽车宣布将ChatGPT批量集成到多款汽车型号
**划重点:**-🚗大众汽车宣布将ChatGPT与IDA语音助手结合,批量集成到多款汽车型号,包括ID.7、ID.5、ID.4、ID.3、全新途观、全新帕萨特,以及新款高尔夫。-🗣️用户通过自然语言与ChatGPT进行互动,实现诸如查询路况、导航、控制汽车设备等功能。0000字节内部AI“赛马”结束,大模型全跟豆包姓,一出手就点名阿里百度
过去一年,围绕着字节AI的几个谜团,终于都在今天被揭开了。5月15日火山引擎Force原动力大会上,字节大模型进行了全系列更名,从云雀大模型升级为豆包大模型家族,一口气发布了9个豆包模型,其中包括通用模型pro版、通用模型lite版以及各个领域的垂类模型,并宣布正式对外服务。这是一次很有意思的更名,我们甚至可以把它理解为是一场“豆包的胜仗”。0000美国汽车工程师学会计划将特斯拉充电技术设为美国行业标准
总部位于美国的标准组织汽车工程师协会(SAEInternational)宣布计划支持特斯拉的电动汽车充电技术成为“北美充电标准”或NACS端口。据报道,SAE的采用将使电动汽车充电站制造商和运营商更容易实施该端口,同时也使电动汽车车主的充电更加一致和可靠。注:图片由midjourney生成站长网2023-06-29 12:13:340000视觉编码器VCoder:提高模型在识别图像方面的能力
VCoder是一个视觉编码器,旨在提高多模态语言模型(MLLM)在识别图像中的对象和理解图像场景方面的能力。它能够帮助模型更好地理解和分析图像内容。项目地址:https://top.aibase.com/tool/vcoder站长网2024-01-04 11:05:260000微软将为 Bing AI 聊天推出重新生成回复功能
站长之家(ChinaZ.com)7月25日消息:你是否一直渴望在BingAI聊天中拥有重新生成回复的功能?如果是的话,你将迎来一些好消息。如果你对这个功能还不熟悉,这个按钮的作用类似于ChatGPT的选项。一旦聊天机器人生成了一个回答,你可以点击一个按钮请求另一个回答,按照你的喜好来选择。站长网2023-07-25 15:51:420000