国补+618双促销驱动,助力2025年家电行业迎来回暖时刻科大讯飞×圣翔航空:数字人技术在航空传播场景的深度应用首次跌破50%!韩系彩电双雄失守高端,“谁”动了他们的“底盘”?深耕AI+招聘:广西人才网以讯飞星火技术开启求职交互革命当监管利剑挥向汽车“内卷”,家电行业该如何自处?美的集团再推最高百亿元回购方案传音与印尼电信运营商IOH达成战略合作 加速印尼5G布局与数字化发展讯飞超脑赋能!李未可智能眼镜实现户外场景98%语音识别率谷歌地图迎来超大规模升级:全新AI功能带来智能评论与节油路线Grok任务功能重磅上线!定时追踪X热门话题,AI效率直超ChatGPTTikTok全新Symphony AI工具上线:图片一键变视频,文字直接生成广告松下全新OmniFlow 多模态大模型,实现文本、图像与音频自由切换夸克App推出“夸克老师” AI首次具备个性化辅导能力腾讯LeVo来袭!媲美Suno 4.5的AI唱歌模型,支持零样本音色克隆MiniMax-M1开源!1M超长上下文推理 AI新王者仅53万美元打造!赛力斯回到全世界我国磁悬浮技术取得新突破:试验车零百加速不到 1 秒,7.1 秒冲刺极速 650km/h手机厂商才是联名高手!小米OPPO谁将率先拿下Labubu?鲸语推出训练耳机2代,训练+蓝牙+MP3三合一消息称苹果iOS版QQ灰度测试“微信同款”来电弹窗功能,利用LiveCommunicationKit实现
  • 首页 > 云计算频道 > 大模型

    音乐生成深度学习模型StemGen:听取音乐上下文生成音乐作品

    2023年12月19日 11:01:26   来源:站长之家

      字节跳动AI研究团队最近推出了一项名为StemGen的音乐生成项目,该项目采用了一种创新的深度学习方法,旨在让模型能够模仿现有音乐中的模式和结构,并以一种非常前卫的方式回应音乐背景。与常用的深度学习技术(如RNN、LSTM网络和Transformer模型)不同,StemGen采用了一种非自回归、基于Transformer的模型,强调对音乐背景的听取和响应,而不是依赖于抽象的条件。

      研究中,来自SAMI和字节跳动公司的研究人员引入了一种非自回归、基于Transformer的模型,该模型通过利用MusicGen模型的公开可用的Encodec检查点来监听和响应音乐背景。通过使用标准度量和音乐信息检索描述符方法,包括Frechet Audio Distance(FAD)和Music Information Retrieval Descriptor Distance(MIRDD),研究团队评估了模型的性能。结果显示,该模型在音频质量和与音乐背景的稳健对齐方面表现出竞争性,经过客观度量和主观MOS测试的验证。

      这项研究强调了最新在端到端音乐生成方面的进展,借鉴了图像和语言处理的技术。它强调了在音乐创作中对音频片段进行对齐的挑战,并对现有依赖于抽象条件的模型提出了批评。研究提出了一种训练范式,使用了一种非自回归、基于Transformer的架构,使模型能够对音乐背景做出响应。该方法引入了两个条件源,并将问题框架构建为条件生成。

      该方法利用了一种非自回归、基于Transformer的音乐生成模型,通过在单独的音频编码模型中引入残差向量量化器。通过将多个音频通道组合成一个单一的序列元素,采用了嵌套的方法。训练过程中采用了掩码程序,并在进行令牌采样期间使用了无分类器的指导,以增强音频背景的对齐。客观度量包括Fr’echet Audio Distance和音乐信息检索描述符距离等,用于评估模型的性能。

      研究团队通过使用标准度量和音乐信息检索描述符方法进行生成模型的评估,包括FAD和MIRDD。与真实音频片段的比较表明,该模型在音频质量上达到了与最先进的文本条件模型相媲美的水平,并展现出与音乐背景的强大音乐连贯性。通过参与音乐培训的参与者进行的Mean Opinion Score测试进一步验证了该模型生成逼真音乐结果的能力。MIRDD对生成和真实音频片段的分布对齐进行评估,提供了音乐连贯性和对齐的度量。

      总的来说,这项研究提出了一种新的训练方法,使生成模型能够对音乐背景做出响应。该方法引入了一种非自回归语言模型,具有Transformer骨干和两个未经测试的改进:多源无分类器的指导和迭代解码过程中的因果偏差。通过在开源和专有数据集上进行训练,这些模型实现了最先进的音频质量。标准度量和音乐信息检索描述符方法验证了其音频质量。通过Mean Opinion Score测试确认了该模型生成逼真音乐结果的能力。

      文章内容仅供阅读,不构成投资建议,请谨慎对待。投资者据此操作,风险自担。

    即时

    新闻

    明火炊具市场:三季度健康属性贯穿全类目

    奥维云网(AVC)推总数据显示,2024年1-9月明火炊具线上零售额94.2亿元,同比增加3.1%,其中抖音渠道表现优异,同比有14%的涨幅,传统电商略有下滑,同比降低2.3%。

    企业IT

    重庆创新公积金应用,“区块链+政务服务”显成效

    “以前都要去窗口办,一套流程下来都要半个月了,现在方便多了!”打开“重庆公积金”微信小程序,按照提示流程提交相关材料,仅几秒钟,重庆市民曾某的账户就打进了21600元。

    3C消费

    华硕ProArt创艺27 Pro PA279CRV显示器,高能实力,创

    华硕ProArt创艺27 Pro PA279CRV显示器,凭借其优秀的性能配置和精准的色彩呈现能力,为您的创作工作带来实质性的帮助,双十一期间低至2799元,性价比很高,简直是创作者们的首选。