Make-An-Audio 2
基于扩散模型的文本到音频生成技术
普通产品其他文本到音频扩散模型
Make-An-Audio 2是一种基于扩散模型的文本到音频生成技术,由浙江大学、字节跳动和香港中文大学的研究人员共同开发。该技术通过使用预训练的大型语言模型(LLMs)解析文本,优化了语义对齐和时间一致性,提高了生成音频的质量。它还设计了基于前馈Transformer的扩散去噪器,以改善变长音频生成的性能,并增强时间信息的提取。此外,通过使用LLMs将大量音频标签数据转换为音频文本数据集,解决了时间数据稀缺的问题。
Make-An-Audio 2 最新流量情况
月总访问量
140
跳出率
44.03%
平均页面访问数
1.0
平均访问时长
00:00:00