Make-An-Audio 2

基于扩散模型的文本到音频生成技术

普通产品其他文本到音频扩散模型
Make-An-Audio 2是一种基于扩散模型的文本到音频生成技术,由浙江大学、字节跳动和香港中文大学的研究人员共同开发。该技术通过使用预训练的大型语言模型(LLMs)解析文本,优化了语义对齐和时间一致性,提高了生成音频的质量。它还设计了基于前馈Transformer的扩散去噪器,以改善变长音频生成的性能,并增强时间信息的提取。此外,通过使用LLMs将大量音频标签数据转换为音频文本数据集,解决了时间数据稀缺的问题。
打开网站

Make-An-Audio 2 最新流量情况

月总访问量

166

跳出率

47.04%

平均页面访问数

1.0

平均访问时长

00:00:00

Make-An-Audio 2 访问量趋势

Make-An-Audio 2 访问地理位置分布

Make-An-Audio 2 流量来源

Make-An-Audio 2 替代品