#音频表示

clap-htsat-fused - 对比语言与音频学习中的多任务性能提升

Github开源项目模型Huggingface对比学习CLAP多模态表示学习零样本音频分类音频表示

CLAP项目使用对比语言-音频预训练模型结合音频编码器与文本编码器，提升多模态学习表现。该模型支持文本到音频检索、零样本音频分类及监督音频分类等多项任务。通过特征融合机制和关键词到字幕增强，CLAP能高效处理不同长度的音频输入。所发布的LAION-Audio-630K数据集及模型在文本到音频检索和零样本音频分类中表现优异，适用于零样本音频分类及音频、文本特征提取。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号