pesto

基于机器学习的高效音高估计开源工具

PESTO 音高估计机器学习 PyTorch 命令行界面 Github 开源项目

PESTO是一个开源的音高估计工具，基于机器学习技术开发。该项目获得ISMIR 2023最佳论文奖，具有出色的性能和快速的处理速度。PESTO支持多种音频格式，提供命令行和Python API接口，便于集成使用。与CREPE相比，PESTO的模型参数更少，但在主要数据集上表现相当。适用于需要高效音高估计的音频处理应用。

访问官网

Github

介绍相关项目

torchcrepe - PyTorch实现的CREPE音高追踪算法

CREPEGithubPyTorch开源项目深度学习音频处理音高跟踪

torchcrepe是CREPE音高追踪算法的PyTorch实现,提供音高预测、周期性分析和音频嵌入功能。该项目支持多种解码方法、滤波和阈值处理,可用于语音和音乐分析。torchcrepe还包含文件处理和命令行接口,便于进行音高相关的音频处理。

crepe - 基于深度卷积神经网络的单音音高跟踪器

CREPEGithubPython开源项目深度卷积神经网络音频处理音高跟踪

CREPE是一款基于深度卷积神经网络的单音音高跟踪器，直接处理时域波形输入，性能优于流行的音高跟踪器如pYIN和SWIPE。用户可通过PyPI安装，并利用预训练模型进行音高预测，结果包含时间戳、预测音高和置信度。CREPE支持时间步长调整、模型容量选择和时间序列平滑，适用于人声和乐器音频，并支持批量处理。

basic-pitch - 高效轻量的自动音乐转录工具

Basic PitchGithubMIDI生成多音高估计开源项目音乐转录音频智能

Basic Pitch是一个开源的自动音乐转录(AMT)Python库，由Spotify音频智能实验室开发。这款轻量级音乐识别工具支持多音高和跨乐器转录，性能可与大型AMT系统媲美。它能将音频转换为包含音高弯曲的MIDI文件，适用于各种乐器，尤其擅长单一乐器转录。Basic Pitch提供命令行和程序化接口，支持MIDI、WAV和CSV等多种输出格式，便于集成到各种音乐处理工作流程中。

stable-audio-metrics - 音频生成模型评估指标集合

GPU支持Githubstable-audio-metrics开源项目数据结构音频指标音频生成模型评估

stable-audio-metrics是一个评估音乐和音频生成模型的开源指标集合。它包含基于Openl3的Fréchet距离、基于PaSST的Kullback-Leibler散度和基于CLAP-LAION的CLAP分数。该项目针对长形式全频带立体声生成进行了优化，支持可变长度输入，并提供了详细文档和示例。适用于评估MusicCaps、AudioCaps和Song Describer等数据集的音频生成质量。

SpeechMOS - 简化语音质量评估的开源工具

GithubMOS预测PyTorchSpeechMOS开源项目语音质量评估音频处理

SpeechMOS是一款开源的语音质量评估工具，通过简单的代码即可预测主观语音得分。该项目支持多种MOS预测系统，包括UTMOS强模型，可用于评估语音自然度。SpeechMOS使用torch.hub加载模型，无需额外导入库，支持批量处理，适用于语音合成评估等多种场景。这个工具为研究人员和开发者提供了便捷的语音质量评估方法。

all-in-one - 全能音乐结构分析工具自动识别节奏节拍和段落

AI模型GithubPyTorch开源项目深度学习音乐结构分析音频处理

All-In-One是一款音乐结构分析工具,可自动识别音乐速度、节拍、小节线、段落边界及标签。工具提供命令行和Python API,支持结果可视化和声音化,适用于音乐研究和应用开发。基于机器学习模型,具有快速处理、多格式支持等特点,并提供详细使用说明和高级研究功能。

friendly-stable-audio-tools - 改进后的Stable Audio Tools开源框架支持音频生成模型训练和推理

AI音频生成GithubStable Audio开源项目模型训练深度学习音乐生成

该项目是对Stability AI的stable-audio-tools的重构和增强，提供了音频和音乐生成模型的开源代码。重构后的代码提高了可读性和易用性，并新增了评估和使用自训练模型的脚本。项目详细说明了如何训练Stable Audio 2.0等模型，并提供了Stable Audio Open 1.0的使用文档和便捷脚本。此外，项目支持多GPU/节点生成，并集成了Gradio界面用于测试模型。

Stable Audio Open - 开源文本转音频模型生成高质量短音频样本和音效

AI工具Stable Audio Open开源模型文本到音频音效制作音频生成

Stable Audio Open是一个开源的文本转音频生成模型，专注于创建短音频样本、音效和音乐制作元素。用户可通过文本提示生成最长47秒的高质量音频。该模型适用于创建鼓点、乐器片段、环境音效和拟音效果等。作为免费开源工具，它为音乐制作和声音设计提供了实用的解决方案。用户可以使用自己的数据微调模型，生成个性化音效。此外，模型支持部署到个人设备，便于自定义使用。

Stems ST-02 - 高质量音频分离工具实现声乐与乐器轨道精准提取

AI工具DemucsFacebook声音处理开源软件音频分离

Stems ST-02采用Facebook开源Demucs库，提供先进的音频分离技术。这款工具可将音乐精确分离为人声、鼓点、贝斯和其他乐器轨道，界面直观易用。适合DJ、音乐制作人和学习者使用，有助于音频分析、混音、采样和音乐结构学习。Stems ST-02输出高质量分离结果，为音乐处理提供专业支持。

metricgan-plus-voicebank - 基于MetricGAN+的开源语音增强模型实现PESQ 3.15分及STOI 93.0分

GithubHuggingfaceMetricGANPyTorchSpeechBrainVoicebank开源项目模型语音增强

MetricGAN+是一个基于SpeechBrain框架开发的语音增强模型，在Voicebank-DEMAND数据集测试中达到PESQ 3.15分和STOI 93.0分。模型支持16kHz采样率音频处理，提供Python接口实现音频降噪和质量优化。项目开源，可用于语音处理和音频增强等应用场景。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号