pesto

基于机器学习的高效音高估计开源工具

PESTO 音高估计机器学习 PyTorch 命令行界面 Github 开源项目

PESTO是一个开源的音高估计工具，基于机器学习技术开发。该项目获得ISMIR 2023最佳论文奖，具有出色的性能和快速的处理速度。PESTO支持多种音频格式，提供命令行和Python API接口，便于集成使用。与CREPE相比，PESTO的模型参数更少，但在主要数据集上表现相当。适用于需要高效音高估计的音频处理应用。

访问官网

Github

介绍相关项目

dasp-pytorch - 基于PyTorch的可微分音频信号处理器库

GithubPyTorch信号处理开源项目深度学习神经网络音频处理

dasp-pytorch是一个基于PyTorch的可微分音频信号处理库。它实现了混响、失真、动态范围处理、均衡和立体声处理等功能，可用于虚拟模拟建模、参数估计、自动DSP和风格迁移。该库支持CPU和GPU批处理，有助于加速训练和优化性能。作为开源项目，dasp-pytorch在Apache 2.0许可下可免费用于学术和商业目的。

petastorm - 开源数据访问库，支持单机或分布式训练和评估深度学习模型，直接从Apache Parquet格式数据集中读取数据

Apache ParquetGithubPetastorm分布式训练开源项目机器学习框架深度学习

Petastorm是一个开源数据访问库，支持单机或分布式训练和评估深度学习模型，直接从Apache Parquet格式数据集中读取数据。该库兼容Tensorflow、PyTorch和PySpark等主流Python机器学习框架，也可用于纯Python代码。Petastorm支持多种数据压缩格式，提供方便的API用于数据生成和读取，并支持列选择、并行读取、行过滤等功能。用户可以轻松在单机或Spark集群上生成数据集，是构建高效机器学习管道的理想工具。

pedalboard - 功能强大的Python音频处理和效果器库

GithubPedalboardPython库VST3开源项目音效插件音频处理

Pedalboard是一个功能丰富的Python音频处理库，支持多种音频格式的读写和效果器应用。内置常见音频效果如合唱、混响等，同时支持加载VST3和Audio Unit插件。该库具有优秀的线程安全性、内存管理和处理速度，可与TensorFlow等深度学习框架集成。Pedalboard在Spotify的数据增强和AI功能开发中得到应用，是音频处理领域的高效工具。

tf_audio_steganalysis - 基于深度学习的MP3隐写分析研究

Audio SteganalysisCNNDeep LearningGithubMP3tensorflow开源项目

此项目基于TensorFlow实现音频隐写分析，利用卷积神经网络（CNN）对MP3隐写进行深入分析与检测，并包含多个获奖论文和数据集。用户可以通过该平台设计自己的网络，轻松安装所需环境和依赖包，并通过TensorBoard可视化训练过程。详细指南阐明了安装步骤、环境配置和代码运行示例，是音频隐写分析研究与实践的理想资源。

AudioSep - 自然语言驱动的多功能音频分离基础模型

AudioSepGithub开放域声音分离开源项目自然语言查询语音增强音频分离

AudioSep是一个创新的音频分离基础模型，可通过自然语言描述执行多种音频分离任务。该模型在音频事件分离、乐器分离和语音增强等领域展现出卓越的性能和泛化能力。AudioSep支持用户通过文本描述精确分离所需音频内容，为音频处理技术开辟了新的应用方向。

audiomentations - 使用于深度学习的高级音频数据增强库

AudiomentationsGithubPyPIPython开源项目深度学习音频数据增强

Audiomentations是一个用于音频数据增强的Python库，专为提升深度学习模型性能而设计。该库支持单声道和多声道音频，能够集成到Tensorflow/Keras或Pytorch等训练管道中。它已在Kaggle竞赛中帮助用户取得了出色的成绩，并被多家开发下一代音频产品的公司采用。Audiomentations提供了丰富的音频变换功能，如加噪声、时间拉伸、音调变化和移位等，在CPU上运行，同时推荐使用torch-audiomentations以获得GPU支持。

espnet - 端到端语音处理工具包，涵盖语音识别及转换

ESPnetGithub开源项目文本转语音深度学习语音处理语音识别

ESPnet是一个端到端语音处理模块，封装了多个领域的语音处理任务，如语音识别、文本到语音、语音翻译、语音增强和说话人分割等。该平台基于Pytorch开发，采用符合Kaldi风格的数据处理方法，提供针对各类语音处理实验的完整解决方案。ESPnet支持多语言处理，并能够调整自身以适应不同的语言和环境。

pastas - Python开源工具助力地下水时间序列分析

GithubPastasPython包地下水开源软件开源项目时间序列分析

这是专注于地下水时间序列分析的开源Python工具。它采用面向对象结构,便于快速构建新模型。通过简洁的Python代码,用户可轻松创建、优化和分析时间序列模型。内置多种分析工具,支持Python 3.9-3.12版本,并提供丰富的文档和示例,适合各层次用户使用。

Mangio-RVC-Fork - 开源语音转换框架支持多种F0算法和快速训练

AIGithubRVC开源项目深度学习语音转换音频处理

Mangio-RVC-Fork是一个基于VITS的开源语音转换框架,具有top1检索功能。它提供CLI和Web界面,支持多种F0估计方法,包括混合F0算法。该工具可快速训练,使用少量数据也能获得良好效果。支持模型融合改变音色,以及UVR5模型分离人声和伴奏。项目持续开发中,计划添加更多功能优化用户体验。

AudioStrip - 免费在线音频分离工具实现高质量人声伴奏隔离

AI工具AudioStrip人声分离在线工具音乐制作音频处理

AudioStrip提供高效的在线音频处理服务，主要用于分离音乐中的人声和伴奏。这款工具运用先进算法，实现近乎完美的音频隔离效果。用户可选择免费或付费模式，付费版本具备批量上传和加速处理等额外功能。除音频隔离外，AudioStrip还支持降噪、母带处理和音调BPM检测，适合音乐创作者和爱好者使用。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号