Project Icon

pesto

基于机器学习的高效音高估计开源工具

PESTO是一个开源的音高估计工具,基于机器学习技术开发。该项目获得ISMIR 2023最佳论文奖,具有出色的性能和快速的处理速度。PESTO支持多种音频格式,提供命令行和Python API接口,便于集成使用。与CREPE相比,PESTO的模型参数更少,但在主要数据集上表现相当。适用于需要高效音高估计的音频处理应用。

dasp-pytorch - 基于PyTorch的可微分音频信号处理器库
GithubPyTorch信号处理开源项目深度学习神经网络音频处理
dasp-pytorch是一个基于PyTorch的可微分音频信号处理库。它实现了混响、失真、动态范围处理、均衡和立体声处理等功能,可用于虚拟模拟建模、参数估计、自动DSP和风格迁移。该库支持CPU和GPU批处理,有助于加速训练和优化性能。作为开源项目,dasp-pytorch在Apache 2.0许可下可免费用于学术和商业目的。
petastorm - 开源数据访问库,支持单机或分布式训练和评估深度学习模型,直接从Apache Parquet格式数据集中读取数据
Apache ParquetGithubPetastorm分布式训练开源项目机器学习框架深度学习
Petastorm是一个开源数据访问库,支持单机或分布式训练和评估深度学习模型,直接从Apache Parquet格式数据集中读取数据。该库兼容Tensorflow、PyTorch和PySpark等主流Python机器学习框架,也可用于纯Python代码。Petastorm支持多种数据压缩格式,提供方便的API用于数据生成和读取,并支持列选择、并行读取、行过滤等功能。用户可以轻松在单机或Spark集群上生成数据集,是构建高效机器学习管道的理想工具。
pedalboard - 功能强大的Python音频处理和效果器库
GithubPedalboardPython库VST3开源项目音效插件音频处理
Pedalboard是一个功能丰富的Python音频处理库,支持多种音频格式的读写和效果器应用。内置常见音频效果如合唱、混响等,同时支持加载VST3和Audio Unit插件。该库具有优秀的线程安全性、内存管理和处理速度,可与TensorFlow等深度学习框架集成。Pedalboard在Spotify的数据增强和AI功能开发中得到应用,是音频处理领域的高效工具。
tf_audio_steganalysis - 基于深度学习的MP3隐写分析研究
Audio SteganalysisCNNDeep LearningGithubMP3tensorflow开源项目
此项目基于TensorFlow实现音频隐写分析,利用卷积神经网络(CNN)对MP3隐写进行深入分析与检测,并包含多个获奖论文和数据集。用户可以通过该平台设计自己的网络,轻松安装所需环境和依赖包,并通过TensorBoard可视化训练过程。详细指南阐明了安装步骤、环境配置和代码运行示例,是音频隐写分析研究与实践的理想资源。
AudioSep - 自然语言驱动的多功能音频分离基础模型
AudioSepGithub开放域声音分离开源项目自然语言查询语音增强音频分离
AudioSep是一个创新的音频分离基础模型,可通过自然语言描述执行多种音频分离任务。该模型在音频事件分离、乐器分离和语音增强等领域展现出卓越的性能和泛化能力。AudioSep支持用户通过文本描述精确分离所需音频内容,为音频处理技术开辟了新的应用方向。
audiomentations - 使用于深度学习的高级音频数据增强库
AudiomentationsGithubPyPIPython开源项目深度学习音频数据增强
Audiomentations是一个用于音频数据增强的Python库,专为提升深度学习模型性能而设计。该库支持单声道和多声道音频,能够集成到Tensorflow/Keras或Pytorch等训练管道中。它已在Kaggle竞赛中帮助用户取得了出色的成绩,并被多家开发下一代音频产品的公司采用。Audiomentations提供了丰富的音频变换功能,如加噪声、时间拉伸、音调变化和移位等,在CPU上运行,同时推荐使用torch-audiomentations以获得GPU支持。
espnet - 端到端语音处理工具包,涵盖语音识别及转换
ESPnetGithub开源项目文本转语音深度学习语音处理语音识别
ESPnet是一个端到端语音处理模块,封装了多个领域的语音处理任务,如语音识别、文本到语音、语音翻译、语音增强和说话人分割等。该平台基于Pytorch开发,采用符合Kaldi风格的数据处理方法,提供针对各类语音处理实验的完整解决方案。ESPnet支持多语言处理,并能够调整自身以适应不同的语言和环境。
pastas - Python开源工具助力地下水时间序列分析
GithubPastasPython包地下水开源软件开源项目时间序列分析
这是专注于地下水时间序列分析的开源Python工具。它采用面向对象结构,便于快速构建新模型。通过简洁的Python代码,用户可轻松创建、优化和分析时间序列模型。内置多种分析工具,支持Python 3.9-3.12版本,并提供丰富的文档和示例,适合各层次用户使用。
Mangio-RVC-Fork - 开源语音转换框架 支持多种F0算法和快速训练
AIGithubRVC开源项目深度学习语音转换音频处理
Mangio-RVC-Fork是一个基于VITS的开源语音转换框架,具有top1检索功能。它提供CLI和Web界面,支持多种F0估计方法,包括混合F0算法。该工具可快速训练,使用少量数据也能获得良好效果。支持模型融合改变音色,以及UVR5模型分离人声和伴奏。项目持续开发中,计划添加更多功能优化用户体验。
AudioStrip - 免费在线音频分离工具 实现高质量人声伴奏隔离
AI工具AudioStrip人声分离在线工具音乐制作音频处理
AudioStrip提供高效的在线音频处理服务,主要用于分离音乐中的人声和伴奏。这款工具运用先进算法,实现近乎完美的音频隔离效果。用户可选择免费或付费模式,付费版本具备批量上传和加速处理等额外功能。除音频隔离外,AudioStrip还支持降噪、母带处理和音调BPM检测,适合音乐创作者和爱好者使用。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计 是一个多功能的在线设计和创意平台,提供广泛的设计工具和资源,以满足不同用户的需求。从专业的图形设计师到普通用户,无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑,稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合,帮助用户轻松实现创意设计。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号