spleeter

音乐源分离工具

Spleeter 音频分离 Tensorflow Deezer Python Github 开源项目

Spleeter是Deezer开发的音乐源分离库，提供预训练模型，支持多种分离模式。适用于个人和专业音频处理，包括2声部、4声部及5声部模型。通过命令行或作为Python库使用，支持快速安装。此外，Spleeter还可通过Docker使用，兼容多种操作系统，为处理音频文件提供多种高效方案。

文档

asteroid - PyTorch基础的音频源分离工具包，支持多种数据集和架构

AsteroidGithubPyTorch开源项目数据集支持社区项目音频源分离工具

Asteroid是一个由PyTorch驱动的音频源分离工具包，面向研究人员，便于在常用数据集上快速进行实验。它提供了支持多种数据集和架构的源代码，并包含复现重要科研论文的方案。Asteroid还支持社区贡献，用户可以通过提交问题或拉取请求参与项目。内置的TensorBoard可视化工具和详尽的教程帮助用户更好地使用该工具包。

friendly-stable-audio-tools - 改进后的Stable Audio Tools开源框架支持音频生成模型训练和推理

AI音频生成GithubStable Audio开源项目模型训练深度学习音乐生成

该项目是对Stability AI的stable-audio-tools的重构和增强，提供了音频和音乐生成模型的开源代码。重构后的代码提高了可读性和易用性，并新增了评估和使用自训练模型的脚本。项目详细说明了如何训练Stable Audio 2.0等模型，并提供了Stable Audio Open 1.0的使用文档和便捷脚本。此外，项目支持多GPU/节点生成，并集成了Gradio界面用于测试模型。

spotify-downloader - 高效命令行工具实现Spotify音乐下载与管理

GithubSpotifyYouTubespotDL命令行工具开源项目音乐下载

spotify-downloader是一个功能丰富的命令行工具，可从Spotify播放列表识别歌曲并通过YouTube下载，同步获取专辑封面、歌词和元数据。该工具提供多种操作模式，包括音乐下载、元数据保存、网页界面、直接下载链接获取、目录同步和元数据更新。它利用YouTube作为音源，确保下载最高音质。支持多平台安装，操作简便，具有详尽的使用说明。

awesome-diarization - 说话者分离和语音分割的数据集

FunASRGithubMiniVoxSIDEKITSpeaker DiarizationSpeechBrain开源项目

DiffSinger - 通过浅层扩散机制进行歌唱语音合成

DiffSingerDiffSpeechGithubLJSpeechPyTorch声音合成开源项目

DiffSinger项目通过PyTorch实现高效的浅层扩散机制声音合成。该项目支持多样的模型训练配置，涵盖基础、辅助解码器及浅层版本，并提供实时控制音调、音量和语速的功能，以适应不同的声音合成需求。适用于LJSpeech等数据集，适合从事音频合成研究与开发的专业人士。

resemble-enhance - 语音增强工具提升音质消除噪音

AI工具GithubResemble Enhance开源项目语音增强降噪音频处理

Resemble Enhance是一款开源的AI语音增强工具，通过去噪和增强提高语音质量。它包含去噪器和增强器两个模块，使用44.1kHz高质量语音数据训练。该工具支持命令行操作和Web演示，可轻松安装使用。此外，还提供了训练自定义模型的功能，适用于有特定需求的用户。

segmentation - 利用Pyannote开源工具进行语音分割与识别

GithubHuggingfacepyannote开源项目模型语音活动检测重分段重叠语音检测音频

探索使用Pyannote开源项目进行高效的语音分割，提高语音活动、重叠语音检测及重分段的性能。详细的使用说明和代码示例使音频处理过程更加准确快速，广泛适用于学术研究和商业应用。同时，Pyannote还为用户提供科学咨询服务和资助选项支持。

deep-speaker - 深度学习语者嵌入系统，适用语者识别与验证

Deep SpeakerGithubKerasTensorflow开源项目神经网络说话人嵌入

本系统利用神经网络将语音映射到超球面，通过余弦相似度计算语音相似度，实现语者识别、验证与聚类。基于TensorFlow和Keras实现，支持多版本，提供可训练和预训练模型。适用于需大规模数据处理和高性能计算的用户，并提供详细的训练与测试指南。

speaker-diarization-3.0 - 基于pyannote.audio的多功能说话人分离模型

GithubHuggingfacepyannote.audio开源项目模型深度学习语音处理说话人分类音频分析

该模型基于pyannote.audio 3.0.0训练，可处理16kHz单声道音频并输出说话人分离结果。经多个数据集基准测试，表现优异。支持GPU加速实时处理，提供进度监控和说话人数量控制等功能。适用于需要高性能说话人分离的研究和开发场景。

Remover.studio - AI在线音频处理平台提供人声分离和音轨拆分

AI工具AI算法人声分离卡拉OK音乐编辑音频处理

Remover.studio是一个先进的在线音频处理平台，利用AI技术实现高质量的人声分离(vocal remover)和音轨拆分(audio splitter)。用户可上传音频文件或YouTube链接，系统自动识别并分离人声，支持创建卡拉OK版本和歌曲重混。平台还提供调音、乐器分离等功能，适合音乐爱好者和创作者使用。免费版每天可处理一首歌曲，付费版则提供更多高级功能，如批量处理和更高质量的音频输出。Remover.studio为用户提供便捷、高效的音频处理体验，助力音乐创作和定制。

相关项目

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com