distil-whisper

快速高效的音频转录模型

Distil-Whisper 语音识别模型压缩自然语言处理机器学习 Github 开源项目

Distil-Whisper是OpenAI Whisper模型的蒸馏版本，速度提升6倍，模型规模缩小49%，同时保持了相近的准确性。该项目支持短语音和长语音转录，提供多个针对英语语音识别的高效模型。Distil-Whisper还可作为Whisper的辅助模型实现推测解码，在保证输出一致性的同时将速度提升2倍。

Github

Huggingface

介绍相关项目

FreeSubtitles.Ai - 高精度音视频转录与多语言翻译工具

AI工具Whisper模型多语言支持文件处理翻译服务语音转文字

FreeSubtitles.Ai提供音频和视频转文字服务，支持自动翻译功能。平台采用Whisper模型进行转录，结合M2M_100、DeepL和Yandex提供翻译服务。支持91种语言翻译，免费版可处理300MB文件（时长1小时），付费版可处理10GB文件（时长10小时）。该工具为音视频内容的多语言处理提供了全面的解决方案。

StarWhisper - 语言、时序与多模态框架

GithubStarWhisper人工智能司天工程大模型天文学开源项目

StarWhisper项目由国家天文台人工智能工作组支持，涵盖语言模型、时序模型和多模态模型。通过改进训练方法，该项目提升了天文物理、代码与Agent能力，并发布了基于大模型的光变曲线数据处理方法。项目还实现了多模态多任务框架与望远镜控制系统的对接，探索了多模态在天文学领域的应用可能。

diffwave - 神经网络驱动的语音及波形快速合成技术

DiffWaveGithub开源项目波形合成器神经声码器语音合成预训练模型

DiffWave是一种基于迭代精细化的神经语音合成器，能从高斯噪声生成语音。支持多GPU和混合精度训练，提供命令行和程序化推理接口，并配有模型和音频样本。

whisper-turbo - 基于WebGPU的浏览器端语音转文字引擎

GithubWebGPUWhisper Turbo开源项目浏览器语音识别跨平台

Whisper Turbo是一个基于WebGPU技术的开源语音识别项目，专门为浏览器和Electron应用设计。这款跨平台工具能在客户端高效执行语音转文字任务，目前支持Windows和MacOS上的Chromium浏览器。项目提供在线演示和详细文档，其核心由Rust编写的Ratchet库提供支持，确保了卓越的性能表现。

whisper - Graphite项目的高效时间序列数据存储方案

GithubGraphite项目Whisper开源项目数据存储时间序列数据库脚本工具

Whisper是Graphite项目的核心组件，专为时间序列数据设计的固定大小数据库。它在RRD基础上进行优化，提供快速可靠的数字数据存储，支持高分辨率的近期数据和低分辨率的长期历史数据。Whisper配备多种实用工具脚本，简化数据库的创建、查询、更新和管理。作为Graphite生态系统的关键部分，Whisper为大规模指标监控和分析提供高效的数据存储解决方案。

ollama-voice - 离线语音交互AI助手集成语音识别对话和合成功能

Githubollama-voice大型语言模型开源项目文字转语音离线模式语音识别

ollama-voice是一个集成Whisper语音识别、Ollama大语言模型和pyttsx3文本转语音技术的开源项目。它创建了一个完全离线的语音交互AI助手，支持本地语音识别、自然语言处理和语音合成。用户通过按住空格键即可与AI对话，适用于需要隐私保护或离线环境的语音交互场景。

dc_tts - 基于深度卷积网络的高效文本到语音转换模型

DC-TTSGithubTensorFlow开源项目文本转语音训练模型语音样本

dc_tts，一个基于TensorFlow的文本到语音转换模型，使用深度卷积网络和引导注意力机制进行设计。项目不仅还原了相关学术论文，还对不同声音数据进行了深入研究，支持多种语言和数据集，提供完善的训练及预处理教程以及预训练模型，适用于学术研究和实际应用场景。

stable-ts - Whisper语音转录时间戳优化和功能扩展工具

GithubWhisper开源项目时间戳稳定性语音识别转录

stable-ts是一个开源的Whisper语音转录优化工具。它通过改进时间戳生成算法，提高了转录结果的时间精确度。该工具扩展了Whisper的功能，增加了语音分离、降噪和时间戳调整等特性。stable-ts支持多种输出格式，并提供API和命令行接口，使语音转录更加稳定和高效。

Whisperback - 多语言有声书和播客AI翻译服务

AI工具多语言文本转语音语音助手语音合成语音技术

这款AI翻译工具专注于有声书和播客的多语种转换。通过50多种语音选项和精准的语音合成技术，实现全球主要语言和方言的高质量、本地化音频翻译。平台致力于消除语言障碍，使全球用户能够便捷地享受多语种有声内容。支持英语、法语、德语、西班牙语等主要语言，精准捕捉口音和地域特色，提供专业的AI驱动翻译体验。

awesome-large-audio-models - 音频AI模型前沿进展与资源汇总

Github大型音频模型开源项目语音合成语音识别跨模态AI音乐生成

本项目汇总了音频AI领域的精选资源,涵盖语音识别、合成、翻译等多个方向的前沿进展。定期更新最新论文和开源实现,为研究者和开发者提供全面了解音频AI发展的平台。内容包括主流大型音频模型、各应用领域技术及大规模数据集,是音频AI研究的重要参考资料。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号