leopard

本地运行的跨平台语音转文字引擎

Leopard 语音转文字跨平台离线处理 Picovoice Github 开源项目

Leopard是一款本地运行的语音转文字引擎，具有高精度、隐私保护和跨平台特性。该引擎支持多种编程语言和平台，包括iOS、Android和Web等。Leopard提供简单易用的API，便于集成到各类应用中，实现优质的语音识别功能。其紧凑高效的设计适用于多种设备，为开发者提供灵活强大的语音转文字解决方案。

访问官网

Github

介绍相关项目

cheetah - 实时本地化语音转文字引擎

CheetahGithub实时转录开源项目本地处理语音转文字跨平台

Cheetah是一款本地化实时语音转文字引擎，具有隐私保护、高精度和跨平台特性。该引擎支持Linux、macOS、Windows、Android、iOS和主流浏览器等多种平台。Cheetah为开发者提供多种编程语言的SDK和演示应用，支持实时麦克风输入和音频文件处理，是一个灵活的语音识别解决方案。

stt - 高效离线本地语音识别工具，基于fast-whisper模型，支持多种输出格式

CUDA加速Githubfast-whisper开源项目文本输出本地部署热门语音识别

这款语音识别工具可在本地离线运行，基于开源的fast-whisper模型，可将视频和音频中的人声快速转换为文字。支持输出json、srt及纯文本格式，无需联网，确保隐私安全，与openai语音识别接口准确率相当。用户可便捷下载预编译版本，或自行部署源码，支持多种操作系统。此外，还提供API接口，适合开发者使用。支持CUDA加速，优化处理速度。

whisperkit-coreml - 针对苹果芯片优化的本地化语音识别开源框架

Apple SiliconCoreMLGithubHuggingfaceWhisperKit开源项目模型设备端语音识别

WhisperKit是一个为苹果芯片设备优化的本地语音识别框架，提供高性能的语音转文本功能。该开源项目托管于GitHub，开发者可以通过Hugging Face上的基准测试评估其在实际设备上的表现。WhisperKit使iOS和macOS应用能够实现先进的本地语音识别，无需依赖云服务。

leon - 开源个人助手Leon结合隐私保护与AI技术

GithubLeonNLP技术开源个人助理开源项目技能共享语音识别

Leon是一个开源的个人助手，通过整合最新的TTS和ASR引擎及混合NLP技术，提供快速、定制和精准的服务。用户可以在自己的服务器上运行Leon，实现离线交流，确保隐私。Leon支持语音和文本交流，并拥有扩展技能的结构，开发者可以创建和分享技能。随着项目的发展，Leon引入了基于transformers的模型，并计划建立一个技能注册平台，鼓励社区共同开发新功能。

whisper - 跨平台音频转文本开源项目

FFMPEGGithubWhisperWhisper.cppopen source开源项目音频转文字

Whisper是OpenAI开发的开源项目，使用whisper.cpp和FFMPEG将音频转换为WAV格式并提取文本。项目支持客户端和服务器端运行，无需互联网。目前代码和文档正在优化，接受捐赠以支持持续更新。适用于Android、Linux、Windows、iOS和macOS系统，安装和使用便捷，提供详尽文档和丰富资源。

SenseVoice - 高效、多语种语音识别与情绪识别技术平台

GithubSenseVoice多语言语音识别开源项目情绪识别推理效率热门音频事件检测

SenseVoice是一款支持多语言的语音解析模型，整合了自动语音识别、语种识别、情绪识别及音频事件检测功能。该项目采用非自回归端到端框架，可在超过50种语言上提供精准的语音识别服务，大幅降低了推理延迟，提供方便的微调脚本和多语种细粒度情绪分析，支持多种客户端语言和服务部署，适用于多种商业场景。

cheetah - 提升软件工程面试表现的AI驱动macOS应用

AI辅助CheetahGithubmacOS应用实时指导开源项目热门软件工程面试

Cheetah是一款针对macOS的AI驱动应用，旨在通过实时语音转写和代码提示帮助用户提升远程软件工程面试表现。应用集成了最新的Whisper技术和GPT-4智能，需使用OpenAI API密钥。支持M1或M2型号的Mac以获得最佳性能。Cheetah通过提供即时编程指导，提高面试成功率，无需长时间备考。

sherpa-onnx - 多平台本地运行的语音处理开源项目

GithubSherpa开源项目语言识别语音合成语音识别音频标记

Sherpa-onnx是一个支持多平台、多功能的语音处理开源项目，涵盖语音识别、语音合成、说话人验证、语言识别等功能，兼容安卓、iOS、Windows、macOS、Linux等系统。支持多种编程语言如C++、C、Python、Go、C#、Java、Kotlin、JavaScript、Swift和Dart，提供预构建的APK和Flutter应用，以及开源预训练模型，便于语音处理开发和部署。

Applio - 基于VITS的高效语音转换

ApplioContentVecGithubRVCTTS模型开源项目语音转换

Applio项目提供高效、优质的语音转换解决方案。基于增强版RVC模型，Applio采用先进的语音处理技术，实现卓越的语音转换效果。用户可通过详细文档、丰富插件和友好界面，轻松安装和使用Applio。支持多平台操作和30多种语言，适用于各种商业用途，确保广泛的应用场景和良好的用户体验。

sherpa-ncnn - 轻量级多平台实时语音识别工具

AndroidGithubsherpa-ncnn多平台实时开源项目语音识别

sherpa-ncnn 是一个开源的实时语音识别项目，支持 Linux、macOS、Windows 及嵌入式设备。基于 ncnn 框架开发，无需依赖 PyTorch，具有轻量化和高效性特点。项目提供详细文档、演示视频和 Android 应用开发指南。支持多语言识别和背景噪音处理，适用于各种语音识别应用场景。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号