Project Icon

ollama-voice-mac

离线可用的Mac专用语音助手

Ollama-voice-mac是一个离线语音助手,利用Ollama和Whisper语音识别模型工作。通过安装Ollama、Mistral 7b和OpenAI Whisper Model,即可在Mac上运行。该项目基于maudoin的工作进行了改进,兼容Mac,适用于macOS 14 Sonoma及以上版本。通过下载更高质量的系统语音,如'Zoe (Premium)',可提升语音质量。用户也可以通过修改assistant.yaml文件来支持其他语言,方便多语言使用。

quillman - 开源的实时语音转录和语言模型对话应用
GithubMetavoice Tortoise TTSModalOpenAI WhisperQuiLLManZephyr开源项目
一个开源项目,提供实时语音转录和自然语音合成的聊天应用,使用Zephyr语言模型和OpenAI Whisper技术。适用于开发和实验自定义语言模型应用,可在Modal平台上无服务器部署。提供在线演示、详细文档和模块化结构,方便本地开发和部署。
ava - 离线运行AI语言模型的开源跨平台应用
Ava PLSGithub开源软件开源项目本地运行桌面应用语言模型
Ava PLS是一款开源跨平台应用,支持在本地计算机上离线运行AI语言模型。该应用可执行文本生成、语法纠正、改写、摘要和数据提取等多种语言任务。Ava PLS采用Zig、C++、Swift UI和SQLite等技术开发,适用于macOS、Windows和Linux系统。作为离线虚拟助手和个人语言服务器,Ava PLS为用户提供了一个功能全面的本地化AI语言处理解决方案。
whisper.unity - 本地语音识别与多语言翻译工具
ASRGithubOpenAIUnitywhisper.cppwhisper.unity开源项目
whisper.unity项目为Unity3d提供了whisper.cpp的绑定,支持在本地运行OpenAI Whisper自动语音识别模型。具备约60种语言支持、多语言翻译和多种模型尺寸选择,可在Windows、MacOS、Linux、iOS和Android等平台上高效运行,且无需互联网连接。项目完全开源,支持商业用途,并支持CUDA和Metal加速。
LLMFarm - 多功能大语言模型应用 支持iOS和macOS
GithubLLMFarmMacOS应用iOS应用人工智能大语言模型开源项目
LLMFarm是一款面向iOS和macOS的大语言模型应用,支持多种推理引擎和采样方法。该应用可加载和调整各类LLM模型参数,并提供Metal加速功能。此外,LLMFarm还具备LoRA适配器支持、模型微调和导出功能,以及上下文状态恢复和Apple快捷指令集成,为用户提供全面的大语言模型使用体验。
insanely-fast-whisper - 高效率开源语音转录命令行工具
AI模型CLI工具GithubWhisper开源项目性能优化语音转录
Insanely Fast Whisper是一款开源的高性能语音转录命令行工具,基于Transformers、Optimum和Flash Attention技术。该工具支持OpenAI的Whisper Large v3模型,能够在98秒内处理150分钟的音频。通过Flash Attention 2和批处理等优化,大幅提升了转录效率。适用于NVIDIA GPU和Mac设备,用户可通过简单的命令实现快速准确的音频转录。
Stage-Whisper - 跨平台免费开源音频转录工具
GithubStage-WhisperWhisper应用程序开源开源项目音频转录
Stage Whisper是一款免费开源的音频转录应用,基于OpenAI的Whisper模型,提供精确的音频文件转录。它拥有直观的图形界面,用户可以轻松存储和编辑转录内容。该项目旨在让非技术用户也能方便地使用Whisper的强大功能。适用于MacOS、Windows和Linux多平台,目前正进行重大改进,测试版即将发布。
whisper - 多语种语音识别与翻译解决方案
GithubOpenAITransformer模型Whisper多语言处理开源项目热门语音识别
Whisper是一个通用语音识别模型,支持多种语言处理任务,如语音翻译和语言识别。该模型基于大规模多样化音频数据集进行训练,利用Transformer技术实现高效的序列到序列学习。用户可以通过简单的命令或Python代码实现快速准确的语音识别与翻译,是一个适用于多种应用场景的强大工具。支持多个模型大小和语言选项,用户可根据需求选择合适的模型。
awesome-whisper - 开源AI语音识别技术
AIGithubOpenAIWhisper开源项目语音识别音频转录
Whisper是OpenAI开发的开源AI语音识别系统,支持多种语言和平台,具备高精度和实时处理能力,并适用于开发者和企业进行高效集成。
RuntimeSpeechRecognizer - 基于OpenAI的Whisper的语音识别项目
GithubOpenAI's WhisperRuntime Speech RecognizerUnreal Engine开源项目语音识别高性能
RuntimeSpeechRecognizer是一个高效的语音识别项目,基于OpenAI的Whisper技术,提供快速且准确的识别。支持英语和多语言(多达100种语言),提供从75 MB到2.9 GB多种模型尺寸。自动下载语言模型,支持将识别的语音翻译成英语,特性可定制,无需静态库或外部依赖,兼容多个平台(Windows、Mac、Linux、Android、iOS等)。
swift - 基于多项先进技术的开源AI语音交互系统
AI语音助手CartesiaGithubGroqNext.jsSwift开源项目
Swift是一个开源的AI语音交互系统,集成了多项先进技术。系统使用Groq技术实现OpenAI Whisper的语音转写和Meta Llama 3的文本生成,通过Cartesia的Sonic模型进行语音合成,并采用VAD技术进行语音检测。项目基于Next.js框架和TypeScript开发,在Vercel平台部署。Swift旨在提供高效的AI语音交互能力。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计 是一个多功能的在线设计和创意平台,提供广泛的设计工具和资源,以满足不同用户的需求。从专业的图形设计师到普通用户,无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑,稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合,帮助用户轻松实现创意设计。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号