Project Icon

OpenVoiceOS

开源语音平台 实现跨设备语音控制

OpenVoiceOS是社区驱动的开源语音平台,致力于创建跨设备语音控制界面。平台支持自然语言处理,提供可定制界面,重视隐私安全。适用于多种设备,包括嵌入式设备和单板计算机,方便DIY智能音箱制作。OpenVoiceOS为开发者提供实验环境,可在Linux和开源语音助手项目中测试新功能。支持Docker和Python安装,并为Raspberry Pi和Mycroft设备提供预构建镜像。

DeepSpeech - 开源的深度学习语音识别引擎
GithubProject DeepSpeechTensorFlow开源开源项目机器学习语音识别
DeepSpeech是一个开源语音转文字引擎,基于百度的Deep Speech研究,并利用Google TensorFlow实现。提供详细的安装、使用和训练模型文档。最新版本及预训练模型可在GitHub获取,支持和贡献指南请参阅相应文件。
glados-tts - 开源Portal风格语音合成引擎
GLaDOSGithub安装指南开源项目模型训练神经网络语音合成
GLaDOS TTS是一个开源的文本转语音引擎,利用神经网络技术生成Portal游戏风格的GLaDOS语音。该项目支持独立运行和远程API调用,提供了详细的安装说明和训练方法。GLaDOS TTS包含多说话人模型训练和模型优化功能,适用于各种设备和应用场景。开发者可以通过此项目轻松将Portal风格的语音集成到自己的应用中。
GPT-SoVITS - 少样本声音克隆模型
GPT-SoVITS-WebUIGithubWebUI工具开源项目文本转语音模型训练热门跨语言支持
GPT-SoVITS-WebUI是一款功能强大的在线语音转换和文本转语音工具,支持跨语言转换与实时语音合成。项目集成了自动训练集分段、中文语音识别和文本标记等工具,能够帮助初学者轻松创建训练数据集和GPT/SoVITS模型。GPT-SoVITS支持零样本和少样本文本转语音,是音频处理领域的创新应用。
whisper - 跨平台音频转文本开源项目
FFMPEGGithubWhisperWhisper.cppopen source开源项目音频转文字
Whisper是OpenAI开发的开源项目,使用whisper.cpp和FFMPEG将音频转换为WAV格式并提取文本。项目支持客户端和服务器端运行,无需互联网。目前代码和文档正在优化,接受捐赠以支持持续更新。适用于Android、Linux、Windows、iOS和macOS系统,安装和使用便捷,提供详尽文档和丰富资源。
Voiceflow - 现代化AI客户体验开发与部署平台
AI客户体验AI工具Voiceflow客户支持自动化对话式AI开发者平台
Voiceflow是一个AI客户体验开发平台,为产品团队提供现代化对话式AI开发工具。平台支持快速构建、管理和部署AI代理,实现客户支持自动化。它允许自定义响应、界面和集成,并提供开发者工具包以便与现有技术栈集成。Voiceflow适用于不同规模的团队,有助于提升客户支持效率,降低运营成本,优化用户体验。平台特点包括AI代理训练、多步骤任务工作流构建、大规模代理管理等功能。Voiceflow还提供自定义集成和扩展能力,支持与Segment、Zendesk、Twilio等多种服务集成。用户反馈显示,使用Voiceflow可显著提高客户支持效率,如自动化60%的支持工单、每周节省30小时工作时间等。
swift - 基于多项先进技术的开源AI语音交互系统
AI语音助手CartesiaGithubGroqNext.jsSwift开源项目
Swift是一个开源的AI语音交互系统,集成了多项先进技术。系统使用Groq技术实现OpenAI Whisper的语音转写和Meta Llama 3的文本生成,通过Cartesia的Sonic模型进行语音合成,并采用VAD技术进行语音检测。项目基于Next.js框架和TypeScript开发,在Vercel平台部署。Swift旨在提供高效的AI语音交互能力。
duix.ai - 开源AI数字人交互平台 助力多平台智能应用开发
AI交互DUIXGithubSDK开源开源项目数字人
DUIX是一个开源的AI数字人交互平台,集成了大规模模型、语音识别和文本转语音技术。该平台支持Android和iOS多平台部署,便于开发者创建智能数字人应用。DUIX具有部署成本低、网络依赖性小的特点,同时提供多样化功能,适用于地铁、银行、政务等多种场景,可满足视频、媒体、客服等行业需求。
whisper-asr-webservice - 基于Whisper的开源语音识别Web服务
DockerGPU支持GithubWhisper ASR开源项目语音识别
whisper-asr-webservice是一个开源的语音识别Web服务,基于OpenAI Whisper模型。它支持OpenAI Whisper和Faster Whisper引擎,提供多语言语音识别、翻译和语言识别功能。项目提供Docker镜像,支持CPU和GPU部署。这个服务具有高性能和易用性,适合各种语音识别应用场景。
whisper-plus - 全面音频处理工具集成语音识别与智能交互
AI模型GithubWhisperPlus开源项目自然语言处理语音转文字
WhisperPlus是一个集成多项功能的开源音频处理工具库。它支持语音转文字、文本摘要和说话人分离等核心功能,并提供YouTube音频下载、多种模型选择以及基于RAG技术的视频内容智能对话能力。此外,WhisperPlus还包含文本转语音和自动字幕生成功能,为开发者提供全面的音频处理解决方案。该项目安装简便,接口灵活,适用于广泛的语音处理应用场景。
gpt-voice-conversation-chatbot - GPT语音对话机器人,支持个性化对话和长期记忆功能
ChatGPTGPT-4GPT-VCCGithubOpenAI APIPython开源项目
本项目通过OpenAI API,提供一个可以用麦克风与ChatGPT或GPT-4进行语音交互的聊天机器人,支持个性化对话与记忆功能。用户可以选择键盘输入或语音输入,机器人能够持续记住对话内容。需要有效的OpenAI API密钥,并支持Google和ElevenLabs的TTS工具。适用于Windows和Linux,提供名称设置、创造力调节和预设对话模式等多种自定义功能。适合语言练习、编程学习和日常对话。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计 是一个多功能的在线设计和创意平台,提供广泛的设计工具和资源,以满足不同用户的需求。从专业的图形设计师到普通用户,无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑,稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合,帮助用户轻松实现创意设计。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号