vosk-server

多协议支持的高准确度离线语音识别服务器

语音识别服务器通信协议离线识别 Vosk-API Github 开源项目

vosk-server是一个基于Kaldi和Vosk-API的高准确度离线语音识别服务器。支持MQTT、GRPC、WebRTC和Websocket四种主要通信协议，适用于智能家居、PBX系统以及Web流式语音识别等场景。该服务器可本地部署，也可作为聊天机器人、网站和电话系统的后端。Vosk网站提供详细的文档和使用说明。

访问官网

Github

介绍相关项目

open-im-server - 开源即时通讯服务器提供完整IM功能集成方案

GithubOpenIM即时通讯开源软件开源项目微服务架构跨平台

open-im-server是开源即时通讯服务器，提供完整IM功能集成。基于微服务架构，可处理大规模用户和消息。通过REST API和Webhooks扩展功能。支持源码、Docker和Kubernetes部署，兼容主流操作系统。适合开发者快速构建即时通讯应用。

FunAudioLLM-APP - 开源语音交互与实时翻译应用

FunAudioLLMGithub人工智能开源项目语音翻译语音聊天音频处理

FunAudioLLM-APP是一个开源项目，包含Voice Chat和Voice Translation两个应用。Voice Chat提供AI驱动的对话系统，实现自然的语音交互。Voice Translation提供实时语音翻译功能，帮助不同语言使用者进行沟通。项目整合了CosyVoice和SenseVoice技术，旨在提升语音交互和翻译体验。

tensorflow-speech-recognition - 开源TensorFlow中的语音识别示例

DeepSpeechGithubTensorflowWhisper开源项目深度学习语音识别

使用谷歌的TensorFlow框架进行语音识别，最初目标是为Linux系统创建独立的语音识别模型。尽管该项目现主要用于教学，开发者展示了使用开源数据和强大模型实现高效语音识别的潜力。推荐查看更新项目如Whisper和Mozilla的DeepSpeech，这两个项目在错误率方面的表现出色。该项目包含示例代码、依赖安装指导及功能扩展，如GPU上的WarpCTC和P2P学习模块。

TTSVox - 多语言在线文本转语音工具提供自然流畅的语音合成

AI工具免费服务在线工具多语言支持文本转语音逼真语音

TTSVox为用户提供高质量的在线文本转语音服务，支持多种语言和声音选项。该工具适用于教育、专业和无障碍等多种场景，操作简单无需下载安装。TTSVox不断优化算法，致力于提供准确、自然的语音输出。作为一款实用工具，它为视障人士、阅读障碍者以及听觉学习者提供便利，同时也适合多任务处理和移动学习。

Vapi - 开发者专用语音AI快速构建与部署平台

AI工具Vapi实时对话客户服务开发者工具语音AI

Vapi是为开发者打造的语音AI平台，支持快速构建、测试和部署高质量语音代理。平台特色包括低延迟优化、中断处理、多语言支持和高度可扩展性。通过集成多种模型和语音服务，并提供Web、iOS等多平台SDK，Vapi助力开发者轻松创建自然流畅的语音交互体验。Vapi致力于简化语音AI开发流程，提高效率。

vibe - 离线音视频转录，多语言支持和多格式输出

GithubOpenAI WhisperVibe开源项目批量转录隐私音频转录

Vibe利用开源工具OpenAI Whisper进行离线音视频转录，支持几乎所有语言，保证数据隐私。软件界面友好，支持多种文件格式如SRT、VTT、TXT、HTML、PDF和JSON。Vibe还具备批量转录、多语言翻译和实时预览等功能，适用于Windows、Linux和macOS系统。优化了对CPU和GPU的支持，兼容Nvidia和AMD GPU。用户可以通过命令行接口进行操作，并提供HTTP API文档。其他功能包括系统音频转录、麦克风转录、说话人分割，未来还将支持iOS和Android。

website - KServe简化机器学习模型部署和管理

GithubKServe开源项目文档社区网站贡献

KServe是开源机器学习模型服务平台，旨在简化AI模型部署和管理。项目网站提供全面文档、代码示例和社区资源。支持版本化文档，欢迎社区参与改进。平台为企业级AI部署提供灵活解决方案，包括最新文档、博客和贡献指南。

Speechson - 在线多语言文本转语音服务

AI工具AI语音生成SSML功能Speechson多语言支持文字转语音

Speechson是一个在线文本转语音平台，提供840多种AI语音和135多种语言方言。支持MP3、OGG、WAV和WEBM等音频格式输出。借助深度学习技术，生成高质量、自然的语音。平台支持SSML功能，方便调整语音特性。适用于教育培训、内容创作等多种场景，能够满足多样化的语音需求。

whisper-web - 浏览器端实时语音识别技术

GithubTransformers.jsWebGPUWhisper Web开源项目浏览器应用语音识别

Whisper Web是一个基于机器学习的浏览器端语音识别项目。它利用 Transformers.js 技术，在客户端实现实时语音处理，无需服务器支持。该项目提供在线演示和本地部署选项，并正在开发 WebGPU 支持以提高性能。Whisper Web 展示了 Web 技术在语音识别领域的应用潜力，为开发者提供了一个便捷的语音识别解决方案。

chatgpt-telegram-bot-serverless - 无服务器的Telegram机器人

APIAWS LambdaBotChatGPTGithubTelegram开源项目

这是一个完全无服务器的Telegram机器人，利用最新的ChatGPT API，通过AWS Lambda部署，无需本地服务器或浏览器登录。支持语音消息和Markdown渲染，适合快速创建和部署聊天机器人的用户。详细的初始设置和部署指南包括OpenAI账户、AWS账户和S3存储桶的配置，以及Telegram令牌的设置。未来计划包括改进令牌刷新机制、提升响应性能和错误处理，并通过CloudFormation一键部署。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

白日梦AI

白日梦AI提供专注于AI视频生成的多样化功能，包括文生视频、动态画面和形象生成等，帮助用户快速上手，创造专业级内容。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

讯飞绘镜

讯飞绘镜是一个支持从创意到完整视频创作的智能平台，用户可以快速生成视频素材并创作独特的音乐视频和故事。平台提供多样化的主题和精选作品，帮助用户探索创意灵感。

Project Cover

讯飞文书

讯飞文书依托讯飞星火大模型，为文书写作者提供从素材筹备到稿件撰写及审稿的全程支持。通过录音智记和以稿写稿等功能，满足事务性工作的高频需求，帮助撰稿人节省精力，提高效率，优化工作与生活。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号