Project Icon

language-detection

准确文本语言检测,支持110种语言,适用于PHP项目

language-detection是一个PHP库,可检测文本的语言。通过解析训练文本生成N-grams数据库,用于语言检测。支持110种语言,提供API接口、白名单和黑名单功能、结果限制、最佳结果获取等功能。用户可自定义语言文件进行训练,提高检测精度。适合需要多语言支持的PHP项目。

项目介绍:language-detection

language-detection 是一个用来检测给定文本字符串语言的 PHP 库。它通过将不同语言的训练文本解析为 N-gram 序列,构建一个在检测阶段使用的数据库文件,然后使用这个数据库来识别输入文本的语言。这一库内置了对 110 种语言的训练和检测支持。

安装和使用

使用 Composer 安装

要使用 language-detection,首先需要确保 PHP 环境中安装了 Multibyte String 扩展。通过 Composer 安装该库非常简单:

$ composer require patrickschur/language-detection

基本用法

为了准确检测语言,输入文本的长度建议至少为几句话。以下是一个基本用法示例:

use LanguageDetection\Language;
 
$ld = new Language;
 
// 检测语言
$ld->detect('Mag het een onsje meer zijn?')->close();

返回的结果是一个语言代码和其对应概率的数组。

功能简介

  • API 设计:该库提供了一系列 API 方法如 whitelistblacklistbestResultslimit 等,以实现语言过滤和结果限制。
  • 支持的语言:目前支持 110 种语言,用户可以通过在 resources 目录添加自定义语言文件来扩展支持的语言。
  • 方法链:可以通过链式调用多种方法,如结合 blacklistlimit 方法以获取特定的检测结果。

API 方法示例

  • whitelist(string ...$whitelist):传入一个白名单,仅返回指定的几种语言。

  • blacklist(string ...$blacklist):传入一个黑名单,从结果中排除指定的语言。

  • setTokenizer(TokenizerInterface $tokenizer):用户可以自定义解析器以处理特定格式的文本。

自定义语言支持

用户可以通过在 resources 目录中创建文件来添加新的语言。具体步骤为:

  1. resources 创建新目录并添加训练文本文件。
  2. 使用类 Trainer 生成语言的模型。
  3. 删除辅助代码以保留干净的项目结构。

FAQ 常见问题

  • 在检测阶段提高准确率的方法是使用更多的 N-gram,但这会降低性能。建议使用约 9,000 个 N-gram 来提升准确率。
  • 即使语言文件很大,检测过程也不会变慢,因为过程只使用最佳的几个 N-gram。

贡献和许可证

language-detection 欢迎任何形式的贡献,并且根据 MIT 许可证条款发布。用户和开发者可以自由地使用和修改该库,支持不断的改进和功能扩展。

项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号