Project Icon

text-dedup

文本去重工具集,支持多种去重方法和大规模数据集处理

项目提供一系列文本去重脚本,适用于各种场景,包括嵌入式去重(RETSim/UniSim)、适合大规模数据集的MinHash + MinHashLSH、64或128位SimHash、后缀数组子串去重、布隆过滤器和精确哈希去重等方法。项目支持高效处理大数据集并计划引入更多去重方法,如SuperMinHash和ProbMinHash等。用户可以根据需求来自定义脚本,灵活应用于不同的文本数据处理场景。

bricks - 开源自然语言处理模块库 提升文本分析效率
Githubbricks代码模块开源项目文本分析自然语言处理
bricks是一个开源自然语言处理模块库,提供多种文本分类器、提取器和生成器。开发者可利用bricks实现语言检测、情感分析、复杂度评估等文本增强功能。该项目支持独立使用,也可与refinery无缝集成,为文本分析提供灵活解决方案。
HCP-Diffusion - Stable Diffusion模型训练与优化工具集
DreamArtist++GithubHCP-DiffusionLoRAStable Diffusion开源项目文本到图像生成
HCP-Diffusion是基于Diffusers库开发的Stable Diffusion模型工具集。它整合了多种文本到图像生成的训练方法,包括Prompt-tuning和Textual Inversion等。该工具集引入了DreamArtist++技术,支持一次性文本到图像生成。HCP-Diffusion提供层级LoRA、模型集成和自定义优化器等功能,为AI研究和开发提供全面的模型训练与推理支持。
DocuSpeed - 智能文档阅读效率提升工具
AI工具大语言模型文本摘要文档阅读效率翻译服务问答功能
DocuSpeed专注提高文档阅读效率,提供摘要、问答和翻译功能。适用于学术论文和书籍等场景,通过自动化流程快速提取核心内容。工具可逐章总结书籍,显著缩减阅读时间。DocuSpeed致力于提供智能、快速、高效的阅读体验,未来计划涵盖财务报告、研究论文和法律文件等更多专业领域。
PruningRadixTrie - 革新性前缀搜索与自动完成数据结构
GithubPruningRadixTrie前缀搜索开源项目数据结构算法性能自动完成
PruningRadixTrie是一种创新数据结构,基于基数树原理,但性能提升了1000倍。通过在节点中存储子节点最大排名,实现树的修剪和查找提前终止,显著提升了前缀搜索和自动完成效率。这种结构特别适合在大型词典中进行查询完成和前缀搜索,可高效服务于大量并发用户。PruningRadixTrie具备添加术语、检索top-k相关术语等功能,同时支持文件持久化,便于数据管理和存储。
TextMine - 企业文档智能管理与分析平台
AI分析AI工具TextMine合规性数据提取文档管理
TextMine是一款智能企业文档管理系统,能将发票、合同等关键业务文档转化为结构化数据。它提供自动分类、数据提取、智能搜索和分析功能,助力企业提高数据透明度,优化决策流程,强化合规管理。TextMine适用于财务、法务、人力等多个部门,帮助企业节省时间成本,降低运营风险,提升整体效率,充分发挥文档数据的价值。
LLMTest_NeedleInAHaystack - LLM长上下文检索能力测试工具
AnthropicCohereGithubLLMsNeedle In A HaystackOpenAI开源项目
LLMTest_NeedleInAHaystack是一个用于评估长上下文语言模型检索能力的开源工具。通过在长文本中插入特定信息并要求模型检索,它可以测试OpenAI、Anthropic和Cohere等主流LLM的性能。该项目提供灵活的参数配置和结果可视化,有助于研究人员和开发者分析不同模型的上下文理解能力。
similarity - 用于度量学习的库,支持自监督和对比学习
GithubTensorFlow Similarity对比学习度量学习开源项目相似性学习自监督学习
TensorFlow Similarity 是一个用于度量学习的库,支持自监督和对比学习。该库提供先进的算法,可用于研究、训练、评估和部署基于相似性和对比的模型,包含模型、损失函数、指标、采样器、可视化工具和索引子系统。最新版本支持分布式训练,增加了多模态嵌入和新的检索指标。可在未标记数据上进行预训练以提高准确性,或构建模型找到并聚类相似示例。了解更多请查看文档和示例。
budoux - 独立小巧且多语言支持的机器学习换行工具
BudouXGithub开源项目机器学习浏览器端独立工具语段分割
BudouX 是一款独立且小巧的机器学习换行整理工具,无需依赖第三方分词器,支持日语、简体中文、繁体中文和泰语。它占用空间小,约15KB,可用于客户端,并支持与HTML输入的集成。使用者可以通过提供数据集训练任何语言的模型,适用于Python、JavaScript和Java编程语言。该工具旨在解决CJK语言在网页排版中的分行问题,提高可读性。
sumy - 简易文本摘要提取和评估工具,支持多种语言
GithubPythonsumy命令行工具开源项目文本总结自动摘要
Sumy是一款简单的文本摘要提取工具,支持多种语言和评估方法。通过Python和pip即可安装,用户可在命令行或浏览器中使用,Python API便于集成项目,还支持容器化运行,满足多种使用需求。
retext - 可扩展的自然语言转换框架
Githubretext开源项目插件系统文本转换自然语言处理语法树
retext是一个基于插件的自然语言转换框架,可在服务器、客户端和Deno等多种环境中使用。它通过结构化数据处理自然语言,支持拼写检查、排版优化和可读性分析等功能。retext生态系统包含多个语言处理包,并允许开发自定义插件。作为unified项目的开源组件,retext使用nlcst语法树提供强大的自然语言支持,适用于文本分析、内容优化和自动校对等场景。其活跃的社区不断贡献新插件,使retext成为灵活可靠的文本处理解决方案。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号