Project Icon

text-dedup

文本去重工具集,支持多种去重方法和大规模数据集处理

项目提供一系列文本去重脚本,适用于各种场景,包括嵌入式去重(RETSim/UniSim)、适合大规模数据集的MinHash + MinHashLSH、64或128位SimHash、后缀数组子串去重、布隆过滤器和精确哈希去重等方法。项目支持高效处理大数据集并计划引入更多去重方法,如SuperMinHash和ProbMinHash等。用户可以根据需求来自定义脚本,灵活应用于不同的文本数据处理场景。

memreduct - 轻量级内存优化工具 实时监控清理系统资源
GithubMem ReductWindows工具内存管理开源项目系统优化缓存清理
Mem Reduct是一款轻量级内存管理工具,专注于实时监控和清理Windows系统内存。通过利用Native API清理系统缓存,可有效释放10-50%的内存空间。支持Windows XP SP3及以上版本,部分功能从Vista开始可用。提供安装版和便携版,需管理员权限运行。此工具有助于优化系统性能,提升计算机运行效率。
embedditor - 开源向量搜索优化工具,编辑GPT嵌入
EmbedditorGPTGithub向量搜索嵌入开放源代码开源项目
Embedditor是一款开源嵌入预处理编辑器,简便如微软Word,帮助编辑GPT/LLM嵌入,优化向量搜索并显著降低嵌入和存储成本。提高检索内容的关联性和准确性,支持自动化预处理,去除噪音信息和常用词汇。特性包括添加元数据、标记和筛选嵌入部分,提供美观的HTML标记和多种文件格式保存。本地部署,最大化数据控制并降低30%成本。
pythia-1.4b-deduped - 用于解释性研究的大规模语言模型套件
EleutherAIGithubHuggingfacePythia去重数据集大语言模型开源项目模型模型训练
Pythia Scaling Suite由多个大规模语言模型组成,旨在支持对模型可解释性的研究。其提供不同规模的模型版本,包括专为科研实验设计的1.4B去重模型,伴有154个训练检查点。虽不以下游应用为导向,但其性能在诸多方面可比拟甚至超越同类模型。适用于关注语言模型行为研究的科学工作者。
metasearch - 高效多源并行搜索工具 实现信息检索效率提升
DockerGithubMetasearch开源项目搜索工具数据源
Metasearch是一个开源的多源并行搜索工具,支持同时检索超过25种数据源,包括AWS、GitHub、Google Drive、Confluence、Jira和Slack等。此工具能显著提高信息检索效率,适合企业内部资源管理。Metasearch支持Docker和Git部署,设置简便,并欢迎社区贡献新的数据源支持。它为企业提供了一个统一的平台,用于快速搜索和访问分散在各种工具和平台上的信息。作为一个轻量级工具,Metasearch仅由约3000行TypeScript代码构成,具有出色的扩展性。
Spam Filter - 高效隐私保护垃圾邮件过滤API
AI工具AI预测API服务低延迟垃圾邮件过滤隐私保护
DeSpam提供专业的垃圾邮件过滤API服务,采用零日志政策、军事级安全标准和AI技术,确保用户隐私和通信安全。该服务具有低延迟和高可用性,适用于个人和各规模企业。通过多种定价方案,DeSpam为不同需求提供灵活选择,快速准确识别垃圾内容,是可靠的通信安全解决方案。
diffgram - AI数据存储与管理解决方案,涵盖多种数据类型与人类监督
AI数据存储DiffgramGithub人类监督开源项目数据工作流数据标签
提供多种数据类型的人类监督功能和AI数据存储解决方案。支持图像、视频、文本和3D数据的高效管理和标注,用户可自行掌控本地数据。适用于从数据标签到AI应用工作流管理的多种商业和研究场景。
WeTextProcessing - 中英文文本标准化和反标准化处理工具包
GithubWeTextProcessing开源项目文本归一化自然语言处理语音识别逆文本归一化
WeTextProcessing是一个开源的文本处理工具包,主要用于中英文文本的标准化和反标准化。它提供API接口,允许自定义规则,并支持C++运行时部署。该工具适用于语音识别后处理、自然语言处理等需要处理大量文本数据的场景。WeTextProcessing具有高性能和灵活配置的特点,可满足各种文本处理需求。
fuzzy-search - 高效灵活的前端模糊搜索JavaScript库
FrontendGithubJavaScript库多语言支持开源项目性能优化模糊搜索
fuzzy-search是一款高性能的前端模糊搜索JavaScript库。它采用n-gram和字符排序算法,支持多语言,查询速度通常低于10ms。该库允许灵活管理搜索实体和术语,无外部依赖,经过全面测试。fuzzy-search为开发者提供了快速、准确且易于集成的搜索解决方案,适用于各类Web应用。
revup - 简化并行代码变更管理的开源工具
GitHubGithubPython工具Revup代码审查并行开发开源项目
Revup是一个开源的命令行工具,旨在简化并行代码变更的管理过程。它可以自动创建和管理多个独立分支链,处理GitHub拉取请求,执行变基检测,并提供审查图和补丁集功能。通过优化代码审查流程,Revup帮助开发团队提高协作效率,适用于需要频繁并行开发的项目。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

白日梦AI

白日梦AI提供专注于AI视频生成的多样化功能,包括文生视频、动态画面和形象生成等,帮助用户快速上手,创造专业级内容。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

讯飞绘镜

讯飞绘镜是一个支持从创意到完整视频创作的智能平台,用户可以快速生成视频素材并创作独特的音乐视频和故事。平台提供多样化的主题和精选作品,帮助用户探索创意灵感。

Project Cover

讯飞文书

讯飞文书依托讯飞星火大模型,为文书写作者提供从素材筹备到稿件撰写及审稿的全程支持。通过录音智记和以稿写稿等功能,满足事务性工作的高频需求,帮助撰稿人节省精力,提高效率,优化工作与生活。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号