Project Icon

indexify

构建快速数据管道 实时处理非结构化数据的开源引擎

Indexify是一个开源引擎,用于构建处理非结构化数据的快速数据管道。它支持视频、音频、图像和文档处理,使用可重用提取器进行数据嵌入、转换和特征提取。系统能自动更新向量数据库和结构化数据库,支持增量提取,并提供提取器SDK。Indexify预置多种提取器,兼容多种LLM框架和存储系统,可本地运行原型。这些特性使其成为实时RAG应用和智能体的高效数据处理解决方案。

vearch - 云原生分布式向量数据库,支持高效相似性搜索
GithubVearch云原生分布式数据库向量搜索开源项目相似度搜索
Vearch是一个提供云原生分布式向量数据库的开源项目,专注于实现嵌入向量的高效相似性搜索。支持混合搜索与标量过滤,具备从百万对象中毫秒级别检索的高性能。同时,Vearch还具备复制和弹性扩展的能力。提供的文档资源包括Restful API、OpenAPI和多语言SDK,适用于构建可视化搜索系统和作为AI内存后端。
mongodb-demo - LlamaIndex和MongoDB构建智能问答系统实践
FlaskGithubLlamaIndexMongoDBNext.js向量搜索开源项目
本项目展示了利用LlamaIndex和MongoDB构建智能问答系统的完整流程。从数据导入到索引创建,再到API开发和前端部署,涵盖了系统构建的各个环节。结合OpenAI语言模型和MongoDB向量搜索,实现了对特定数据集的复杂查询和智能回答。项目提供了一个端到端的工作流程,可供开发者参考创建AI驱动的应用。
pg_vectorize - Postgres数据库文本向量搜索与自动化扩展工具
GithubLLM应用Postgres扩展pg_vectorize嵌入转换开源项目文本向量搜索
pg_vectorize是一款针对Postgres数据库设计的扩展工具,实现了文本到向量的自动化转换和流行LLMs的连接。简化现有数据上的搜索操作只需两个函数,完美集成了OpenAI和Hugging Face Sentence-Transformers的自然语言处理技术,满足商业与开发的多样性需求。
omniparse - 多类型非结构化数据解析与结构化平台
GithubOmniParse多媒体处理开源项目文档解析结构化数据网页爬取
OmniParse是一个专注于非结构化数据处理的开源平台。该平台能够解析文档、表格、图像、视频、音频和网页等多种格式,将其转化为结构化数据,以便于生成式AI应用使用。OmniParse支持约20种文件类型,具备本地处理能力,无需依赖外部API。这使其适用于多种AI应用场景,包括检索增强生成(RAG)和模型微调等。
spark - 统一分析引擎 支持多语言API及丰富工具集
Apache SparkGithub分布式计算大数据处理开源项目数据分析机器学习
Apache Spark是一个大规模数据处理的统一分析引擎,提供Scala、Java、Python和R的高级API。它支持多种高级工具,如Spark SQL、pandas API on Spark、MLlib、GraphX和Structured Streaming,分别用于SQL查询、pandas操作、机器学习、图处理和流处理。Spark的优化引擎支持通用计算图,适用于多种大数据分析场景。
Extracta.ai - 自动提取非结构化文档数据 无需训练高效解析
AI工具Extracta.ai人工智能数据提取文档处理自动化
Extracta.ai为智能文档数据提取工具,可从多种非结构化文档中自动提取信息。支持PDF、图片、扫描件等格式,无需复杂训练。用户定义所需字段并上传文件后,即可获得结构化数据。适用于发票、简历、合同等文档处理,提高效率减少错误。采用加密存储技术,符合GDPR规定,确保数据安全。
spyglass - 个性化搜索引擎 实现快速精准信息检索
GithubSpyglass个人搜索引擎内容索引开源项目网页爬取隐私保护
Spyglass作为一款创新个人搜索引擎,允许自定义索引内容,通过简洁界面快速访问。支持索引本地文档、互联网主题、Google日历和GitHub仓库等多种数据源,有效突破传统搜索限制。该工具在本地设备运行,保障数据隐私,同时提供强大搜索功能,便于构建个人专属信息库。
VectorHub - 免费开源的向量检索学习平台与工具
GithubVDB 比较工具VectorHub向量检索开源开源项目机器学习
VectorHub是一个免费开源的学习平台,旨在帮助用户将向量检索技术集成到机器学习堆栈中。用户可以在这里找到实用资源,用于创建最小可行产品(MVP),解决特定用例中的挑战,了解和选择合适的向量数据库供应商。VectorHub还提供了一个免费工具,用于比较不同向量数据库的特性,确保在生产环境中的应用效果。
synmetrix - 专为集中管理和优化大规模指标数据而设计的数据工程平台
CubeGithubSynmetrix度量管理开源项目数据工程平台语义层
Synmetrix 是一个开源数据工程平台,专为集中管理和优化大规模指标数据而设计。功能涵盖数据建模、整合、转换、聚合与分发,支持灵活的SQL建模和Cube数据模型,提供统一的语义层、排程报告及警报。支持版本控制、基于角色的访问控制、数据探索与缓存优化,并能实现团队协作与BI工具的高效整合,助力数据驱动决策。
nix-index - Nixpkgs文件快速定位工具
Githubnix-indexnixpkgs包管理命令行工具开源项目文件索引
nix-index是一款专为Nixpkgs设计的文件定位工具。通过索引二进制缓存中的构建派生,它能快速搜索特定文件。用户可生成索引,使用nix-locate命令查找文件,也可作为命令未找到的替代方案。支持Flakes安装,提供预生成数据库,与多种shell兼容,简化了Nix环境中的文件查找。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计 是一个多功能的在线设计和创意平台,提供广泛的设计工具和资源,以满足不同用户的需求。从专业的图形设计师到普通用户,无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑,稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合,帮助用户轻松实现创意设计。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号