Project Icon

datumaro

综合数据集管理与转换工具

Datumaro是一个全面的数据集管理工具,支持多种数据格式的读取、写入及转换,并提供注释处理和数据过滤功能。该工具还能进行数据集质量检查、模型推理、数据集比较及统计,协助用户有效进行数据集合并、拆分和采样,并与OpenVINO等模型集成。一览详细功能及使用指南,请参阅官方文档。

Parsr - 清理和解析文档,生成结构化数据
APIDockerGithubParsr开源项目数据解析文档处理
Parsr是一款轻量级的文档清理、解析和提取工具,支持图像、PDF、DOCX和EML格式。能够生成JSON、Markdown、CSV/Pandas DF或TXT格式的数据,为分析师、数据科学家和开发者提供结构化的标签信息集,可用于数据录入和文档分析自动化等应用。功能包括文档清理、层次结构重建、标题检测、表格、列表、目录、页码、页眉页脚和链接检测等。通过Docker镜像可以快速安装和运行,并提供GUI工具以可视化结果。
data_management_LLM - 大型语言模型训练数据管理资源汇总
Github大语言模型开源项目数据质量监督微调训练数据管理预训练
该项目汇总了大型语言模型训练数据管理的相关资源。内容涵盖预训练和监督微调阶段,探讨领域组成、数据数量和质量等关键方面。项目还收录了数据去重、毒性过滤等技术,以及不同因素间的关系研究。这些资源为优化LLM训练数据管理提供了全面参考。
roapi - 无代码自动生成数据集的只读API服务
APIGithubROAPI开源项目数据格式数据集查询接口
ROAPI为静态数据集自动生成只读API,无需编写代码。它支持SQL、GraphQL和REST API查询接口,可从文件系统、HTTP、S3等多种来源加载CSV、JSON、Parquet等格式的数据。ROAPI自动推断数据模式,并支持多种结果序列化格式,为数据访问和查询提供了灵活高效的解决方案。
dataloader - 适用于 TensorFlow、PyTorch 和 JAX 的 GPU 优化数据加载器
GPU优化GithubMerlin DataloaderPyTorchTensorFlow开源项目推荐系统
Merlin Dataloader 提供适用于 TensorFlow、PyTorch 和 JAX 的 GPU 优化数据加载器,大幅提升推荐模型的训练速度。优势包括速度提升超10倍、支持大于内存的数据集、每个周期的数据随机化及分布式训练。这些特点使其成为高效训练推荐模型的理想工具。
Streamline-Analyst - AI数据分析工具,自动化处理全流程数据
GithubStreamline Analyst开源项目数据分析数据可视化模型选择自动化工作流程
Streamline Analyst 是一个基于大型语言模型的开源数据分析应用,旨在提高数据分析效率。它自动执行数据清洗、预处理和其他复杂任务,如识别目标对象、划分测试集以及选择最佳模型。用户只需进行简单的操作,即可快速得到高质量的视觉化结果和模型。此工具确保数据隐私和安全,同时未来将增加自然语言处理、神经网络和对象检测等更多高级功能。
meta-dataset - 多样化小样本学习基准与算法实现
CrossTransformersFLUTEGithubMeta-DatasetNeurIPS 2021TFDS API开源项目
本项目介绍了基于TensorFlow Datasets的Meta-Dataset输入管道,兼容原始协议(MD-v1)和更新的VTAB+MD协议(MD-v2),并提供相关研究的代码和检查点,详细说明数据管道、模型及实验设置。大量实验揭示了一些重要的研究挑战,并提出了新的基准方法来量化Meta-Dataset中的元学习优势,希望能激励更多相关研究方向的工作。
MiraData - 长时视频数据集助力AI视频生成研究
GithubMiraData开源项目结构化标注视频数据集视频生成长视频
MiraData是一个为长视频生成任务设计的大规模数据集。其特点包括平均72秒的视频长度和详细的结构化字幕。数据集提供330K、93K、42K和9K四个版本,每个视频配有六类字幕:主要对象、背景、风格、相机运动、简短摘要和详细描述。这些特性使MiraData成为改进长序列视频处理和镜头转换建模的重要资源。
diffgram - AI数据存储与管理解决方案,涵盖多种数据类型与人类监督
AI数据存储DiffgramGithub人类监督开源项目数据工作流数据标签
提供多种数据类型的人类监督功能和AI数据存储解决方案。支持图像、视频、文本和3D数据的高效管理和标注,用户可自行掌控本地数据。适用于从数据标签到AI应用工作流管理的多种商业和研究场景。
dagu - 强大的工作流管理工具 简化复杂任务调度
DAGDaguGithubWeb界面工作流管理开源项目调度器
Dagu是一个开源的工作流管理工具,通过YAML格式定义任务依赖关系,形成有向无环图(DAG)。它提供Web界面实现可视化管理,支持Docker容器、HTTP请求和SSH命令执行。Dagu简化了复杂工作流的调度和监控,无需修改现有程序或额外数据库即可使用,是Cron的现代化替代方案。
vector-io - 多平台向量数据集迁移工具 支持主流向量数据库
GithubVector IO向量数据库向量数据集开源项目数据导入导出
Vector IO是一个向量数据集迁移工具,采用通用格式实现多种向量数据库间的数据转换。目前支持Pinecone、Qdrant、Milvus等主流数据库,提供命令行接口进行数据导入导出和重新嵌入。该开源项目正不断扩展兼容的数据库类型,欢迎社区参与贡献。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号