OmniCorpus

百亿级图文交错数据集推动多模态AI研究新高度

OmniCorpus 多模态数据集图像文本交错数据处理管道大规模数据 Github 开源项目

OmniCorpus是一个大规模多模态数据集，包含86亿张图像和1,696亿个文本标记。该数据集提供中英双语内容，涵盖从网站和视频平台提取的文本和视觉文档，具有高度的数据多样性和灵活性。与之前最大的数据集LAION-5B相比，OmniCorpus在图像和文本规模上分别大1.7倍和12.5倍，同时保持了优秀的数据质量。研究表明，基于此数据集训练的模型在图像描述和视觉问答等任务中表现出色。OmniCorpus采用流式数据格式，可适应多种数据结构，包括纯文本语料库、图文对和交错数据格式。这一特性使其在自然语言处理、计算机视觉和多模态AI等领域的研究和应用中具有广泛潜力。

访问官网

Github

介绍相关项目

OmniFusion - 整合多模态数据的先进人工智能系统

GithubOmniFusion图像处理多模态AI模型开源项目深度学习自然语言处理

OmniFusion是一个整合多模态数据的人工智能系统，基于Mistral-7B核心和CLIP-ViT-L视觉编码器。通过创新的适配器机制，该系统能够处理图像等多种数据形式，在图像描述和视觉问答等任务中展现出优秀性能。OmniFusion由AIRI研究所FusionBrain团队与Sber AI合作开发，目前主要处理图像数据，未来计划扩展到音频等更多模态。

MINT-1T - 万亿级开源多模态数据集推动AI研究

GithubMINT-1T图文数据多模态数据集开源数据开源项目海量数据

MINT-1T是一个大规模开源多模态数据集，包含1万亿文本标记和34亿张图像，比现有开源数据集规模扩大约10倍。该数据集首次纳入PDF和ArXiv论文等新数据源，提供HTML、PDF和ArXiv等多个子集。MINT-1T旨在为大规模多模态AI模型研究提供丰富的训练资源，其规模和多样性有望促进多模态AI技术的发展。

OmniGen-v1 - 多模态图像生成模型特点与能力

GithubHuggingfaceOmniGen人工智能图像生成多模态开源项目模型模型优化

OmniGen是一个多模态图像生成模型，支持通过灵活的多模态指令生成多种图像，无需额外插件或操作。安装简便，界面友好，具备从文本生成图像的功能。其设计注重易用性和灵活性，支持用户自定义和微调，满足多样的图像生成需求。

WanJuan1.0 - 开源多模态语料库推动AI模型性能提升

GithubWanJuan上海人工智能实验室图文数据集多模态语料库开源项目文本数据集

WanJuan1.0是一个开源多模态语料库,包含超过5亿文档、22万图文对的文本、图像和视频数据,总量超2TB。涵盖科技、文学等多领域,经过精细处理和价值观对齐。该语料库已应用于Intern系列大模型训练,显著提升了模型在语义理解、知识问答等任务的表现,可有效增强AI模型的知识内容、逻辑推理和泛化能力。

omniparse - 多类型非结构化数据解析与结构化平台

GithubOmniParse多媒体处理开源项目文档解析结构化数据网页爬取

OmniParse是一个专注于非结构化数据处理的开源平台。该平台能够解析文档、表格、图像、视频、音频和网页等多种格式，将其转化为结构化数据，以便于生成式AI应用使用。OmniParse支持约20种文件类型，具备本地处理能力，无需依赖外部API。这使其适用于多种AI应用场景，包括检索增强生成(RAG)和模型微调等。

omnichain - AI语言模型的可视化编程工具

AI语言模型APIGithubLLMOmniChain可视化编程开源项目

OmniChain是一个为AI语言模型设计的可视化编程工具。它提供直观界面，便于构建和管理AI模型链。该工具支持多种LLM后端，提供API和示例，简化AI开发过程。OmniChain适用于开发从基础聊天机器人到复杂AI应用的各类项目。

OmniTokenizer - 联合图像视频标记器实现高效视觉生成

GithubOmniTokenizerVQVAE图像视频联合标记器开源项目视觉生成语言模型

OmniTokenizer是一个图像和视频联合标记器，采用单一模型和权重，提供最先进的重建性能。它具有高分辨率和长视频适应性，可与语言模型和扩散模型结合实现视觉生成。项目提供预训练模型、训练脚本和评估工具，支持VQVAE和VAE版本，为视觉生成研究提供基础设施。

OCR_DataSet - 综合OCR数据集资源库及工具集

Github图像标注开源项目数据集文字识别深度学习计算机视觉

OCR_DataSet项目整合了13个知名的多语言OCR数据集，涵盖ICDAR2015、MLT2019和COCO-Text_v2等。项目特色包括数据格式统一化、便捷的百度网盘下载、详尽的数据集信息表和简化的读取脚本。此外，项目还提供了数据生成工具链接，为OCR领域的研究和开发工作提供了全面的资源支持。

OmniEvent - 多模型事件抽取框架支持多种范式和语言

GithubOmniEvent事件抽取开源项目数据处理模型训练评估方法

OmniEvent是一个开源事件抽取工具包，支持事件检测和事件论元抽取。它覆盖多种范式，如令牌分类、序列标注、机器阅读理解和序列到序列等，在英文和中文数据集上提供统一评估。采用模块化实现，具有可扩展性，支持大型模型训练和推理，易用性高，兼容Transformers库。

nlp_chinese_corpus - 中文自然语言处理高质量多任务语料库

Github中文自然语言处理开源项目数据集词向量语料预训练

该中文自然语言处理项目提供丰富的高质量语料，包括维基百科条目、新闻、百科问答等，目标是解决中文大规模语料匮乏的问题。项目支持10大任务和9个模型的基准测试，并提供一键运行和详细性能比较，旨在提升中文NLP标准。适用于多种实际应用场景，如词向量训练、关键词生成和标题生成，方便研究人员和从业者获取和利用中文语料。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号