OCR_DataSet

综合OCR数据集资源库及工具集

文字识别数据集图像标注深度学习计算机视觉 Github 开源项目

OCR_DataSet项目整合了13个知名的多语言OCR数据集，涵盖ICDAR2015、MLT2019和COCO-Text_v2等。项目特色包括数据格式统一化、便捷的百度网盘下载、详尽的数据集信息表和简化的读取脚本。此外，项目还提供了数据生成工具链接，为OCR领域的研究和开发工作提供了全面的资源支持。

访问官网

Github

介绍相关项目

LaTeX_OCR_PRO - 基于深度学习的多语言数学公式识别系统

AttentionGithubLaTeX_OCR_PROSeq2Seq开源项目数学公式识别机器学习

LaTeX_OCR_PRO是一个开源的数学公式识别项目，结合Seq2Seq、Attention和Beam Search技术，实现了对标准、中文及手写数学公式的高精度识别。项目提供完整的环境配置、数据处理、模型训练和评估流程，在多项性能指标上达到业界领先水平。此外，LaTeX_OCR_PRO还支持训练过程和注意力机制的可视化，为相关研究和应用开发提供了有力支持。

meta-dataset - 多样化小样本学习基准与算法实现

CrossTransformersFLUTEGithubMeta-DatasetNeurIPS 2021TFDS API开源项目

本项目介绍了基于TensorFlow Datasets的Meta-Dataset输入管道，兼容原始协议（MD-v1）和更新的VTAB+MD协议（MD-v2），并提供相关研究的代码和检查点，详细说明数据管道、模型及实验设置。大量实验揭示了一些重要的研究挑战，并提出了新的基准方法来量化Meta-Dataset中的元学习优势，希望能激励更多相关研究方向的工作。

open-speech-corpora - 开放语料库整理助力语音技术研究与发展

CC-0许可Common VoiceGithub多语言开放语音语料库开源项目语音技术

open-speech-corpora项目为语音技术研究和开发提供了一个丰富的开放语料库清单。这些语料库多为免费并在创意共享许可证或社区数据许可协议下发布，方便研究和商业使用。它覆盖多种语言和超过2万小时的验证语音数据，是学者和开发者理想的数据资源。项目鼓励社区成员提出资源增补，以进一步完善数据库。

easyportrait - 人像分割和面部解析大规模数据集

EasyPortraitGithub人像分割人工智能开源项目数据集面部解析

EasyPortrait是一个包含40,000张高质量标注RGB图像的数据集，用于人像分割和面部解析研究。数据集提供9个类别的标注，涵盖背景、人物、皮肤、眉毛、眼睛等。它可应用于视频会议背景移除、面部美化等多个场景。数据集基于用户ID划分训练、验证和测试集，并提供多个基线模型的预训练权重，为计算机视觉研究提供了有价值的资源。

dataspeech - 简化语音数据集标注与处理的实用工具

Data-SpeechGithub开源项目数据标注语音AI语音数据集音频转换

Data-Speech是一套用于语音数据集标注的实用脚本工具。它提供简洁代码库，支持音频转换和注释，有助于语音AI模型开发。该工具能重现研究论文中的注释方法，使用自然语言描述标注说话者特征。Data-Speech可处理LibriTTS-R和MLS等数据集，并为Parler-TTS库提供支持。它提供从数据集注释、特征映射到自然语言描述生成的完整工作流程。

imageinwords - 致力于生成超详细图像描述的研究项目

GithubImageInWords图像描述开源项目数据集机器学习计算机视觉

ImageInWords 是一个致力于生成超详细图像描述的研究项目。该项目提供基准评估数据集，可通过 Hugging Face 访问。它集成了计算机视觉和自然语言处理技术，为研究人员和开发者提供数据集、可视化工具和探索接口。这项研究旨在推进图像理解和描述生成领域的发展。

AzurePublicDataset - Azure云平台多样化工作负载数据集

AzureGithubMicrosoft函数计算大语言模型开源项目虚拟机

AzurePublicDataset项目提供Azure云平台多种工作负载数据集,涵盖虚拟机、Azure Functions和LLM推理等领域。这些数据集反映了不同时期Azure服务的使用情况,为云计算资源管理和优化研究提供了宝贵素材。项目还包含相关论文链接和使用指南,有助于深入理解和分析云计算平台的运行特征。

zotero-ocr - Zotero OCR插件实现PDF文献自动文本识别

GithubOCRPDFTesseractZotero开源项目插件

Zotero OCR是一个开源的Zotero插件，为PDF文献提供OCR文字识别功能。该插件可为选定PDF添加识别文本，生成新的文本化PDF，或创建纯文本笔记和HTML文件。基于Tesseract OCR引擎，支持多语言识别，并提供自定义配置选项。插件安装简便，有助于提升文献管理效率。

hagrid - 大规模手势识别图像数据集助力人机交互系统开发

GithubHaGRID图像数据集开源项目手势识别机器学习计算机视觉

HaGRID是一个包含554,800张全高清RGB图像的手势识别数据集，涵盖18种手势类别。数据集由37,583名受试者在多种光照条件下采集，适用于图像分类和目标检测任务。HaGRID可用于开发视频会议、家庭自动化和汽车领域的手势识别系统，推动人机交互技术进步。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号