#零样本图像分类

Chinese-CLIP入门学习资料-中文版CLIP模型实现图文跨模态检索与表示生成

2024年09月10日

Chinese-CLIP 跨模态检索零样本图像分类图文特征提取模型下载 Github 开源项目

2024年09月10日

Chinese-CLIP:基于大规模中文数据的跨模态预训练模型

2024年08月30日

Chinese-CLIP 跨模态检索零样本图像分类图文特征提取模型下载 Github 开源项目

2024年08月30日

相关项目

Chinese-CLIP

Chinese-CLIP项目，基于大规模中文图文对数据，专门针对中文领域的特点进行优化，提供高效的图文特征计算与相似度测算，实现零样本分类和跨模态检索。该项目改进了多个模型，包括ViT与ResNet结构，并在多个公开数据集上展示了显著的性能提升，为中文处理场景下的企业和研究者提供强大工具。

ViT-B-16-SigLIP

ViT-B-16-SigLIP是一个在WebLI数据集上训练的视觉语言模型，使用Sigmoid损失函数进行预训练。该模型支持对比学习和零样本图像分类任务，可通过OpenCLIP和timm库使用。ViT-B-16-SigLIP在图像-文本对齐和特征提取方面具有良好性能，适用于计算机视觉和自然语言处理的交叉应用研究。

CLIP-ViT-L-14-DataComp.XL-s13B-b90K

CLIP ViT-L/14是一个基于DataComp-1B大规模数据集训练的多模态模型。在ImageNet-1k上达到79.2%的零样本分类准确率，可用于图像分类、检索等任务。该模型主要面向研究社区，旨在促进对零样本和任意图像分类的探索。由stability.ai提供计算资源支持，不建议直接用于部署或商业用途。

CLIP-ViT-bigG-14-laion2B-39B-b160k

CLIP-ViT-bigG-14-laion2B-39B-b160k是基于LAION-2B数据集训练的大规模视觉语言模型。该模型在零样本图像分类、图像文本检索等任务中表现出色，在ImageNet-1k测试中实现80.1%的零样本top-1准确率。模型采用ViT-bigG/14架构，由stability.ai提供计算资源支持。虽然适合研究人员探索零样本分类和跨模态学习，但目前不建议直接应用于商业场景。

CLIP-convnext_base_w-laion2B-s13B-b82K-augreg

该项目提供了一系列基于ConvNeXt-Base架构的CLIP模型，在LAION-5B数据集子集上训练。这些模型作为ViT和ResNet的替代方案，在模型规模和图像分辨率方面展现出良好的可扩展性。经过13B样本训练，模型在ImageNet零样本分类任务中达到70.8%以上的top-1准确率，体现出较高的样本效率。这些模型可应用于零样本图像分类、图像文本检索等多种任务。

ViT-SO400M-14-SigLIP-384

ViT-SO400M-14-SigLIP-384是一个在WebLI数据集上训练的大规模视觉-语言预训练模型。该模型采用SigLIP（Sigmoid Loss for Language-Image Pre-training）技术，适用于对比学习和零样本图像分类任务。模型提供了与OpenCLIP和timm库的兼容性，支持图像和文本编码。研究人员可将其应用于图像分类、检索等多种视觉-语言任务中。

metaclip-b32-400m

MetaCLIP-b32-400m是基于CommonCrawl数据集训练的视觉语言模型，旨在解析CLIP的数据准备方法。该模型构建了图像和文本的共享嵌入空间，支持零样本图像分类和基于文本的图像检索等功能。研究人员可通过此模型探究CLIP的数据处理流程，加深对视觉语言模型训练过程的理解。

CLIP-convnext_base_w-laion2B-s13B-b82K

这是一系列基于LAION-5B数据集训练的CLIP ConvNeXt-Base模型。经过13B样本训练后，模型在ImageNet零样本分类中实现了70.8%以上的Top-1准确率，显示出比ViT-B/16更高的样本效率。模型使用timm的ConvNeXt-Base作为图像塔，并探索了增强图像增强和正则化的效果。作为首个在CLIP ViT-B/16和RN50x4规模下训练的ConvNeXt CLIP模型，它为零样本图像分类研究提供了新的选择。

CLIP-convnext_xxlarge-laion2B-s34B-b82K-augreg-soup

CLIP ConvNeXt-XXLarge是基于LAION-2B数据集训练的大规模视觉-语言模型。它在ImageNet零样本分类任务中实现79.4%的准确率,成为首个非ViT架构突破79%的CLIP模型。该模型结合847M参数的ConvNeXt-XXLarge图像塔和ViT-H-14规模的文本塔,在计算效率和性能间达到平衡,为视觉-语言模型研究开辟新方向。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com