clip-rsicd-v2

专为遥感图像优化的零样本分类和检索模型

Transformer Huggingface 模型遥感图像 Github 开源项目图像检索 CLIP 零样本分类

clip-rsicd-v2是一个基于CLIP的微调模型，专注于提升遥感图像的零样本分类和检索能力。该模型采用ViT-B/32架构和掩码自注意力Transformer分别作为图像和文本编码器。通过在RSICD、UCM和Sydney等遥感数据集上训练，clip-rsicd-v2在多项检索任务中显著超越原始CLIP模型。研究人员可利用此模型深入探究计算机视觉模型的鲁棒性和泛化能力。

Github

Huggingface

介绍相关项目

vit_large_patch14_clip_336.openai - 通过CLIP模型探索计算机视觉鲁棒性

CLIPGithubHuggingfaceOpenAI偏见开源项目数据集模型计算机视觉

OpenAI开发的CLIP模型通过ViT-L/14 (336x336)架构提高视觉任务的鲁棒性，专注于零样本图像分类，供研究人员深入探索。这个模型针对英语场景，其数据主要源自发达国家的互联网用户，目前不建议用于商用部署，但在学术界具备多学科研究的重要价值。

ViT-B-32__openai - CLIP模型的ONNX导出版本用于图像和文本嵌入生成

CLIPGithubHuggingfaceImmich图像编码器开源项目文本编码器模型自托管照片库

ViT-B-32__openai项目是CLIP模型的ONNX导出版本，将视觉和文本编码器分离为独立模型。这种设计适用于生成图像和文本嵌入，特别针对Immich自托管照片库。该项目可用于处理大量图像和文本数据，有助于改进图像检索和跨模态搜索功能。

ViT-L-16-SigLIP-256 - 用于零样本图像分类的对比式图像文本模型

GithubHuggingfaceSigLIPWebLI对比学习开源项目模型语言图像预训练零样本图像分类

模型以WebLI数据集进行训练，兼容OpenCLIP与timm库，支持图像与文本的任务。通过SigLIP方法增强语言与图像的预训练能力，实现零样本图像分类。该模型由JAX格式转为PyTorch，更易集成至现有机器学习流程，具备多平台适应性。

fashion-clip - 专为时尚领域优化的对比语言视觉学习模型

CLIPFashionCLIPGithubHugging Face开源项目时尚行业模型

FashionCLIP是一个为时尚行业优化的CLIP模型，用于提升商品检索、分类和时尚分析的表现。通过超过70万对图像和文本数据进行微调，FashionCLIP在零样本场景下表现出色。更新版FashionCLIP 2.0采用更多训练数据，显著提高了FMNIST、KAGL和DEEP数据集的性能。项目提供开源代码和模型权重，可在Hugging Face上获取，并支持多种API和教程便于上手。

siglip-so400m-patch14-224 - 增强图像文本任务的性能，探索形状优化模型

GithubHuggingfaceSigLIPWebLI对比学习开源项目模型视觉零样本图像分类

SigLIP通过sigmoid损失函数优化了CLIP模型的图像和文本匹配性能。此模型在WebLi数据集上预训练，可实现更大的批量训练，同时在小批量下表现出色。适用于零样本图像分类和图像文本检索任务，能在不同环境下获得高效结果。该模型在16个TPU-v4芯片上训练三天，而图像预处理中使用标准化和归一化，提升了计算效率。

CLIP-convnext_base_w-laion_aesthetic-s13B-b82K - LAION-5B训练的ConvNeXt-Base CLIP模型

CLIPConvNextGithubHuggingface图像分类开源项目数据集机器学习模型

ConvNeXt-Base架构的CLIP模型在LAION-5B子集上完成训练，支持256x256和320x320两种图像分辨率。在ImageNet零样本分类评测中取得70.8%-71.7%的top-1准确率，样本效率超过同规模ViT-B/16模型。该模型主要用于研究领域，可执行零样本图像分类和图文检索等任务。

clipseg-rd64-refined - 基于文本和图像提示的先进图像分割策略

CLIPSegGithubHuggingface一样本学习图像分割复杂卷积开源项目模型零样本学习

该模型引入先进的复杂卷积技术，支持零样本和单样本图像分割。结合文本与图像提示，该模型在图像分析中提供高效且准确的分割性能。

OpenAI-CLIP - 从零开始实现CLIP模型：探索文本与图像的多模态关联

CLIPGithubOpenAI图像编码器多模态开源项目文本编码器

本项目实现了CLIP模型，基于PyTorch进行开发，通过训练文本和图像数据，探索其相互关系。详细的代码指南和实用工具展示了模型在自然语言监督任务中的表现和实际应用，适合多模态学习的研究者和开发者使用。

CLIP-ReID - 基于CLIP的无标签图像重识别新方法

CLIP-ReIDGithub人工智能图像重识别开源项目视觉语言模型计算机视觉

CLIP-ReID提出了一种无需具体文本标签的图像重识别新方法。该方法基于CLIP视觉-语言模型,结合CNN和ViT架构,并运用SIE和OLP等技术进行优化。在MSMT17等多个基准数据集上,CLIP-ReID展现了领先的性能,为图像重识别领域开辟了新的研究方向。

TinyCLIP-ViT-40M-32-Text-19M-LAION400M - 基于亲和力模仿和权重继承的CLIP模型压缩方法

GithubHuggingfaceLAION400MTinyCLIP图像识别开源项目模型模型压缩深度学习

TinyCLIP是一种用于压缩大规模语言-图像预训练模型的跨模态蒸馏方法，采用亲和力模仿和权重继承技术。实验显示，TinyCLIP ViT-45M/32使用ViT-B/32一半的参数达到相似的零样本性能；TinyCLIP ResNet-19M在参数量减少50%的情况下，推理速度提升2倍，在ImageNet数据集上实现56.4%的准确率。

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号