MIMDet

掩码图像建模应用于目标检测的开源项目

MIMDet 物体检测视觉变换器实例分割卷积神经网络 Github 开源项目

MIMDet是一个利用掩码图像建模技术的开源项目，能够提升预训练的Vanilla Vision Transformer在目标检测中的表现。此框架采用混合架构，用随机初始化的卷积体系取代预训练的大核Patchify体系，实现多尺度表示无需上采样。在COCO数据集上的表现亮眼，使用ViT-Base和Mask R-CNN模型时，分别达到51.7的框AP和46.2的掩码AP；使用ViT-L模型时，成绩分别是54.3的框AP和48.2的掩码AP。

访问官网

Github

介绍相关项目

detrex - 开源Transformer检测算法工具箱

Detectron2GithubPytorchTransformerdetrexobject detection开源项目

detrex是一个开源工具箱，专为最先进的Transformer检测算法提供支持。该工具箱基于Detectron2构建，并参考了MMDetection和DETR的模块设计。detrex模块化设计，提供强大基线，通过优化超参数将模型性能提升至0.2至1.1AP。该工具箱轻量易用，支持最新算法如Focus-DETR、SQR-DETR、Align-DETR、EVA-01和EVA-02，帮助用户构建定制模型。

owlvit-large-patch14 - 基于Vision Transformer的零样本目标检测模型

GithubHuggingfaceOWL-ViT多模态模型开源项目模型物体检测视觉变换器零样本学习

OWL-ViT模型采用CLIP和Vision Transformer架构，实现了零样本文本条件目标检测。它可以根据文本查询识别图像中的物体，无需预先定义类别。该模型在大规模图像-文本数据集上进行训练，并在COCO和OpenImages等数据集上微调。OWL-ViT为计算机视觉研究提供了新的可能性，尤其在零样本目标检测领域。

fastvit_ma36.apple_in1k - Apple开源的高性能混合视觉Transformer图像处理模型

FastViTGithubHuggingface图像分类开源项目机器学习模型神经网络计算机视觉

FastViT是Apple开源的混合视觉Transformer模型，基于结构重参数化技术构建。模型在ImageNet-1k数据集训练，参数量4410万，支持256x256图像输入。主要功能包括图像分类、特征图提取和图像嵌入表示。通过混合架构设计，在保证准确率的基础上优化了计算效率。

vit-base-patch32-384 - Vision Transformer图像分类模型支持大规模数据训练

GithubHuggingfaceImageNetVision Transformer图像分类开源项目模型深度学习计算机视觉

Vision Transformer（ViT）是一款图像分类模型，采用Transformer编码器架构，通过将图像分割为固定大小patch进行处理。模型在包含1400万张图像的ImageNet-21k数据集完成预训练，并在ImageNet-1k数据集上进行384x384分辨率的微调。提供预训练权重，可直接应用于图像分类或迁移学习任务。

Vim - 基于双向状态空间模型的高效视觉表示学习

GithubVision Mamba图像分类开源项目深度学习状态空间模型视觉表示学习

Vision Mamba是一种基于双向Mamba块的新型视觉主干网络。该模型通过位置嵌入和双向状态空间模型处理图像序列，在ImageNet分类、COCO目标检测和ADE20k语义分割等任务上表现优异。与DeiT等视觉Transformer相比，Vision Mamba不仅性能更高，还大幅提升了计算和内存效率。其在高分辨率图像特征提取方面的出色表现，使其有潜力成为新一代视觉基础模型的核心架构。

efficientvit - EfficientViT多尺度线性注意力用于高分辨率密集预测

EfficientViTGithub图像分割开源项目模型优化深度学习计算机视觉

EfficientViT是一种新型ViT模型，专注于高效处理高分辨率密集预测视觉任务。其核心是轻量级多尺度线性注意力模块，通过硬件友好操作实现全局感受野和多尺度学习。该项目提供图像分类、语义分割和SAM等应用的预训练模型，在性能和效率间达到平衡，适合GPU部署和TensorRT优化。

CoDet - 共现引导的开放词汇目标检测方法

CoDetGithub图像文本对齐开放词汇开源项目深度学习目标检测

CoDet是一种开放词汇目标检测方法，采用共现引导来对齐区域和词语。该方法利用大规模图像-文本对训练，在LVIS和COCO数据集上表现优异。CoDet兼容现代视觉基础模型，并可与Roboflow集成实现自动图像标注。这一方法为开放词汇目标检测领域提供了新的解决方案。

ml-cvnets - 灵活的计算机视觉模型训练库

CVNetsGithub图像分类对象检测开源项目模型训练计算机视觉

CVNets是一个计算机视觉库，支持研究人员和工程师训练和评估多种计算机视觉模型，包括对象分类、对象检测和语义分割等任务。最新版本引入了直接处理文件字节的Transformer和高效在线增强，支持如Mask R-CNN、EfficientNet、Swin Transformer和ViT等模型，并增强了蒸馏功能。

vitmatte-base-composition-1k - Vision Transformer驱动的图像抠图模型

GithubHuggingfaceViTMatte图像抠图开源项目模型深度学习视觉transformer计算机视觉

ViTMatte-base-composition-1k是一个基于Vision Transformer的图像抠图模型，在Composition-1k数据集上训练。该模型采用ViT结构和轻量级头部，能准确估计图像前景对象。ViTMatte在图像抠图任务中表现优异，为图像前景提取提供了高效解决方案。

MambaVision-T-1K - 提高视觉模型长距离空间依赖的处理能力

GithubHuggingfaceMambaVision变换器图像分类开源项目模型特征提取计算机视觉

MambaVision是一个混合视觉模型，将Mamba与Transformer的优点结合，重新设计后的Mamba通过引入自注意力机制有效捕获长距离空间依赖。该模型在Top-1准确率和吞吐量上表现突出，创造了新的性能标准。用户可以通过简单的安装和代码导入来使用其图像分类和特征提取功能，满足多样化的应用需求，同时提供阶段性和平均池化特征输出。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号