RepViT

移动设备上的高效实时视觉模型

RepViT-SAM SAM模型实时分割移动设备轻量级CNN Github 开源项目

RepViT是一个轻量级CNN模型家族,整合了Vision Transformer的架构设计,在移动设备上实现了80%以上的ImageNet准确率,延迟仅1毫秒。RepViT-SAM将RepViT应用于SAM模型,显著降低了计算需求,实现了移动设备上的实时任意目标分割。这两个模型在图像分类、目标检测和语义分割等视觉任务中均表现出色,兼具高性能和高效率。

Github

介绍相关项目

LITv2 - 基于HiLo注意力的快速视觉Transformer

GithubHiLo注意力LITv2图像分类开源项目目标检测视觉Transformer

LITv2是一种基于HiLo注意力机制的高效视觉Transformer模型。它将注意力头分为两组,分别处理高频局部细节和低频全局结构,从而在多种模型规模下实现了优于现有方法的性能和更快的速度。该项目开源了图像分类、目标检测和语义分割任务的预训练模型和代码实现。

Grounded-SAM-2 - 多模态视频目标检测与分割框架

GithubGrounding DINOSAM 2图像分割开源项目目标检测视频追踪

Grounded-SAM-2是一个开源项目，结合Grounding DINO和SAM 2技术，实现图像和视频中的目标检测、分割和跟踪。该项目支持自定义视频输入和多种提示类型，适用于广泛的视觉任务。通过简化代码实现和提供详细文档，Grounded-SAM-2提高了易用性。项目展示了开放世界模型在处理复杂视觉任务中的潜力，为研究人员和开发者提供了强大的工具。

clip-vision-model-tiny - 轻量级AI图像处理与分析视觉模型

GithubHuggingfaceMIT协议代码许可开源协议开源项目模型许可证软件授权

基于MIT许可证开发的轻量级图像视觉模型，采用紧凑架构设计，具备高效的图像处理和分析能力。该开源项目适用于快速部署场景，可在资源受限环境中保持准确的图像识别表现。

MIMDet - 掩码图像建模应用于目标检测的开源项目

GithubMIMDet卷积神经网络实例分割开源项目物体检测视觉变换器

MIMDet是一个利用掩码图像建模技术的开源项目，能够提升预训练的Vanilla Vision Transformer在目标检测中的表现。此框架采用混合架构，用随机初始化的卷积体系取代预训练的大核Patchify体系，实现多尺度表示无需上采样。在COCO数据集上的表现亮眼，使用ViT-Base和Mask R-CNN模型时，分别达到51.7的框AP和46.2的掩码AP；使用ViT-L模型时，成绩分别是54.3的框AP和48.2的掩码AP。

vit-base-patch16-384 - Vision Transformer：基于图像分块的高效视觉识别模型

GithubHuggingfaceImageNetVision Transformer图像分类开源项目模型深度学习计算机视觉

Vision Transformer (ViT) 是一种基于Transformer架构的视觉识别模型，在ImageNet-21k上进行预训练，并在ImageNet 2012上微调。模型采用图像分块和序列化处理方法，有效处理384x384分辨率的图像。ViT在多个图像分类基准测试中表现优异，适用于各种计算机视觉任务。该预训练模型为研究人员和开发者提供了快速开发高精度图像识别应用的基础。

SAM-Adapter-PyTorch - 提升复杂场景下图像分割效果的开源项目

GithubICCVPyTorchPythonSAM-AdapterSegment Anything开源项目

SAM-Adapter项目提升了SAM在伪装、阴影和医疗图像分割中的表现。最新的更新支持更强大的SAM2骨干网络，并提供多种预训练模型和数据集下载链接，便于快速上手。该项目在IEEE/CVF国际计算机视觉会议上展示，并包含详细的环境配置和训练指南，方便研究人员进行深度学习任务。

LViT - 结合语言和视觉Transformer的医学图像分割技术

GithubLViTVision Transformer医学图像分割开源项目数据集深度学习

LViT是一种创新的医学图像分割方法，融合了语言信息和视觉Transformer。该技术在QaTa-COV19、MosMedData+和MoNuSeg等多个数据集上展现出优异性能，大幅提升了分割精度。项目包含完整代码实现、数据准备指南、训练评估流程及详细实验结果。除常规任务外，LViT在结肠息肉和食管CT等特定领域分割中也表现出色。

vit_small_patch14_reg4_dinov2.lvd142m - 基于自监督学习的视觉Transformer用于图像特征提取和分类

GithubHuggingfaceVision Transformer图像分类图像特征开源项目模型深度学习自监督学习

该Vision Transformer (ViT) 图像特征模型通过自监督学习进行预训练，基于LVD-142M数据集并采用DINOv2方法。模型专为图像分类和特征提取设计，包含22.1M参数和29.6 GMAC的运算能力。其注册方法增强了处理518x518像素图像的效果，DINOv2技术有助于无监督视觉特征学习。此模型在图像嵌入应用中表现优异，并支持多种视觉分析与研究。用户可使用timm库简单调用和部署模型，适合多种机器学习场景。

sam-hq - 升级版零样本图像分割模型

GithubHQ-SAMSAMprompt分割开源项目零样本分割高质量分割

SAM-HQ是对原始SAM模型的改进版本，专注于提高零样本图像分割的质量。该模型保留了SAM的灵活提示和泛化能力，同时通过引入可学习的高质量输出标记和特征融合策略，显著提升了分割效果，特别是对于复杂结构的物体。SAM-HQ仅增加少量参数就实现了性能的大幅提升。在9个不同领域的数据集测试中，SAM-HQ在各类下游任务中均表现优于原始SAM模型。

RevCol - 多任务计算机视觉的新型架构

GithubRevCol图像分类开源项目目标检测计算机视觉语义分割

RevCol是一种新型神经网络架构，采用多个子网络（列）通过多层可逆连接组成。作为基础模型骨干，RevCol适用于图像分类、目标检测和语义分割等计算机视觉任务。该架构在ImageNet等基准测试中表现优异，项目提供了训练和评估代码，以及多个数据集上的预训练模型权重，方便研究人员进行进一步探索。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号