Project Icon

MixFormer

基于迭代混合注意力的端到端目标跟踪框架

MixFormer是一种创新的端到端目标跟踪框架,采用目标-搜索混合注意力(MAM)骨干网络和角点头部结构,实现了无需显式集成模块的紧凑跟踪流程。这种无后处理方法在LaSOT、GOT-10K和TrackingNet等多个基准测试中表现卓越,并在VOT2020上取得0.584的EAO成绩。项目开源了代码、模型和原始结果,为目标跟踪研究领域提供了宝贵资源。

mask2former-swin-large-ade-panoptic - 通用图像分割模型,提升性能和效率
ADE20kGithubHuggingfaceMask2FormerMaskFormer分割开源项目模型视觉
Mask2Former利用多尺度可变形注意力Transformer,提高图像分割性能与效率。其掩蔽注意力解码器在不增加计算负担的情况下提升表现,适用于实例、语义和全景分割。基于ADE20k全景分割数据集的训练研究,提供优化的分割方案。
poolformer - 视觉任务中MetaFormer架构的应用及其效能
CVPR 2022GithubMetaFormerPoolFormerTransformer图像分类开源项目
该项目展示了MetaFormer架构在视觉任务中的应用,特别通过简单的池化操作实现token混合。研究证实,基于这种方法的PoolFormer模型在ImageNet-1K验证集上表现优于DeiT和ResMLP。此外,后续工作介绍了IdentityFormer、RandFormer等MetaFormer基线模型。本项目证明了Transformer模型的竞争力主要来源于其通用架构MetaFormer,而非特定的token混合器。
SparseTrack - 多目标跟踪新方法:基于伪深度的场景分解技术
GithubSparseTrack伪深度场景分解多目标跟踪开源项目数据关联
SparseTrack提出了一种新的多目标跟踪方法,通过伪深度估计和深度级联匹配策略来分解密集场景。这种方法在MOT17和MOT20基准测试中表现出色,仅使用IoU匹配就达到了与复杂算法相当的性能。SparseTrack为解决拥挤场景中的多目标跟踪问题提供了新的思路,展示了简单方法在复杂任务中的潜力。
VoxFormer - 基于稀疏体素变换器的相机驱动3D语义场景补全方法
3D语义场景补全CVPRGithubVoxFormer开源项目计算机视觉语义分割
VoxFormer是一种基于Transformer的创新框架,仅通过2D图像即可生成完整的3D语义体素。它采用两阶段设计:先从深度估计生成可见占据体素查询,再通过密集化阶段生成完整3D体素。在SemanticKITTI数据集上,VoxFormer在几何和语义方面分别提升了20.0%和18.1%,同时将训练所需GPU内存减少约45%。这为相机驱动的3D语义场景补全任务提供了一个强有力的基线。
pytracking - 基于PyTorch的开源视觉目标跟踪和视频对象分割框架
GithubPyTorch开源项目深度学习视觉目标跟踪视频目标分割计算机视觉
PyTracking是基于PyTorch的开源视觉目标跟踪和视频对象分割框架。它实现了多个先进的跟踪算法,如TaMOs、RTS和ToMP,并提供完整的训练代码和预训练模型。该框架包含用于实现和评估视觉跟踪器的库,涵盖常用数据集、性能分析脚本和通用构建模块。其LTR训练框架支持多种跟踪网络的训练,提供丰富的数据集和功能。
multi-object-tracker - 利用Python实现多对象跟踪,兼容多种检测器
CentroidTrackerGithubOpenCVTF-MobileNetSSDYOLOv3multi-object tracker开源项目
该项目提供多种基于Python的多对象跟踪算法,包括CentroidTracker、IOUTracker、CentroidKF_Tracker和SORT,支持TF_SSDMobileNetV2、Caffe_SSDMobileNet和YOLOv3等OpenCV对象检测器。安装简便,使用友好,支持GPU加速,适用于视频数据解析和对象追踪。参考项目示例可快速上手,实现精准多对象跟踪。
BEVFormer - 多摄像头鸟瞰图学习框架助力自动驾驶感知
BEVFormerGithub多相机感知开源项目目标检测自动驾驶鸟瞰图表示
BEVFormer是一个用于自动驾驶感知的开源框架,通过时空Transformer从多摄像头图像中学习统一的鸟瞰图表示。该方法利用预定义的网格查询,结合空间交叉注意力和时间自注意力机制,有效聚合多视角的空间和时序信息。在nuScenes测试集上,BEVFormer达到56.9%的NDS指标,显著超越现有方法,与激光雷达系统性能相当。这一创新为基于纯视觉的3D目标检测提供了新的基准。
mask2former-swin-base-coco-panoptic - 多任务图像分割的先进模型
GithubHuggingfaceMask2Former图像分割开源项目模型深度学习计算机视觉语义分割
Mask2Former-swin-base-coco-panoptic是一个基于COCO全景分割数据集训练的先进图像分割模型。它采用统一方法处理实例、语义和全景分割任务,通过预测掩码集合和对应标签实现多任务分割。该模型引入多尺度可变形注意力Transformer和masked attention等技术,在性能和效率上超越前代方法。Mask2Former为计算机视觉领域提供了versatile的图像分割解决方案,适用于多种分割场景。
mask2former-swin-tiny-coco-instance - Mask2Former模型:统一处理实例、语义和全景图像分割
GithubHuggingfaceMask2Former图像分割实例分割开源项目模型深度学习计算机视觉
Mask2Former是一个先进的图像分割模型,基于Swin骨干网络在COCO数据集上训练。它采用统一的方法处理实例、语义和全景分割任务,通过预测掩码和标签来完成分割。该模型引入多尺度可变形注意力Transformer和掩码注意力Transformer解码器,在性能和效率上超越了先前的MaskFormer模型。Mask2Former提供了简单的使用方法和代码示例,方便研究人员和开发者在图像分割领域进行应用和研究。
mask2former-swin-large-mapillary-vistas-panoptic - Mask2Former:集实例、语义和全景分割于一体的图像分割模型
GithubHuggingfaceMask2Former图像分割开源项目模型深度学习计算机视觉语义分割
Mask2Former是一个基于Swin主干网络的高级图像分割模型,在Mapillary Vistas数据集上训练用于全景分割。它通过预测掩码和标签集合,统一处理实例、语义和全景分割任务。该模型采用改进的Transformer架构和高效训练策略,性能和效率均优于先前的MaskFormer。Mask2Former为各类图像分割应用提供了强大支持,推动了计算机视觉技术的进步。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号