CrossFormer

融合跨尺度注意力的高效视觉Transformer

CrossFormer++视觉Transformer 跨尺度注意力图像分类目标检测 Github 开源项目

CrossFormer++是一种创新的视觉Transformer模型，通过跨尺度注意力机制解决了不同尺度对象特征间建立关联的问题。该模型引入跨尺度嵌入层和长短距离注意力等设计，并采用渐进式分组策略和激活冷却层来平衡性能与计算效率。在图像分类、目标检测和语义分割等视觉任务中表现优异，尤其在密集预测任务中效果显著。CrossFormer++为计算机视觉领域提供了一种灵活高效的新型架构。

Github

Huggingface

介绍相关项目

timesformer-base-finetuned-k600 - 采用空间时间注意力的视频分类技术，提升视频理解能力

GithubHuggingfaceKinetics-600TimeSformer开源项目模型深度学习空间时间注意力视频分类

TimeSformer模型运用空间时间注意力机制进行视频分类，能够识别Kinetics-600中的600种标签。该工具旨在提升视频理解的准确性，提供简便的视觉分析能力。

vision-perceiver-conv - Perceiver IO模型：灵活应用于图像分类的优化架构

GithubHuggingfaceImageNetPerceiver IO图像分类开源项目模型模型预训练自注意力机制

Perceiver IO是一个适用于多种模态的transformer编码器模型，通过自注意力机制在固定的计算资源下实现更高效的处理。该模型在ImageNet上进行了预训练，能够通过像素级处理进行准确的图像分类。模型结合了卷积和maxpool预处理，可以生成多尺寸和多语义的输出结果，并在ImageNet-1k中实现了82.1的顶级精度。这一模型不仅可用于高效的标准图像分类，还能通过替换分类解码器实现灵活的应用扩展，适用于多种任务的特征提取。

PersFormer_3DLane - PersFormer基于透视变换实现精确的3D车道线检测

3D车道线检测GithubOpenLane基准PersFormerPyTorch实现开源项目透视变换

PersFormer是一种创新的3D车道线检测模型，采用基于Transformer的模块生成BEV特征并参考相机参数。模型能同时进行2D和3D车道检测，提升特征一致性与多任务学习效果。PersFormer在OpenLane和Apollo 3D Lane Synthetic数据集上的表现优异，超越了多种现有方法，并提供简便的安装与评估说明以及详细的训练和测试指南，成为3D车道检测领域的重要进展。

MambaVision-S-1K - MambaVision融合Mamba与Transformer的计算机视觉新型架构

GithubHuggingfaceMambaVision图像分类开源项目模型深度学习模型特征提取计算机视觉

MambaVision-S-1K是一种新型计算机视觉模型,首次融合了Mamba和Transformer的设计理念。研究者通过改进Mamba结构增强了其视觉特征建模能力,并验证了与Vision Transformer的有效集成。在ImageNet-1K基准测试中,该模型在准确率和效率方面取得了平衡。MambaVision可用于图像分类和特征提取任务,提供了简洁的调用接口。这一创新架构为计算机视觉领域带来了新的研究思路和应用前景。

segformer-b5-finetuned-cityscapes-1024-1024 - SegFormer-b5模型在CityScapes数据集上微调的语义分割应用

GithubHuggingfaceSegFormerTransformer图像处理开源项目模型深度学习语义分割

SegFormer-b5是一个在CityScapes数据集上微调的语义分割模型。它结合层次化Transformer编码器和轻量级MLP解码头，在1024x1024分辨率下展现优秀性能。该模型经ImageNet-1k预训练后，通过添加解码头并在特定数据集微调，可应用于自动驾驶场景理解等多种语义分割任务。

swinv2-tiny-patch4-window16-256 - Swin Transformer v2：分层特征图构建的高效视觉模型

GithubHuggingfaceSwin Transformer v2图像分类开源项目模型深度学习神经网络计算机视觉

Swin Transformer v2是一种改进的视觉模型，通过合并图像块构建分层特征图，适用于图像分类和密集识别任务。它采用局部窗口自注意力机制，实现了线性计算复杂度。模型引入残差后归一化、余弦注意力和对数间隔连续位置偏置等技术，提升训练稳定性和迁移能力。同时，利用SimMIM自监督预训练方法减少了对大量标记图像的依赖。

SOFT - 无需softmax的线性复杂度Transformer模型

GithubTransformer图像分类开源项目目标检测线性复杂度自注意力机制

SOFT是一种新型Transformer模型,采用无需softmax的归一化自注意力机制,实现了线性复杂度和更强的泛化能力。该模型在图像分类、目标检测和语义分割等计算机视觉任务中表现优异。项目提供多种规模的预训练模型,适用于不同应用场景。开源代码包含完整的训练和评估流程,并附有详细说明,便于研究人员进行深入研究和应用开发。

other - 高性能开源自然语言处理框架

GithubHuggingfacetransformers人工智能开源项目机器学习模型深度学习自然语言处理

Transformers是一个开源的自然语言处理框架，提供多种预训练模型和工具。支持文本分类、问答和生成等任务，适用于研究和生产环境。该框架易用且灵活，可处理多语言文本，支持迁移学习。Transformers定期更新，紧跟NLP领域最新进展，为用户提供丰富的API和优化的性能。

EEG-Conformer - 结合卷积和自注意力的EEG解码与可视化工具

EEG ConformerEEG解码Github卷积神经网络大脑波形投影开源项目自注意力机制

EEG Conformer是一种结合卷积和自注意力机制的EEG分类与可视化工具。其卷积模块提取时间和空间上的局部特征，自注意力模块捕捉全局关联，最终通过全连接层进行分类预测。此外，EEG Conformer还具备将类激活映射到脑拓扑图的可视化功能。支持Python 3.10和Pytorch 1.12，在多个BCI竞赛数据集上表现出色。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号