VoxFormer

基于稀疏体素变换器的相机驱动3D语义场景补全方法

VoxFormer 3D语义场景补全计算机视觉 CVPR 语义分割 Github 开源项目

VoxFormer是一种基于Transformer的创新框架，仅通过2D图像即可生成完整的3D语义体素。它采用两阶段设计：先从深度估计生成可见占据体素查询，再通过密集化阶段生成完整3D体素。在SemanticKITTI数据集上，VoxFormer在几何和语义方面分别提升了20.0%和18.1%，同时将训练所需GPU内存减少约45%。这为相机驱动的3D语义场景补全任务提供了一个强有力的基线。

Github

介绍相关项目

segformer-b2-finetuned-ade-512-512 - SegFormer模型实现高效语义分割的新方法

GithubHugging FaceHuggingfaceSegFormerTransformer图像分割开源项目模型视觉

SegFormer模型在ADE20K数据集上微调，支持512x512分辨率图像的语义分割，由层次Transformer编码器和轻量级MLP解码头构成，适用于ADE20K和Cityscapes等基准。模型先在ImageNet-1k上预训练，再在下游任务上微调，适合多种分割任务。

mit-b2 - 高效语义分割的简单Transformer设计

GithubHuggingfaceSegFormerTransformer图像分类开源项目机器学习模型语义分割

SegFormer b2是一个在ImageNet-1k上预训练的编码器模型，采用分层Transformer结构。该模型专为语义分割任务设计，结合了简单高效的架构和出色的性能。虽然此版本仅包含预训练的编码器部分，但它为图像分类和语义分割的微调提供了坚实基础。SegFormer的创新设计使其在多个计算机视觉任务中展现出强大潜力。

SpA-Former-shadow-removal - Transformer模型实现高效图像去阴影

GithubIJCNN 2023SpA-FormerTransformer图像阴影去除开源项目注意力机制

SpA-Former是一种基于Transformer的图像去阴影模型,采用空间注意力机制提取阴影特征。在ISTD数据集上,该模型在PSNR、SSIM和RMSE指标方面表现出色。SpA-Former具有参数量少、计算效率高的特点,适用于实际场景的阴影去除。该研究已在IJCNN 2023会议发表,并开源了预训练模型和测试结果,便于研究者复现和对比。

segformer-b4-finetuned-ade-512-512 - 512x512分辨率下SegFormer的高效Transformer语义分割实现

ADE20kGithubHuggingfaceSegFormerTransformer图像处理开源项目模型语义分割

本项目展示了SegFormer模型如何应用在ADE20k数据集上，以512x512分辨率进行微调。该模型采用分层Transformer编码器与轻量级全MLP解码头的设计，并在ImageNet-1k预训练后用于语义分割。其适用于多个基准测试如ADE20K和Cityscapes，为视觉分割提供强大而灵活的工具。用户可以使用该模型进行图像的语义分割，或选择适合特定任务的微调版本。

mask2former-swin-tiny-coco-instance - Mask2Former模型：统一处理实例、语义和全景图像分割

GithubHuggingfaceMask2Former图像分割实例分割开源项目模型深度学习计算机视觉

Mask2Former是一个先进的图像分割模型，基于Swin骨干网络在COCO数据集上训练。它采用统一的方法处理实例、语义和全景分割任务，通过预测掩码和标签来完成分割。该模型引入多尺度可变形注意力Transformer和掩码注意力Transformer解码器，在性能和效率上超越了先前的MaskFormer模型。Mask2Former提供了简单的使用方法和代码示例，方便研究人员和开发者在图像分割领域进行应用和研究。

maskformer-swin-base-ade - 语义分割的新方法——MaskFormer的应用

GithubHugging FaceHuggingfaceMaskFormer图像分割开源项目模型深度学习语义分割

MaskFormer采用Swin骨干网络与ADE20k数据集，在语义分割中表现出色。该模型通过预测掩模和标签统一地解决实例、语义及全景分割任务，可通过Hugging Face平台上的预训练模型来深入研究其应用。

actionformer_release - 基于Transformer的高精度动作时刻定位模型

ActionFormerActivityNetGithubTHUMOS14Transformer开源项目时序动作定位

actionformer_release是一个基于Transformer的动作定位模型，能够检测动作实例的起止点并识别动作类别。在THUMOS14数据集上，该模型取得了71.0%的mAP，超越之前的最佳模型14.1个百分点，并首次突破60%的mAP。此外，该模型在ActivityNet 1.3和EPIC-Kitchens 100数据集上也取得了优异成绩。该项目设计简洁，通过局部自注意力机制对未剪辑视频进行时间上下文建模，并可一次性精确定位动作时刻。代码和预训练模型已开源，可供下载和试用。

voxelmorph - 学习驱动的图像配准和变形建模库

GithubVoxelMorph合成形态图像配准开源项目机器学习空间变换

本页面介绍VoxelMorph，这是一个用于图像配准和变形建模的学习驱动库。页面提供教程展示无数据训练模型、图像配准和参数选择等操作步骤。VoxelMorph库支持下载预训练模型、图像到图像配准和Dice分数测量，并包含模板构建和变形字段可视化等高级功能。该项目适合那些需要高效图像配准解决方案的研究人员和开发者。

segformer-b3-finetuned-ade-512-512 - 改进版SegFormer模型，提升语义分割精度与效率

ADE20kGithubHuggingfaceSegFormerTransformers图像分割开源项目模型语义分割

SegFormer在ADE20k数据集上微调后，在高分辨率下展现出卓越的语义分割能力。它结合了层次Transformer编码器和轻便MLP解码器，通过ImageNet-1k预训练和后续微调，适合多样化的图像分割应用，提供多种版本以匹配不同需求。

GameFormer - 结合游戏理论的自动驾驶交互预测规划模型

GameFormerGithubTransformer交互预测开源项目自动驾驶规划

GameFormer是一个创新的自动驾驶AI项目，结合游戏理论和Transformer架构进行交互式预测和规划。项目提供Waymo开放运动数据集上的交互预测联合模型代码，以及动态场景的开环规划实现。GameFormer提高了预测准确性和自动驾驶系统的决策能力，为智能交通系统研究开辟新方向。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号