Project Icon

segformer-b4-finetuned-ade-512-512

512x512分辨率下SegFormer的高效Transformer语义分割实现

本项目展示了SegFormer模型如何应用在ADE20k数据集上,以512x512分辨率进行微调。该模型采用分层Transformer编码器与轻量级全MLP解码头的设计,并在ImageNet-1k预训练后用于语义分割。其适用于多个基准测试如ADE20K和Cityscapes,为视觉分割提供强大而灵活的工具。用户可以使用该模型进行图像的语义分割,或选择适合特定任务的微调版本。

timesformer-base-finetuned-k400 - TimeSformer视频分类模型的Kinetics-400数据集实现
GithubHuggingfaceKinetics-400TimeSformer开源项目机器学习模型视频分类视频理解
TimeSformer是一个基于空间-时间注意力机制的视频分类模型,在Kinetics-400数据集上完成微调。该模型支持400类视频标签分类,由Facebook Research开发并在Hugging Face平台开源。模型采用transformer架构处理视频序列,可通过Python接口实现快速部署和预测。
DECIMER-Image_Transformer - 化学结构图像识别的深度学习新方法
DECIMERGithubSMILESTransformer化学图像识别开源项目深度学习
DECIMER-Image_Transformer项目结合EfficientNet V2和Transformer模型,开发了用于化学结构图像识别的先进深度学习方法。该项目优化了数据处理流程,采用TPU加速训练,提高了SMILES预测效率。这一创新为化学文献的自动化分析和结构识别提供了新的研究方向,推动了化学信息学领域的发展。
swinv2-tiny-patch4-window8-256 - 基于分层特征图的轻量级视觉Transformer模型
GithubHuggingfaceImageNetSwin Transformer v2图像分类开源项目模型深度学习计算机视觉
Swin Transformer V2是一个在ImageNet-1k数据集上预训练的视觉模型,采用分层特征图结构和局部窗口注意力机制,实现线性计算复杂度。模型整合了残差后归一化和余弦注意力等技术,在保持256x256分辨率输入的同时,提供了稳定的图像分类和特征提取能力。
vit_small_r26_s32_384.augreg_in21k_ft_in1k - ResNet与Vision Transformer结合的图像分类模型解析
GithubHuggingfaceImageNetViTtimm图像分类增广正则化开源项目模型
该模型结合ResNet与Vision Transformer(ViT)的特点,专用于图像分类。最初在ImageNet-21k上训练,后在ImageNet-1k上微调,并在JAX中创建,由Ross Wightman移植到PyTorch环境中。模型采用了36.5M参数和27.7M激活,针对384x384图像进行了优化,通过增强和正则化技术提升了处理复杂图像任务的能力,适用于多种图像识别应用。
ViTAE-Transformer-Remote-Sensing - 遥感图像解释的视觉变压器模型集合
Github图像分割开源项目深度学习目标检测计算机视觉遥感
ViTAE-Transformer-Remote-Sensing项目致力于遥感图像解释领域的视觉变压器模型研究。该项目涵盖遥感预训练、场景识别、语义分割和目标检测等多项任务,提出了RVSA和MTP等创新模型架构和训练方法。项目还开发了SAMRS大规模遥感分割数据集。这些成果有助于推进遥感基础模型的发展,为遥感应用提供技术支持。项目成果包括遥感预训练研究、场景识别模型、语义分割技术和目标检测算法。RVSA和MTP等创新架构提升了模型性能和效率。SAMRS数据集的开发为遥感分割任务提供了大规模训练资源。
FasterViT - 高效分层注意力的视觉transformer新突破
FasterViTGithub图像分类层级注意力机制开源项目目标检测视觉Transformer
FasterViT是一种创新的视觉transformer模型,采用分层注意力机制高效捕获短程和长程信息。在ImageNet分类任务中,FasterViT实现了精度和吞吐量的新平衡,无需额外训练数据即达到最先进水平。该项目提供多种预训练模型,适应不同计算资源和精度需求,支持任意分辨率输入,为目标检测、分割等下游任务提供灵活选择。
florence2-finetuning - 视觉语言模型的高效微调实现
Florence-2Github分布式训练开源项目微调微软视觉语言模型
本项目展示了Florence-2模型的微调方法。Florence-2是一个基础视觉语言模型,特点是模型小且性能强。项目包含模型安装、数据准备和代码修改说明,并提供单GPU及分布式训练脚本。这些工具可用于Florence-2的特定任务训练,适用于各种计算机视觉和视觉语言任务。
efficientnet-b0 - EfficientNet的复合系数法在资源有限设备上提升图像分类效果
EfficientNetGithubHuggingfaceImageNet卷积神经网络图像分类开源项目模型模型缩放
EfficientNet是一种训练于ImageNet-1k数据集、分辨率为224x224的卷积模型。该模型提出了复合系数方法,以均衡缩放模型的深度、宽度和分辨率。在移动设备上表现卓越,适用于图像分类。同时,用户可在Hugging Face平台上获取特定任务的微调版本。
SegVol - 突破性的通用交互式三维医学影像分割模型
3D建模CT扫描GithubSegVol人工智能医学图像分割开源项目
SegVol是一个创新的通用交互式三维医学影像分割模型,支持点、框和文本提示输入。该模型在96,000个CT扫描数据集上训练,可分割超过200个解剖类别。SegVol开源了推理代码、训练代码、模型参数以及预训练的ViT参数。通过内部和外部验证,SegVol展现出优秀的分割性能,为医学影像分析提供了新的解决方案。
regnety_120.sw_in12k_ft_in1k - 高级图像分类模型,优化大规模数据集的性能
GithubHuggingfaceRegNetY图像分类开源项目数据集模型特征提取预训练
RegNetY-12GF模型致力于图像分类,先在ImageNet-12k上预训练,再在ImageNet-1k上微调。其结构支持多项增强功能,如随机深度和梯度检查点,提高模型准确性和效率。基于timm库实现,广泛用于特征图提取和图像嵌入,适用于多种图像处理场景。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号