Project Icon

actionformer_release

基于Transformer的高精度动作时刻定位模型

actionformer_release是一个基于Transformer的动作定位模型,能够检测动作实例的起止点并识别动作类别。在THUMOS14数据集上,该模型取得了71.0%的mAP,超越之前的最佳模型14.1个百分点,并首次突破60%的mAP。此外,该模型在ActivityNet 1.3和EPIC-Kitchens 100数据集上也取得了优异成绩。该项目设计简洁,通过局部自注意力机制对未剪辑视频进行时间上下文建模,并可一次性精确定位动作时刻。代码和预训练模型已开源,可供下载和试用。

mit-b4 - 使用SegFormer预训练模型提升语义分割效率
GithubHugging FaceHuggingfaceImageNetSegFormerTransformer开源项目模型语义分割
此项目提供SegFormer的b4-sized预训练模型,具有分层Transformer和轻量级MLP解码头,在ADE20K和Cityscapes等基准上展现出色性能。经过ImageNet-1k预训练的SegFormer可用于下游任务微调,满足多种应用需求。用户可在[模型库](https://huggingface.co/models?other=segformer)中根据任务需求选择合适版本,优化图像分割效果。
VTimeLLM - 创新视频大语言模型实现精准时刻理解
GithubVTimeLLM多阶段训练大语言模型开源项目时间边界感知视频理解
VTimeLLM是一种先进的视频大语言模型,专注于精细化视频时刻理解和推理。该模型采用边界感知三阶段训练策略,包括图像-文本特征对齐、多事件视频时间边界识别和高质量视频指令微调。这种方法显著提升了模型的时间理解能力,使其在多项视频理解任务中表现优异。
x-transformers - 轻量级Transformer模型,支持完整的编解码器配置和最新研究成果,适合各种从图像分类到语言模型的应用
Githubtransformerx-transformers开源项目模型训练编码器编解码器
x-transformers提供了多功能的Transformer模型,支持完整的编解码器配置和最新研究成果,适合各种应用,从图像分类到语言模型。其先进技术如闪存注意力和持久内存,有助于提高模型的效率和性能。此项目是研究人员和开发者的理想选择,用于探索和优化机器学习任务中的Transformer技术。
iTransformer - 先进的时间序列预测模型,打造SOTA性能
GithubiTransformer人工智能开源项目时间序列预测注意力网络深度学习
iTransformer是一种基于注意力机制的时间序列预测模型,由清华大学和蚂蚁集团研究人员开发。该模型采用倒置Transformer结构,支持多变量和多步长预测。iTransformer引入了可逆实例归一化等技术,旨在提高预测准确性和处理长序列数据的能力。这个开源项目为时间序列分析提供了新的研究方向。项目提供Python实现,支持使用PyTorch框架。用户可通过pip安装并轻松集成到现有的时间序列分析工作流程中。该项目还包括实验性功能,如二维注意力和傅里叶变换增强版本,为研究人员提供了探索和改进的空间。
MetaTransformer - 统一12种模态的多模态学习框架
GithubMeta-Transformer人工智能多模态学习开源项目深度学习计算机视觉
Meta-Transformer是一个创新的多模态学习框架,可处理12种不同模态的数据,包括自然语言、图像、点云和音频等。该框架采用共享编码器架构和数据到序列转换方法,支持分类、检测和分割等多种任务。项目提供开源预训练模型和代码实现,为多模态AI研究提供了有力支持。
mformer-authority - 基于Transformers的开源自然语言处理库
GithubHuggingfacetransformers开源许可开源项目机器学习库模型自然语言处理英语
mformer-authority是一个基于MIT许可的开源自然语言处理库,提供了便捷的Transformers模型使用接口。该库支持多语言处理,可帮助开发者快速构建和部署NLP应用。作为一个轻量级工具,mformer-authority适用于各种自然语言处理任务,包括文本分类、命名实体识别等。它具有易用性高、性能优良的特点,是开发者进行NLP项目的理想选择。
segformer-b1-finetuned-cityscapes-1024-1024 - SegFormer模型在语义分割中的高效应用
CityscapesGithubHugging FaceHuggingfaceSegFormerTransformer图像分割开源项目模型
SegFormer模型在CityScapes数据集上进行了微调,使用Transformer结构和轻量级MLP解码头实现高效的图像语义分割。适用于图像分割领域的研究者和开发者,可通过Python代码轻松使用。该模型支持高分辨率图像处理,展示了Transformer的潜力。
mask2former-swin-large-coco-instance - 使用Swin骨干的高效图像分割Transformer模型
COCOGithubHuggingfaceMask2Former图像分割实例分割开源项目模型语义分割
Mask2Former在COCO数据集上的实例分割中表现出色,采用Swin骨干网,通过掩码预测和标签分类统一处理多种分割任务。相比MaskFormer,其改进的多尺度变形注意力机制提升了性能,并且不增加计算量的情况下优化了训练效率。此模型可以用于实例分割,提供多种微调版本供不同需求使用。
Awesome-Transformer-Attention - 视觉变换器与注意力机制的最新研究进展
GithubTransformerVision Transformer多模态学习开源项目注意力机制深度学习
探索视觉变换器和注意力机制的最新发展,包括由Min-Hung Chen持续更新的论文、代码与链接资源。适合学术与实际应用,发现创新思路。
segformer-b4-finetuned-ade-512-512 - 512x512分辨率下SegFormer的高效Transformer语义分割实现
ADE20kGithubHuggingfaceSegFormerTransformer图像处理开源项目模型语义分割
本项目展示了SegFormer模型如何应用在ADE20k数据集上,以512x512分辨率进行微调。该模型采用分层Transformer编码器与轻量级全MLP解码头的设计,并在ImageNet-1k预训练后用于语义分割。其适用于多个基准测试如ADE20K和Cityscapes,为视觉分割提供强大而灵活的工具。用户可以使用该模型进行图像的语义分割,或选择适合特定任务的微调版本。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号