Project Icon

dino-vits8

采用DINO训练的自监督Vision Transformer模型

小型Vision Transformer模型使用DINO自监督方法训练,专为ImageNet-1k数据集预训练。模型通过8x8像素的固定大小图像块输入,用于图像表征,无需微调便可用于图像分类任务。ViT模型适合下游任务的特征提取,并可通过线性层进行分类。用户可在Hugging Face上找到适合特定任务的微调版本。

tensorflow-image-models - 将PyTorch图像模型移植到TensorFlow的预训练模型库
GithubTensorFlow图像模型开源项目机器学习深度学习预训练权重
tensorflow-image-models是一个将PyTorch图像模型移植到TensorFlow的开源项目。它提供了多种预训练模型,包括ViT、DeiT、ResNet等,可用于图像分类和分割。该项目为开发者提供了简单的API来创建、预处理和保存/加载模型,并支持调整类别数量以适应不同任务。通过这个模型库,研究人员和开发者可以更方便地在TensorFlow中使用先进的图像模型。
notebooks - 使用 SOTA 计算机视觉模型和技术的示例和教程
DETRGPT-4 VisionGithubRoboflowYOLO开源项目计算机视觉
提供详尽的计算机视觉教程,包括ResNet、YOLO、DETR等经典模型,以及最新的Grounding DINO、SAM和GPT-4 Vision技术。这个资源库适合初学者和专家学习最前沿的计算机视觉方法和应用。
EasyCV - 基于PyTorch的全能计算机视觉工具箱,支持自监督学习和Transformer模型
EasyCVGithubPyTorch图像分类开源项目目标检测自监督学习
EasyCV是基于PyTorch的全能计算机视觉工具箱,专注于自监督学习、Transformer模型和主要视觉任务,包括图像分类、度量学习、目标检测和姿态估计。该工具箱提供了最先进的自监督算法如SimCLR、MoCO V2、Swav、DINO和基于掩码图像建模的MAE。它拥有简单综合的推理接口,并支持多种预训练模型。EasyCV支持多GPU和多工作者训练,利用DALI优化数据处理,使用TorchAccelerator和fp16加速训练,并通过PAI-Blade优化推理性能。
Awesome-Backbones - 图像分类的主干网络库及其使用教程
Awesome-BackbonesGithubPyTorch图像分类开源项目模型训练预训练权重
提供丰富的图像分类主干网络,包括TinyViT、DeiT3、EdgeNeXt、RevVisionTransformer等,兼容Pytorch 1.7.1+及Python 3.6+。项目包含环境搭建、数据集准备、训练和评估的详细教程,适合科研和实际应用,提升图像分类模型性能。提供快速开始指南和预训练权重,帮助开发者高效部署与测试。
MambaVision - 高效且灵活的视觉骨干网络,适用于各种分辨率的图像处理
GithubHugging FaceMambaVision图像分类开源项目深度学习计算机视觉
MambaVision采用混合Mamba-Transformer架构,结合自注意力和混合块,实现了卓越的图像分类和特征提取效果。其创新的对称路径设计提升了全局上下文的建模能力,并提供多种预训练模型。MambaVision支持多种分辨率图像处理,适用于分类、检测和分割等任务。最新模型支持Hugging Face和pip包,详细信息见[官网](https://huggingface.co/collections/nvidia/mambavision-66943871a6b36c9e78b327d3)。
HighResCanopyHeight - AI驱动的高分辨率森林冠层高度制图技术
DINOv2GithubMeta AI卫星图像开源项目树冠高度图自监督学习
HighResCanopyHeight项目运用自监督视觉转换器和卷积解码器,将RGB卫星影像转化为高分辨率森林冠层高度图。通过大规模预训练和针对性微调,该技术展现出跨地理区域和影像类型的适应性。这一创新方法在精确度和细节呈现上超越传统技术,为森林监测和生态研究提供了有力支持。
Transformer-in-Vision - 深入探索Transformer在计算机视觉领域的最新研究与资源
AI模型ChatGPTGithubTransformer-in-Vision多模态开源项目计算机视觉
本页面收录并介绍了最新的基于Transformer的计算机视觉研究和相关资源,内容涵盖机器人应用、视频生成、文本-图像检索、多模态预训练模型等领域。用户可访问开源代码和论文链接,如ChatGPT在机器人领域的应用、DIFFUSIONDB、LAION-5B、LAVIS、Imagen Video和Phenaki等。页面会不定期更新,提供Transformer在视觉领域应用的全面信息和资源汇总。
Open-MAGVIT2 - 自回归视觉生成新突破 大幅提升图像分词性能
GithubOpen-MAGVIT2图像分词器大规模词表开源项目自回归模型视觉生成
Open-MAGVIT2是一个创新的自回归视觉生成项目,采用无查找技术和262144大小的码本,克服了VQGAN的局限性。该项目用PyTorch重新实现MAGVIT2分词器,在图像分词方面取得显著进展,8倍下采样时rFID达到0.39。项目致力于推动自回归视觉生成领域发展,目前处于积极开发阶段,未来计划拓展至视频生成领域。
vits2_pytorch - 单阶段文本到语音转换的效率与质量提升
GithubVITS2单阶段模型对抗学习开源项目文本转语音架构设计
VITS2_pytorch是一款先进的单阶段文本到语音转换模型,采用对抗学习和架构设计改进前代产品。这一最新的非官方实现版本,旨在通过增强模型结构和训练机制,有效提升语音自然度和特征相似性,同时显著降低对音素转换的依赖,从而提高训练和推断的效率。该项目还为专业人士提供了预训练模型和多种语言的样本音频,支持开箱即用的转换学习。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

白日梦AI

白日梦AI提供专注于AI视频生成的多样化功能,包括文生视频、动态画面和形象生成等,帮助用户快速上手,创造专业级内容。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

讯飞绘镜

讯飞绘镜是一个支持从创意到完整视频创作的智能平台,用户可以快速生成视频素材并创作独特的音乐视频和故事。平台提供多样化的主题和精选作品,帮助用户探索创意灵感。

Project Cover

讯飞文书

讯飞文书依托讯飞星火大模型,为文书写作者提供从素材筹备到稿件撰写及审稿的全程支持。通过录音智记和以稿写稿等功能,满足事务性工作的高频需求,帮助撰稿人节省精力,提高效率,优化工作与生活。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号