Project Icon

regnety_120.sw_in12k_ft_in1k

高级图像分类模型,优化大规模数据集的性能

RegNetY-12GF模型致力于图像分类,先在ImageNet-12k上预训练,再在ImageNet-1k上微调。其结构支持多项增强功能,如随机深度和梯度检查点,提高模型准确性和效率。基于timm库实现,广泛用于特征图提取和图像嵌入,适用于多种图像处理场景。

recognize-anything - 通用图像识别模型:支持开放域类别和高精度标签生成
GithubRAM++图像识别多模态开源模型开源项目零样本学习
Recognize Anything Model是一系列开源图像识别模型,包括RAM++、RAM和Tag2Text。这些模型能准确识别常见和开放域类别,支持高精度图像标签生成和全面描述。项目提供预训练模型、推理代码和训练数据集,适用于多种计算机视觉任务。模型性能优于现有先进方案,尤其在零样本识别方面表现突出。
yolos-small-finetuned-license-plate-detection - 车牌识别微调模型提升物体检测能力
GithubHuggingfaceYOLOS开源项目模型模型微调目标检测视觉Transformer车牌识别
YOLOS小型模型经过微调适用于车牌检测,使用5200张图片进行训练,并在380张图片上验证,实现49.0的平均精度。模型支持PyTorch平台,并通过Python代码执行对象检测与边界框预测。其此前版本曾在ImageNet-1k和COCO 2017数据集上进行训练,具备卓越的识别性能。
ml-aim - 自回归图像模型预训练的突破性进展
AIMGithub图像特征大规模模型开源项目自回归图像模型预训练
AIM项目开发了一系列采用自回归生成目标预训练的视觉模型。研究发现,图像特征的自回归预训练呈现出与大型语言模型类似的扩展性。该项目能够将模型参数轻松扩展到数十亿级,并能有效处理大规模未筛选的图像数据。AIM提供多种预训练模型,兼容PyTorch、MLX和JAX等多个框架,为计算机视觉领域的研究与应用提供了有力支持。
SRGAN - 使用生成对抗网络提升单图像超分辨率效果
GithubSRGANTensorLayerXVGG19开源项目计算机视觉超分辨率
本项目展示了使用生成对抗网络(GAN)如何实现单图像的高分辨率超分辨率。使用预训练的VGG19模型和高分辨率图像进行训练,支持多种深度学习框架,如TensorFlow、PaddlePaddle、MindSpore,未来还将支持PyTorch。项目提供完整的训练和评估指南,并通过简单的代码修改可以切换不同的后端框架。适用于图像处理和计算机视觉领域的研究人员和开发人员,项目中展示了技术实现的详细结果,还提供了参考文献和讨论资源。
sd-controlnet-mlsd - 结合M-LSD直线检测优化Stable Diffusion的图像生成
ControlNetGithubHuggingfaceM-LSDStable Diffusion开源项目扩散模型条件输入模型
该项目介绍了ControlNet神经网络结构,通过加入M-LSD直线检测等条件来控制大规模扩散模型,适用于Stable Diffusion。ControlNet能够在小数据集下进行稳健学习,且可在个人设备上快速训练。项目提供了多种检查点,涵盖边缘检测、深度估计和关键点检测,丰富了大规模扩散模型的控制方式,有助于推进相关应用的发展,最佳效果在Stable Diffusion v1-5结合使用时体现。
conditional-detr-resnet-50 - 基于条件机制增强ResNet-50的图像检测模型
COCO 2017Conditional DETRGithubHuggingfaceResNet-50对象检测开源项目快速训练收敛模型
Conditional DETR结合了ResNet-50,通过条件交叉注意力机制加速COCO 2017数据集上的训练收敛。在目标检测任务中,该模型解决了训练收敛缓慢的问题,提升了特征提取和目标分类的效率。通过条件空间查询机制,模型能够更高效地定位目标区域,提高了训练速度。在R50和R101骨干网下加速6.7倍,DC5-R50和DC5-R101下加速10倍,并支持PyTorch。
SRe2L - 创新的ImageNet规模数据集压缩技术
GithubImageNetNeurIPS大规模数据开源项目数据集蒸馏自监督压缩
SRe2L项目提出了一种新颖的大规模数据集压缩方法,通过'挤压'、'恢复'和'重新标记'三个步骤实现ImageNet规模数据的高效压缩。该方法在NeurIPS 2023会议上获得spotlight展示,为数据集蒸馏领域带来新的研究视角。项目还包括SCDD和CDA等相关工作,共同推动数据集蒸馏技术在大数据时代的应用和发展。
Ranni - 将文本指令精确转化为图像的AI生成技术
AI绘画CVPR 2024GithubRanni开源项目文本生成图像语义理解
Ranni是一个创新的文本到图像生成项目,结合大型语言模型和扩散模型,提高了指令理解和图像生成的精确度。该项目由规划模型和绘画模型组成,可将文本指令准确转化为视觉元素。除了生成高质量图像,Ranni还支持交互式编辑,方便调整生成结果。项目已开源模型权重,包含经LoRA微调的LLaMa-2-7B和全面微调的SDv2.1模型。
HighResCanopyHeight - AI驱动的高分辨率森林冠层高度制图技术
DINOv2GithubMeta AI卫星图像开源项目树冠高度图自监督学习
HighResCanopyHeight项目运用自监督视觉转换器和卷积解码器,将RGB卫星影像转化为高分辨率森林冠层高度图。通过大规模预训练和针对性微调,该技术展现出跨地理区域和影像类型的适应性。这一创新方法在精确度和细节呈现上超越传统技术,为森林监测和生态研究提供了有力支持。
Qwen2-VL-7B-Instruct-GPTQ-Int4 - 量化模型支持多分辨率视觉理解
GithubHuggingfaceQwen2-VL图像理解多模态开源项目模型视觉语言模型视频理解
Qwen2-VL-7B-Instruct-GPTQ-Int4是一款量化视觉语言模型,支持多分辨率图像和20分钟以上视频理解。模型具备复杂推理能力,可应用于移动设备和机器人操作。支持多语言理解,包括欧洲语言、日语和韩语等。采用动态分辨率和多模态旋转位置嵌入技术,在视觉理解基准测试中表现出色。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号