#视觉基础模型

GPT4Tools - 大语言模型自学使用多模态工具的创新系统

GPT4Tools大语言模型视觉基础模型自我指导多模态交互Github开源项目

GPT4Tools是基于Vicuna (LLaMA)的创新系统,通过71K自建指令数据实现对多个视觉基础模型的智能控制。该系统能自动决策和利用不同视觉模型,实现对话中的图像交互。项目支持通过自我指导和LoRA微调教授大语言模型使用工具,为图像相关需求提供高效解决方案。GPT4Tools的开源性和灵活性使其成为AI研究与应用的重要工具。

RADIO - 通过多模型融合提升性能的通用视觉基础模型

RADIO视觉基础模型CLIPDINOv2SAMGithub开源项目

AM-RADIO是一个将多个大型视觉基础模型蒸馏为单一模型的框架。其核心产物RADIO作为新一代视觉基础模型,在多个视觉任务中表现优异,可作为通用视觉骨干网络使用。RADIO通过蒸馏整合了CLIP、DINOv2和SAM等模型,保留了文本定位和分割对应等特性。在ImageNet零样本分类、kNN和线性探测分割等任务上,RADIO超越了教师模型,同时提升了视觉语言模型的性能。此外,RADIO支持任意分辨率和非方形图像输入,并提供了名为E-RADIO的高效变体。

ComfyUI-Florence2 - 基于Florence-2视觉基础模型，可处理多种视觉和视觉-语言任务

Florence2ComfyUI视觉基础模型多任务学习DocVQAGithub开源项目

ComfyUI-Florence2项目基于Florence-2视觉基础模型，可处理多种视觉和视觉-语言任务。除支持图像描述、物体检测和分割外，还新增文档视觉问答功能。项目利用FLD-5B数据集进行多任务学习，采用序列到序列架构，在零样本和微调场景下表现优异。用户可通过ComfyUI界面便捷使用Florence2的各项功能。

InternViT-300M-448px - 动态分辨率视觉模型提供高效特征提取和OCR功能

知识蒸馏Huggingface模型OCR能力图像嵌入InternViTGithub视觉基础模型开源项目

InternViT-300M-448px是一个经过知识蒸馏的视觉基础模型，具有304M参数量和448x448的动态输入分辨率。该模型支持多图块处理，训练时1-12个，测试时可扩展至40个。通过在LAION、COYO等多个数据集上预训练，并整合额外OCR数据，模型展现出优秀的鲁棒性、文字识别和高分辨率处理能力。它可为多种视觉任务提供高质量的图像特征提取。

Florence-2-large-no-flash-attn - 基于统一表示的多功能视觉人工智能模型

模型多任务学习Github视觉基础模型开源项目Florence-2Huggingface图像处理自然语言处理

Florence-2-large-no-flash-attn是一款由微软开发的视觉基础模型。它采用提示式方法处理多种视觉和视觉语言任务,包括图像描述、目标检测和分割。该模型利用54亿个注释的大规模数据集进行多任务学习,在零样本和微调场景下均表现出色。Florence-2的序列到序列架构使其在各类下游任务中展现优异性能,为统一视觉表示提供了新的可能性。

InternViT-6B-448px-V1-5 - 提升视觉模型分辨率及多语言OCR精度

Github开源项目视觉基础模型高分辨率处理InternViT-6B-448px-V1-5图像特征提取HuggingfaceOCR能力模型

InternViT-6B-448px-V1-5在InternViT-6B-448px-V1-2的基础上，通过动态调整训练图像分辨率和强化数据集质量来提高模型的高分辨率处理和OCR能力。该模型具有5540M参数，使用1到12块瓦片进行训练，并通过PaddleOCR进行了中英文OCR处理，增强了多语言OCR性能。建议在构建视觉语言模型时，使用最后一层的特征。

lotus-depth-g-v1-0 - 新一代视觉深度预测与密集估计模型

Github模型密集预测开源项目深度预测Lotus扩散模型Huggingface视觉基础模型

Lotus是一个开源的视觉基础模型，主要用于图像深度估计和密集预测任务。该项目提供完整的模型实现和在线演示平台，可应用于3D场景重建、深度感知等计算机视觉领域。模型采用Apache-2.0许可协议发布，支持学术研究和商业应用开发。

lotus-normal-g-v1-0 - 基于扩散原理的高精度视觉预测模型

视觉基础模型深度学习Huggingface开源项目模型扩散模型Github密集预测Lotus

Lotus是EnVision Research团队开发的视觉基础模型，采用扩散模型技术实现高精度的视觉预测功能。该项目已在arXiv发表论文，并开源了完整代码库。通过在线演示平台，开发者可以体验其在计算机视觉领域的实际应用效果。

lotus-normal-d-v1-0 - 视觉预测领域的高品质扩散模型

高质量预测Github扩散模型开源项目Lotus模型HuggingfaceHuggingFace视觉基础模型

Lotus系列中的视觉基础模型，专注于高精度与密集预测任务。通过创新的扩散技术，显著提升视觉预测的精度和质量，在科研领域拥有广泛的应用潜力。该项目是Lotus官方模型家族的一部分，采用先进的扩散技术以提高视觉预测的效果，适用于多种高难度的密集预测任务。

相关文章

Article Cover

GPT4Tools: 革新视觉交互的智能系统

Article Cover

AM-RADIO: 革命性的多领域图像生成技术

Article Cover

ComfyUI-Florence2：将微软强大的视觉语言模型整合到AI艺术创作中

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号