Project Icon

VLDet

将开放词汇目标检测转化为对象语言对齐学习

VLDet是一种开放词汇目标检测方法,通过学习对象与语言的对齐来直接从图像-文本对训练检测器。基于CLIP的视觉-语言预训练模型,该方法将任务构建为二分图匹配问题,在COCO和LVIS等数据集上实现了领先性能,并可轻松扩展到新目标类别。VLDet为开放词汇目标检测提供了高效的解决方案。

OpenPCDet - 开源LiDAR 3D目标检测框架 支持多种先进算法和数据集
3D目标检测GithubLiDAROpenPCDet开源项目深度学习点云
OpenPCDet是一个开源LiDAR 3D目标检测框架,支持PointRCNN、PV-RCNN等多种算法。具有简洁设计,兼容多种数据集和模型,在KITTI和Waymo等数据集上提供基准性能。支持分布式训练和多头检测,是功能丰富的3D检测工具箱。
vip-llava-7b-hf - 基于自然视觉提示的多模态语言模型
AI聊天机器人GithubHuggingfaceViP-LLaVA图像识别多模态AI开源项目模型视觉语言处理
VipLLaVA在LLaVA基础上引入自然视觉提示训练机制,通过边界框和指向箭头等视觉标记增强模型的图像理解能力。作为基于Transformer架构的多模态模型,VipLLaVA支持多图像输入和复杂视觉查询处理。该模型通过微调LLaMA/Vicuna实现,可集成到transformers库中实现图像文本交互,并支持4位量化和Flash Attention 2优化部署。
ViT-SO400M-14-SigLIP - 基于SigLIP的视觉-语言模型实现零样本图像分类
GithubHuggingfaceSigLIPViT图像分类开源项目机器学习模型自然语言处理
ViT-SO400M-14-SigLIP是基于WebLI数据集训练的视觉-语言预训练模型,采用sigmoid损失函数进行图像和文本的联合学习。该模型在零样本图像分类任务中表现出色,具有良好的跨模态理解能力。通过OpenCLIP和timm库,用户可以方便地使用该模型生成图像和文本嵌入。ViT-SO400M-14-SigLIP适用于图像分类、图像检索等多种计算机视觉和自然语言处理任务。
yolos-small - 基于Vision Transformer的高效物体检测模型
COCO数据集GithubHuggingfaceYOLOS图像识别开源项目模型目标检测视觉模型
YOLOS是一种基于Vision Transformer的物体检测模型,在COCO 2017数据集上进行了微调。该模型采用DETR损失函数训练,使用双向匹配损失和匈牙利算法优化参数。YOLOS-small版本在COCO验证集上达到36.1 AP的性能,而基础版本可达到与DETR相当的42 AP。YOLOS为计算机视觉领域提供了一种简单高效的物体检测方案,适用于多种目标检测场景。
DIVA - 扩散模型辅助CLIP增强视觉理解能力
AI视觉CLIPDIVAGithub开源项目扩散模型迁移学习
DIVA是一种创新方法,利用扩散模型作为视觉助手优化CLIP表示。通过文本到图像扩散模型的生成反馈,DIVA无需配对文本数据即可提升CLIP视觉能力。在MMVP-VLM细粒度视觉评估基准上,DIVA显著提升了CLIP性能,同时保持了其在29个图像分类和检索基准上的强大零样本能力。这为增强视觉语言模型的视觉理解开辟了新途径。
LITv2 - 基于HiLo注意力的快速视觉Transformer
GithubHiLo注意力LITv2图像分类开源项目目标检测视觉Transformer
LITv2是一种基于HiLo注意力机制的高效视觉Transformer模型。它将注意力头分为两组,分别处理高频局部细节和低频全局结构,从而在多种模型规模下实现了优于现有方法的性能和更快的速度。该项目开源了图像分类、目标检测和语义分割任务的预训练模型和代码实现。
VILA1.5-3b - 交错图像文本预训练的视觉语言模型突破
GithubHuggingfaceVILA图像文本预训练多图像推理开源项目模型视觉语言模型边缘部署
VILA1.5-3b是一款基于交错图像-文本数据预训练的视觉语言模型。它具备多图像推理、上下文学习和视觉思维链等能力,可通过AWQ 4位量化部署于边缘设备。该模型采用交错图像-文本预训练、语言模型解冻和指令数据重混合等创新技术,有效提升了视觉语言和纯文本任务性能。VILA1.5-3b支持多种硬件架构,适用于计算机视觉、自然语言处理等研究领域。
clip-flant5-xxl - 基于VQAScore论文的强大图像文本检索模型
CLIP-FlanT5-XXLFlan-T5GithubHuggingfaceVQAScore图像文本检索开源项目模型视觉语言生成模型
CLIP-FlanT5-XXL是一个基于google/flan-t5-xxl微调的图像文本检索模型,由Zhiqiu Lin等研究者开发。这个视觉语言生成模型专门针对VQAScore论文中的任务进行了优化。采用Apache-2.0许可证的CLIP-FlanT5-XXL能够高效处理图像和文本之间的关联。该模型在Hugging Face平台上提供了演示,技术细节可在GitHub仓库中查阅。
vilt-b32-finetuned-vqa - ViLT:基于Transformer的无卷积视觉语言问答模型
GithubHuggingfaceViLTVision-and-Language Transformer图像处理开源项目模型自然语言处理视觉问答
vilt-b32-finetuned-vqa是一个在VQAv2数据集上微调的视觉问答模型,基于ViLT架构。该模型无需卷积或区域监督,可高效处理图像和文本的多模态任务。通过PyTorch,开发者能轻松实现视觉问答功能,只需输入图像和问题即可。这一模型为视觉语言理解领域的研究和应用提供了有力支持。
VLMEvalKit - 开源的大型视觉语言模型评估工具包
GithubVLMEvalKit多模态数据集大型视觉语言模型开源开源项目评估工具包
VLMEvalKit是一款开源的大型视觉语言模型评估工具包,支持即插即用的评估操作,无需繁重的数据准备。该工具包支持多种顶级数据库和最新模型测试,并为用户提供精确匹配和基于LLM的答案提取两种评估结果。有效工具,帮助专业人员和研究者评估模型性能。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号