Project Icon

InternVL2-8B

多模态大语言模型在图像理解、视频分析和目标定位方面的全面能力

InternVL2-8B是一个基于InternViT-300M-448px和internlm2_5-7b-chat的多模态大语言模型。该模型在文档理解、图表分析和场景文本识别等图像任务中表现优异,同时在视频理解和目标定位方面也展现出强大能力。支持8k上下文窗口,能够处理长文本、多图像和视频输入,在开源多模态模型中具有竞争力。

Qwen2-VL-2B-Instruct-GPTQ-Int4 - Qwen2-VL推动多模态与自动化的跨语言视觉处理进步
GithubHuggingfaceQwen2-VL多模态多语言支持开源项目机器人人工智能模型视频理解
Qwen2-VL具备先进的多模态处理能力,支持高分辨率图像和长时视频理解,适用于视频问答及自动化设备控制。支持包括欧洲语言、日语、韩语、阿拉伯语等多语言文本理解。更新的分辨率处理和位置嵌入技术提升了视觉感知性能。
DeepSeek-VL - 高性能开源视觉语言模型 多模态理解与复杂场景应用
DeepSeek-VLGithub人工智能多模态理解开源开源项目视觉语言模型
DeepSeek-VL是一个开源视觉语言模型,为实际应用场景而设计。它能处理逻辑图表、网页、公式、科学文献、自然图像等,并在复杂场景中展现智能。模型提供1.3B和7B两种参数规模,支持基础和对话应用,可用于学术研究和商业用途。DeepSeek-VL采用MIT许可证,为研究人员和开发者提供了强大的视觉语言处理工具。
falcon-11B-vlm - 11B参数增强型视觉语言模型,提升细节图像理解与文本生成
Falcon2-11B-vlmGithubHuggingfacePyTorch 2.0图像文本数据大规模语言模型开源项目模型视觉语言模型
Falcon2-11B-vlm是一款11B参数的模型,通过超过5000B RefinedWeb数据训练,结合预训练的CLIP ViT-L/14视觉编码器,专注于增强小物件细节感知及高分辨率图像处理。该模型适用于多种视觉语言研究,特别是在细节复杂的图像理解任务中表现出色。其使用TII Falcon License 2.0许可,提倡负责任的AI使用。
llava-v1.6-vicuna-7b - 基于Vicuna的开源多模态视觉语言模型
GithubHuggingfaceLLaVA图文理解多模态大语言模型开源项目模型视觉问答
LLaVA-v1.6-vicuna-7b是一个基于Vicuna-7B开发的开源多模态模型,支持图像和文本的理解与处理。模型训练数据包含558K图文对和158K多模态指令等多样化数据集,通过12个基准测试验证其性能表现,可用于视觉语言研究与应用开发。
visualglm-6b - 中英文图像交互的多模态对话模型
GithubHuggingfaceVisualGLM-6B图像生成多模态对话开源项目模型语言模型预训练
VisualGLM-6B是一个多模态对话模型,支持中文、英文和图像交互。基于ChatGLM-6B,有78亿参数,通过BLIP2-Qformer桥接视觉和语言模型。此模型使用CogView数据集进行预训练,并在长视觉问答数据上微调,以生成符合人类偏好的回答。用户可用Python代码简便调用模型,同时提供命令行、网页示例及模型量化的详细说明。
internlm2-chat-7b-sft - 提供超长上下文支持和多功能工具的对话模型
GithubHuggingfaceInternLM代码解释器工具调用开源开源项目模型模型性能
InternLM2-Chat-7B-SFT是一款对话模型,具备提升的推理、数学和代码能力,支持长达200K的上下文处理,能够进行代码解释和数据分析,经RLHF训练后可处理复杂任务,展现出可靠的工具使用能力。
llava-1.5-13b-hf - 基于Llama 2的多模态视觉语言模型集成图像理解与对话功能
GithubHuggingfaceLLaVA图像理解多模态对话开源项目机器学习模型自然语言处理
llava-1.5-13b-hf作为开源多模态模型整合了Llama 2架构,实现图像理解和自然语言对话功能。模型通过transformers库实现多图像处理和多提示生成,并集成4位量化与Flash-Attention 2优化方案提升运行效率。在图像描述、视觉问答等任务中表现出色,体现了视觉语言模型的技术创新。
blip2-flan-t5-xl - 融合视觉和语言的多功能预训练模型用于图像理解和多模态任务
BLIP-2GithubHuggingface图像描述多模态模型开源项目模型自然语言处理视觉问答
BLIP-2 Flan T5-xl是一款融合CLIP图像编码器、查询转换器和Flan T5-xl大语言模型的视觉-语言预训练模型。它擅长图像描述、视觉问答和基于图像的对话等多模态任务,在大规模图像-文本数据集上训练后展现出优秀的零样本和少样本学习能力。该模型为视觉理解和多模态应用研究提供了强大工具,但使用时需注意评估其在特定应用场景中的安全性和公平性。
clip-ViT-B-32-multilingual-v1 - CLIP-ViT-B-32多语言模型实现文本图像向量映射和跨语言搜索
CLIPGithubHuggingfacesentence-transformers图像搜索多语言模型开源项目模型零样本分类
CLIP-ViT-B-32-multilingual-v1是OpenAI CLIP-ViT-B32模型的多语言拓展版本。该模型能将50多种语言的文本和图像映射到同一向量空间,支持多语言图像搜索和零样本图像分类。通过sentence-transformers库,用户可以方便地使用该模型。模型采用多语言知识蒸馏技术,将CLIP原始向量空间对齐到多语言空间。这为跨语言图像搜索和理解提供了有力支持,是图像-文本多语言处理的有效工具。
llava-v1.5-7b-llamafile - LLaVA模型实现图像理解与自然语言交互的多模态AI
GithubHuggingfaceLLaVA人工智能多模态模型开源项目机器学习模型自然语言处理
LLaVA-v1.5-7b-llamafile作为一个开源多模态AI模型,通过微调LLaMA/Vicuna而成。它整合了图像理解和自然语言处理功能,能够执行图像相关指令和进行对话。该模型于2023年9月推出,主要用于研究大型多模态模型和聊天机器人。LLaVA的训练数据包括558K图像-文本对和多种指令数据,在12个基准测试中表现优异。这个模型为计算机视觉和自然语言处理领域的研究人员提供了探索AI前沿应用的有力工具。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计 是一个多功能的在线设计和创意平台,提供广泛的设计工具和资源,以满足不同用户的需求。从专业的图形设计师到普通用户,无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑,稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合,帮助用户轻松实现创意设计。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号