Project Icon

h2ovl-mississippi-800m

紧凑型视觉语言模型,提供出色的文本识别功能

H2OVL-Mississippi-800M是H2O.ai推出的一款紧凑型视觉语言模型,拥有0.8亿参数,专注于OCR文本识别,表现出色。该模型在OCRBench测试中领先,超越更大规模的模型。基于H2O-Danube的架构,Mississippi-800M扩展了视觉和文本整合能力。通过1900万图文对进行训练,尤其注重OCR、文档理解以及表格和图表的解析,优化紫为OCR任务。

NVLM-D-72B - 开源前沿级多模态大语言模型 实现视觉语言任务的最新突破
GithubHuggingfaceNVLM人工智能多模态大语言模型开源项目模型视觉语言
NVLM-D-72B是一款开源的多模态大语言模型,在视觉语言任务上表现卓越,达到了与顶级专有和开源模型相当的水平。该模型不仅擅长视觉语言任务,在多模态训练后其纯文本处理能力也有所提升。NVLM-D-72B可执行光学字符识别、多模态推理、定位、常识推理等多种任务,为AI研究社区提供了强大的开源多模态能力。
MiniCPM-V-2 - 多模态语言模型,支持跨平台高效部署
GithubHuggingfaceMiniCPM-V场景文本理解多模态开源项目模型深度学习视觉问答
MiniCPM-V 2.0是一个多模态大模型,以高效端侧部署和可靠性为特色,支持OCRBench和TextVQA等基准测试。该模型结合RLHF多模态技术,减少幻觉生成,并能处理任意宽高比的高分辨率图像。MiniCPM-V 2.0可在多数GPU和PC上高效运行,拥有中英双语支持,并能够在移动设备上执行,提供多种部署选择。
manga-ocr-base - 高精度日语漫画OCR模型支持多场景文本识别
GithubHuggingfaceManga OCR图像文本转换开源项目日本漫画日语文字识别模型视觉编码器解码器
manga-ocr-base是一款专为日语漫画开发的OCR模型,采用Vision Encoder Decoder框架。它不仅能识别垂直和水平文本,还可处理带振假名的文字和图像上的叠加文字。该模型适用于多种字体和样式,并能在低质量图像中保持高识别率。除漫画外,它还可用于一般日语印刷文本识别。该开源项目已在GitHub上发布,为日语文本识别领域提供了新的解决方案。
InternVL2-2B - 多模态大语言模型支持多语言及多媒体理解
GithubHuggingfaceInternVL2人工智能多模态大语言模型开源项目模型自然语言处理计算机视觉
InternVL2-2B是一个开源的多模态大语言模型,参数量为2.2B。该模型在文档理解、图表分析和场景文本识别等任务中表现优异,性能接近商业闭源模型。InternVL2-2B支持8K上下文窗口,可处理长文本、多图像和视频输入,大幅提升了多模态理解能力。作为一款出色的开源模型,InternVL2-2B为多模态人工智能研究和应用提供了新的可能性。
MiniCPM-Llama3-V-2_5 - 手机端多模态大语言模型突破性进展:8B参数达GPT-4V水平
GithubHuggingfaceMiniCPM-Llama3-VOCR能力多模态大语言模型多语言支持开源项目模型边缘设备部署
MiniCPM-Llama3-V-2_5是一款创新型多模态大语言模型,仅使用8B参数即达到GPT-4V级性能。该模型具备出色的OCR能力、可靠的行为表现和广泛的多语言支持,可高效部署于手机等边缘设备。支持30多种语言,并提供多种灵活部署方式,如llama.cpp、GGUF格式和LoRA微调。MiniCPM-Llama3-V-2_5标志着端侧多模态大语言模型的重要进展。
MobileCLIP-S2-OpenCLIP - 高效图像-文本模型通过多模态强化训练实现性能突破
GithubHuggingfaceMobileCLIPOpenCLIP图像文本模型多模态强化训练开源项目模型零样本图像分类
MobileCLIP-S2-OpenCLIP是一款基于多模态强化训练的高效图像-文本模型。相比SigLIP的ViT-B/16模型,它在性能上有所超越,同时速度提升2.3倍,模型体积缩小2.1倍,且仅使用了1/3的训练样本。在ImageNet零样本分类任务中,该模型达到74.4%的Top-1准确率,在38个数据集上的平均性能为63.7%,体现了出色的效率与性能平衡。
MiniCPM-V-2_6 - 高性能多模态语言模型 实现单图多图视频智能理解
GithubHuggingfaceMiniCPM-V人工智能图像理解多模态大语言模型开源项目模型视频理解
MiniCPM-V 2.6是一个高效的多模态大语言模型,仅用8B参数就达到了GPT-4V级别的表现。该模型支持单图、多图和视频理解,在多项基准测试中成绩优异。它具备出色的性能、多图和视频理解能力、强大的OCR功能以及多语言支持。MiniCPM-V 2.6还以其高效率和易用性著称,可轻松部署在包括手机和平板电脑在内的各种设备上。
Idefics3-8B-Llama3 - 提升视觉文本处理能力的多模态模型
GithubHuggingfaceIdefics3多模态开源项目文档理解模型模型优化视觉文本处理
Idefics3-8B是由Hugging Face开发的开放性多模态模型,支持处理任意图像和文本序列进行文本生成。该模型在OCR、文档理解和视觉推理方面有显著增强,适用于图像描述和视觉问答任务。Idefics3-8B主要通过监督微调进行训练,可能需要多次提示以获得完整回答。与Idefics2相比,Idefics3在文档理解能力上表现更为出色,并增加了视觉标记编码的多项改进和丰富的数据集支持。
MobileVLM-1.7B - 移动设备优化的高效多模态视觉语言模型
GithubHuggingfaceMobileVLM多模态开源项目性能评估模型模型推理移动设备
MobileVLM-1.7B是一种专为移动设备设计的多模态视觉语言模型,通过多种优化技术实现高效推理,支持跨模态交互。该模型在标准基准测试中表现出色,并经过CLIP方式的预训练。在Qualcomm Snapdragon 888和NVIDIA Jeston Orin设备上的处理速度分别为每秒21.5个和65.3个令牌。
LLaVAR - 优化视觉指令微调的文本丰富图像理解模型
GithubLLaVAROCR能力多模态大语言模型开源项目文本丰富图像理解视觉指令微调
LLaVAR项目致力于增强大型语言模型对文本丰富图像的理解能力。通过改进视觉指令微调方法,该项目显著提升了模型在OCR相关任务上的表现。LLaVAR开源了模型权重、训练数据,并提供了环境配置、训练脚本和评估方法,为相关研究和开发提供了全面支持。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

白日梦AI

白日梦AI提供专注于AI视频生成的多样化功能,包括文生视频、动态画面和形象生成等,帮助用户快速上手,创造专业级内容。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

讯飞绘镜

讯飞绘镜是一个支持从创意到完整视频创作的智能平台,用户可以快速生成视频素材并创作独特的音乐视频和故事。平台提供多样化的主题和精选作品,帮助用户探索创意灵感。

Project Cover

讯飞文书

讯飞文书依托讯飞星火大模型,为文书写作者提供从素材筹备到稿件撰写及审稿的全程支持。通过录音智记和以稿写稿等功能,满足事务性工作的高频需求,帮助撰稿人节省精力,提高效率,优化工作与生活。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号