#视觉编码器

llava-v1.6-vicuna-13b-hf - 多模态聊天机器人：增强图像识别和常识推理能力

图像文本问答生成优化开源项目模型GithubHuggingface视觉编码器多模态LLaVa-Next

LLaVa-1.6在提升图像分辨率和视觉指令数据集的基础上，增强了光学字符识别（OCR）和常识推理能力。整合了大型语言模型与视觉编码器，可用于图像描述、视觉问答和多模态聊天等应用。通过优质数据组合和动态高分辨率支持复杂的应用场景，优化算法效率，利用4位量化和Flash-Attention 2提升生成速度，使其成为多模态AI的一种先进工具。

nougat-small - 神经网络驱动的学术PDF到Markdown转换模型

学术文档识别开源项目Huggingface模型视觉编码器PDF转MarkdownGithub文本解码器Nougat

Nougat-small是一个专门用于将学术PDF转换为Markdown格式的开源模型。它结合了Swin Transformer视觉编码器和mBART文本解码器，通过分析PDF图像像素来生成对应的Markdown内容。作为Nougat项目的轻量级版本，该模型旨在提升学术文献处理的效率。它为研究人员提供了一种简化PDF文档转换和分析的工具，有助于提高学术工作流程的效率。

dit-base-finetuned-rvlcdip - 基于自监督学习的文档图像转换模型应用

文档分类自我监督学习视觉编码器Document Image TransformerRVL-CDIPHuggingfaceGithub开源项目模型

Document Image Transformer 是一种基于 Transformer 的模型，专为自监督学习而设计，通过大量文档图像来学习图像的内在表示。经过 RVL-CDIP 数据集的细调，该模型适用于文档图像分类、表格检测和文档布局分析等任务。通过在预训练编码器上添加线性层，可以灵活实现不同任务的目标。模型将图像划分为16x16像素固定块，并使用离散 VAE 编码器的视觉 token 进行预测。该技术解决方案在灰度图像分类中表现出色，尤其是在细分类别的文档图像任务中。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号