#实验运行

Pix2Struct：一种革命性的视觉语言理解预训练模型

3 个月前

3 个月前

相关项目

pix2struct

Pix2Struct是一个基于截图解析的视觉语言预训练模型。该模型可处理图像描述、图表问答和界面元素理解等多种任务。项目提供预训练的Base和Large模型检查点,以及9个下游任务的微调代码。Pix2Struct在多个视觉语言任务中表现优异,为相关研究提供了有力支持。

投诉举报邮箱: service@vectorlightyear.com