BLIVA
BLIVA是一款简单有效的多模态大语言模型,专门处理富文本视觉问题。其在多个视觉问答基准中表现出色,并公开了模型权重和训练代码。结合FlanT5和Vicuna版本,BLIVA适用于多种商业用途并提升认知和感知任务性能。演示和安装教程也非常详细。