CapsFusion
CapsFusion是一个用于生成高质量图像描述的创新框架。该项目结合大型语言模型,融合真实和合成图像-文本对,解决了大规模多模态模型训练中的可扩展性和知识保留问题。CapsFusion提供120M数据集、模型和分布式推理代码,为多模态预训练研究提供重要资源。