Project Icon

fromage

支持多模态输入输出的语言模型

该页面介绍了FROMAGe项目,为其多模态输入输出任务提供代码和模型权重。包含详细的设置指南、预训练检查点、图像检索预计算嵌入、推理和训练示例以及评估脚本。研究人员可使用这些资源在视觉故事讲述和对话生成等任务中实现突破。欢迎访问项目主页和在线演示参与讨论。

项目介绍:FROMAGe

FROMAGe 项目旨在将语言模型与图像相结合,能够处理多模态的输入和输出。此项目已经开放了源代码和模型权重,研究人员和开发者可进一步研究和应用。

模型架构与特点

FROMAGe 模型的设计初衷是通过将语言模型与图像结合来实现多模态功能。模型可以读取文本与图像组合的输入,并生成相应的输出,这无疑扩大了模型的应用范围,比如图像描述、视觉问答等领域。通过框架搭建和模型训练,FROMAGe 实现了在处理复杂图片时提供更准确的响应能力。

环境设置

为了运行 FROMAGe,开发者需要设置一个新的 Python 虚拟环境,并安装所需的库。具体步骤包括创建虚拟环境,激活后通过需求文件安装相关的 Python 依赖包。

安装好库后,还需将 fromage 库加入系统的 PYTHONPATH 中,以确保能够顺利导入相关模块。

预训练模型权重

FROMAGe 的模型权重较小,大约 11MB,已经包含在代码库中。预训练模型主要用来再现论文中报告的结果。此外,库中还提供了一个经过更强视觉层训练的模型,它能更好地表现对话场景。

图像检索的预计算嵌入

为了实现图像检索功能,FROMAGe 使用了预计算的视觉嵌入。这些嵌入文件大约 3GB,可与我们提供的两种模型配置兼容。开发者可以下载这些文件,并将其放置于 fromage_model/ 文件夹中。

推理与训练

开发者可以使用 FROMAGe_example_notebook.ipynb 中提供的示例来进行模型推理。推理过程再现了论文中的一些图表,从而帮助理解模型的工作方式。

在训练方面,FROMAGe 使用 Conceptual Captions 数据集,并提供了详细的数据准备说明。开发者只需依据指引准备数据,即可启动新的训练任务。模型的训练在单张 A6000 GPU 上大约需要 24 小时完成。

权重精剪与单元测试

模型中仅包含少量的预训练线性层和 [RET] 嵌入,因此可以在磁盘空间上进行权重的精简处理。项目中还提供用于本地测试的单元测试,确保代码可以正常运行。

评估与演示

项目中包含脚本,用于在 Visual Storytelling 和 VisDial 上再现结果。提供了 iPython 笔记本格式的脚本,方便开发者进行文本生成和图像检索的评估。

此外,FROMAGe 项目提供了一个 Gradio 演示,开发者可以通过简单地运行脚本或者使用 HuggingFace 的空间来本地启动演示应用。

研究与引用

FROMAGe 项目在 2023 年的 ICML 大会上发布,研究人员若对该工作感兴趣或使用此模型进行进一步研究,建议引用相关文献以表达认可和感谢。

项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

白日梦AI

白日梦AI提供专注于AI视频生成的多样化功能,包括文生视频、动态画面和形象生成等,帮助用户快速上手,创造专业级内容。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

讯飞绘镜

讯飞绘镜是一个支持从创意到完整视频创作的智能平台,用户可以快速生成视频素材并创作独特的音乐视频和故事。平台提供多样化的主题和精选作品,帮助用户探索创意灵感。

Project Cover

讯飞文书

讯飞文书依托讯飞星火大模型,为文书写作者提供从素材筹备到稿件撰写及审稿的全程支持。通过录音智记和以稿写稿等功能,满足事务性工作的高频需求,帮助撰稿人节省精力,提高效率,优化工作与生活。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号