Project Icon

Multi-Modality-Arena

完善的多模态模型评估工具,让视觉问答更精准

Multi-Modality Arena 是一个专注于评估多模态模型的开放平台,支持视觉问答任务的对比测试。平台发布了OmniMedVQA和Tiny LVLM-eHub等评估基准,涵盖广泛的视觉和语言领域。用户可以访问在线演示,参与评估项目,并利用丰富的模型和数据集资源进行性能优化。

Multi-Modality Arena 项目介绍

项目概况

Multi-Modality Arena 是一个面向大型多模态模型的评估平台。在这个平台上,两个匿名模型将被并排用于视觉问答任务的比较。这个项目已经发布了相关演示,并欢迎各界人士参与到这次评估活动中。

全面的多模态模型评估

OmniMedVQA:针对医疗大规模LVLM的综合评估

  • OmniMedVQA数据集:该数据集包含118,010张图像和127,995个问答项目,涵盖12种不同的模态,并涉及超过20个人体解剖区域。
  • 12种模型:包括8种通用领域的大型视觉语言模型(LVLM)和4种医疗专业的LVLM。

Tiny LVLM-eHub:Bard参与的早期多模态实验

  • 小型数据集:包括50个随机样本的42个文本相关视觉基准,总共有2,100个样本,便于使用。
  • 更多模型:另外添加4个模型,使模型总数达到12个,其中包括谷歌的Bard。
  • ChatGPT 合集评估:与之前的词匹配方法相比,与人类评估结果更为一致。

LVLM-eHub:大型视觉语言模型的评估基准

LVLM-eHub是一个对公众开放的大型多模态模型的综合性评估基准。它对8个LVLM在6个多模态能力类别中进行广泛评估,涵盖47个数据集和1个线上平台。

LVLM排行榜

LVLM排行榜系统地根据模型的特定目标能力(如视觉感知、视觉推理、视觉常识、视觉知识获取和对象幻觉)对数据集进行分类,并包括最近发布的模型以增强其全面性。

排名模型版本分数
🏅InternVLInternVL-Chat327.61
🥈InternLM-XComposer-VLInternLM-XComposer-VL-7B322.51
🥉BardBard319.59

(备注:完整榜单见原文档)

更新日志

  • 2024年3月31日:发布了OmniMedVQA,这是面向医疗LVLM的大规模综合评估基准。
  • 2023年10月16日:根据LVLM-eHub提供的能力水平数据集进行了分割,新增了8个最近发布的模型。

支持的多模态模型

下列模型正在参与随机构建的竞争中:

  • MiniGPT-4
  • Salesforce/BLIP2
  • DAMO Academy/mPLUG-Owl
  • 等更多模型……

如何开始使用

用户需要设置合适的环境以运行控制器和服务端,并根据不同模型需求创建特定的环境。使用简单的命令行操作即可启动控制台、模型工作器和Gradio网络服务器,通过网络界面与模型进行互动。

贡献指南

项目欢迎对质量评估的各类贡献。在LVLM Evaluation和LVLM Arena两个方面都可以进行贡献。贡献者可以通过电子邮件提供评估结果或模型推理API以参与项目。

特别感谢

我们对ChatBot Arena的团队及其相关论文表示感谢,该项目激励了我们在LVLM评估方面的努力。同时,也感谢提供LVLM和数据集的各个团队,他们对大规模视觉语言模型的发展做出了重大贡献。

使用条款

该项目是一个实验性的研究工具,仅供非商业目的使用。项目部署了有限的安全措施,可能生成不当内容,不能用于任何非法、有害、暴力、种族主义或色情的用途。

项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号