MELD

用于情感识别研究的多模态对话数据集

MELD 多模态情感识别对话数据集情感标注多方对话 Github 开源项目

MELD是一个基于《老友记》电视剧的多模态对话情感识别数据集，包含1400多段对话和13000多句话。数据集融合了文本、音频和视觉信息，每句话标注有7种情绪和3种情感倾向。MELD为多模态对话情感识别研究提供了丰富资源，包括详细统计信息、标注说明和基线模型。该数据集可用于开发情感对话系统等多种应用场景。

访问官网

Github

介绍相关项目

SEED - 融合视觉与语言的多模态AI框架

AI助手GithubSEED-LLaMA多模态大语言模型开源项目视觉语言模型

SEED是一个创新的多模态AI框架，通过视觉分词器和去分词器，赋予大语言模型视觉理解和生成能力。该系统支持多模态理解与生成，展现出多轮上下文多模态生成等组合能力。基于SEED开发的SEED-LLaMA在广泛的多模态任务中表现优异，为AI领域开辟了新的研究方向。

sentiment_analysis_model - BERT模型的情感分析应用

BERTGithubHuggingface开源项目情感分析无监督学习模型模型描述预训练

该情感分析模型基于BERT，在大规模英语语料的自监督训练基础上，具备双向语句理解能力，经过精细调优，专注于文本分类任务，该项目微调BERT模型以进行情感分析，可用于自动提取文本中的情感特征。

dreamtalk - 音频驱动的表情丰富说话头像生成系统

AI表情生成DreamTalkGithub开源项目扩散模型生成说话人头像音频驱动

DreamTalk是一个创新的音频驱动说话头像生成系统，采用扩散概率模型技术。该系统能生成高质量、表情丰富的说话头像视频，适应多种说话风格。DreamTalk在处理歌曲、多语言语音、噪声音频和非常规肖像等多样化输入时表现优异。通过结合扩散概率模型，DreamTalk实现了准确的唇形同步和生动的面部表情，为不同说话风格提供了灵活支持。

MultiModal_BigModels_Survey - 大规模多模态预训练模型综合调研

Github人工智能多模态预训练模型大规模模型开源项目深度学习综述

这个项目提供了大规模多模态预训练模型的全面调研。内容包括发展历程、关键技术、代表性模型和应用场景。调研分析了模型架构、预训练策略和下游任务等研究热点,并探讨了未来方向。这份资料可为多模态人工智能研究和开发提供参考。

RedPajama-Data - 开放大规模多语言数据集助力大型语言模型训练

GithubRedPajama-Data-v2大语言模型开放数据集开源项目数据质量自然语言处理

RedPajama-Data-v2是一个包含30万亿tokens的开放数据集，用于训练大型语言模型。该数据集涵盖了超过100B的文本文档，来源于84个CommonCrawl快照。它包含英语、德语、法语、意大利语和西班牙语5种语言的内容，并提供多种质量信号和去重处理。项目提供完整的数据处理流程，包括准备工件、计算质量信号和去重等步骤，为语言模型研究提供高质量的大规模语料资源。

mllm - 轻量级移动设备多模态大语言模型推理引擎

AI推理引擎Githubmultimodal LLM开源项目移动设备边缘计算量化

mllm是一款针对移动和边缘设备优化的多模态大语言模型推理引擎。该引擎采用纯C/C++实现，无外部依赖，支持ARM NEON和x86 AVX2指令集，并提供4位和6位整数量化。开发者可利用mllm构建智能个人助理、基于文本的图像搜索、屏幕视觉问答等移动应用，实现本地推理而无需上传敏感数据。

dialogbot - Dialogbot 实现多类型对话模型的开源项目

AIDialogBotGithub人机对话系统对话模型开源项目聊天机器人

Dialogbot 是一个涵盖问答型、任务型和聊天型多种对话模型的开源项目，能够实现高效的对话解决方案。它支持计算语句相似度、网络检索、任务导向和 GPT2 生成模型，并适用于各种场景。无论是知识领域的问答，还是人性化的聊天，Dialogbot 都能够智能地提供应对方案，并支持灵活的模型训练和调整，提高对话系统的精确性与可扩展性。

VisionLLM - 面向视觉任务的开放式多模态大语言模型

GithubVisionLLM人工智能多模态大语言模型开源项目视觉语言任务计算机视觉

VisionLLM 系列是一种多模态大语言模型，专注于视觉相关任务。该模型利用大语言模型作为开放式解码器，支持数百种视觉语言任务，包括视觉理解、感知和生成。VisionLLM v2 进一步提升了模型的通用性，扩展了其在多模态应用场景中的能力，推动了计算机视觉与自然语言处理的融合。

instruction-datasets - 大语言模型指令微调数据集汇总

GithubInstruction TuningNLP多语言大语言模型开源项目数据集

该项目整理了大语言模型指令微调所需的多种数据集，包括金标准、银标准/LM生成和偏好数据集。内容涵盖多语言和多模态任务，提供指令-响应对和人类偏好评分等资源。这些数据集有助于提升模型的指令跟随、对话和任务执行能力，为NLP研究和开发提供重要参考。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号