sharegpt4video-8b

基于视频指令数据训练的开源视频对话模型

模型 ShareGPT4Video 开源项目 Huggingface 机器学习 Github 视频语言模型视频指令数据视频聊天机器人

sharegpt4video-8b是一个开源视频对话模型，基于153K多样化视频指令数据和28K高质量视频字幕数据进行全模型微调。该模型能处理视频问答、描述和分析等任务，旨在推进视频-语言模型研究。它主要面向计算机视觉、自然语言处理和人工智能领域的研究人员，用于探索大规模视频-语言模型和视频聊天机器人的潜力。

访问官网

Github

Huggingface

介绍相关项目

speechgpt - 语音对话ChatGPT助力提升多语言口语能力

GithubSpeechGPT多语言支持开源应用开源项目语音聊天隐私保护

SpeechGPT是一个开源的网络应用，支持用户与ChatGPT进行语音对话。该应用支持超过100种语言，集成了语音识别和合成技术，可用于提升语言口语能力或进行AI对话。SpeechGPT注重数据隐私，将所有信息存储在本地。作为一个免费的开源项目，它为用户提供了一个便捷的AI语音交互平台，适用于语言学习和日常交流。

AI-text-to-video-model-from-scratch - 从零开始使用Python构建小规模AI文本生成视频模型

ColabGANGithubOpenAIPythonStability AI开源项目

完整指南教你使用Python从零构建AI文本生成视频模型，详细介绍理论概念、GAN架构、代码实现和训练过程。了解如何在普通硬件上高效训练小规模模型，实现文本到视频的转换。

Vlogger - 多模型协作生成长视频博客的AI系统

AI系统GithubShowMakerVlogger大语言模型开源项目视频生成

Vlogger是一个创新AI系统,可根据文本描述生成分钟级视频博客。该系统利用大型语言模型作为导演,将长视频生成任务分解为四个阶段,并调用多种基础模型扮演专业角色。Vlogger引入了视频扩散模型ShowMaker,融合文本和视觉提示以增强空间-时间连贯性。系统能从开放描述生成超过5分钟的连贯vlogs,在脚本和演员方面保持一致性。

Video-MME - 全面评估多模态大语言模型视频分析能力的基准

GithubVideo-MME人工智能基准评估多模态大语言模型开源项目视频分析

Video-MME是一个创新的多模态评估基准，用于评估大语言模型的视频分析能力。该项目包含900个视频和2,700个人工标注的问答对，覆盖多个视觉领域和时间跨度。其特点包括视频时长多样性、类型广泛性、数据模态丰富性和高质量标注。Video-MME为研究人员提供了一个全面评估多模态大语言模型视频理解能力的工具。

git-large-coco - 高级视觉与语言转换：大规模图像到文本模型

GITGithubHuggingface图像标注开源项目模型模型训练视觉视觉问答

GIT大型模型通过在COCO数据集上微调，实现图像到文本的转换，支持图像和视频字幕生成、视觉问答和图像分类等功能。该模型利用图像和文本令牌的结合，预测下一个文本令牌，并在多种视觉与语言应用场景中表现出色。

llava-onevision-qwen2-7b-ov-chat - LLaVA-OneVision多模态AI模型支持图像和视频交互

GithubHuggingfaceLLaVA-OneVision图像处理多模态开源项目模型深度学习自然语言处理

LLaVA-OneVision是一款基于Qwen2架构的多模态AI模型，专门针对聊天场景进行优化。该模型通过多阶段训练，包括LCS-558K预训练、高质量合成数据训练和单图数据训练等，最终经过RLHF进一步提升性能。它能够与图像、多图和视频进行交互，同时保持良好的指令遵循能力，是一个versatile的视觉语言模型。

BotChat - 创新评估大语言模型多轮对话能力的基准

BotChat BenchmarkGPT-4GithubLLM对话生成开源项目评估

BotChat基准测试通过分析大语言模型生成的对话评估多轮聊天能力。基于MuTual-Test数据集,该项目生成了大规模模型对话数据,并采用单轮评估、BotChat Arena和人类对话对比等方法全面评估主流LLM对话质量。研究发现GPT-4表现最佳,部分小型开源模型在短对话中也有不错表现。这一创新基准为改进LLM对话能力提供了新思路。

VideoTuna - 多模型集成的AI生成解决方案

AI视频生成GithubVideoTuna图像到视频开源项目文本到视频视频自动化

VideoTuna项目集成多种AI视频生成模型，支持从文本到视频、图像到视频及文本到图像的生成任务。该项目提供全方位的视频生成流程，涵盖预训练、持续训练、后续对齐和微调操作。平台包含U-Net与DiT结构的生成模型，并推出3D视频VAE和可控人脸视频生成模型，为开发者提供提升视频生成自动化和效果的工具。

ChatGPT-Telegram-Bot - 使用GPT模型的Telegram机器人

ChatGPT Telegram BotGPT模型Github多模态问答开源项目插件系统迁移部署

ChatGPT-Telegram-Bot利用最新的GPT模型（包括GPT-3.5、GPT-4等），提供多模态问答功能，支持语音、音频、图像及文档查询。具备多语言界面和插件系统，适用于群聊模式及消息异步处理，并支持自动生成后续问题和多用户对话隔离。该机器人可通过Docker、Koyeb、Zeabur及Replit等平台进行一键部署。

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号