dolphin

通用视频互动平台，基于大型语言模型的视频理解、处理与生成

Dolphin 视频理解视频处理视频生成大型语言模型 Github 开源项目

Dolphin是一个基于大型语言模型的通用视频互动平台，专注于视频理解、处理和生成。该平台支持视频问答、视频剪辑、字幕添加、音频提取及生成等功能，旨在提升视频处理的智能化水平。用户可通过文本生成视频、姿态到视频转换及视频图像转换等多种方式进行创作。项目持续更新，欢迎社区贡献和拉取请求，适用于北航和南洋理工大学的科研项目。

访问官网

Github

介绍相关项目

DOVER - 创新解耦视频质量评估方法

DOVERGithub开源项目深度学习用户生成内容美学和技术评估视频质量评估

DOVER是一种创新的视频质量评估方法,将审美和技术两个维度解耦,为用户生成内容提供全面评估。该方法从现有UGC-VQA数据集中分离这两个维度,并提供了包括轻量级DOVER-Mobile在内的多个版本。项目开源了代码、演示和权重,支持单视频和批量视频集评估,并提供了详细的安装使用说明。DOVER在多个基准数据集上取得了领先性能,为视频质量评估领域带来了新的研究方向。

dolphin-2.6-mistral-7B-GGUF - 兼容多平台的量化AI模型格式

Dolphin 2.6 Mistral 7BGithubHuggingface开源项目文件下载模型模型兼容性深度学习框架量化

该项目提供多平台兼容的GGUF格式模型文件，包括对GGML的量化替代方案，支持多种比特量化，适用于Windows、Linux和macOS平台的模型推理和GPU加速。用户可以选择合适的量化参数文件，并通过多种工具和命令行进行下载和运行，提升模型推理性能。

Deepdub - 专业AI视频配音与本地化平台

AI工具AI配音内容全球化多语言本地化语音克隆音频处理

Deepdub平台运用先进AI技术为影视内容提供多语言配音服务。集成语音克隆和情感文本转语音功能，显著提升配音效率与质量。其在线协作工作室支持80多种语言的转录和配音，助力内容快速进入全球市场。该AI配音平台采用创新技术，为影视作品提供高质量多语言配音。通过语音克隆和情感文本转语音功能，大幅提高配音效率。在线协作工作室支持80余种语言，加速内容国际化进程。

AVDC - 从无动作视频学习行为的AI训练框架

AVDCGithub实验代码开源项目无动作视频深度对应视频策略训练

AVDC是一个创新的AI训练框架，能够从无动作视频中学习行为策略。该项目支持Meta-World、iTHOR等多个环境，提供完整的代码库、预训练模型和详细文档。AVDC具有灵活的训练和推理功能，方便研究人员快速上手和复现实验结果，为计算机视觉和机器人学习领域带来新的可能性。

VideoSage - 视频内容智能分析与互动问答平台

AI工具Moonshot Kimi AIVideoSage人工智能用户交互视频分析

VideoSage是一个基于Moonshot Kimi AI技术的智能视频分析平台。该平台提供AI视频分析、智能问答和长视频观看优化等功能，支持用户在观看过程中与AI实时交互，获取精准答复和深度分析。VideoSage不仅提供视频摘要、洞察和时间戳，还能回答关于视频的各种问题，显著改善长视频观看体验。平台以其高准确性和强互动性为特色，致力于为个人用户打造流畅的视频观看环境，通过丰富的工具和功能，实现观看体验的个性化和增强。

VideoElevator - 融合文本到图像技术提升AI视频生成质量

GithubVideoElevator开源项目扩散模型文本到图像文本到视频视频生成

VideoElevator是一个开源的AI视频生成项目，通过结合文本到图像和文本到视频的扩散模型来提升生成视频的质量。该项目采用免训练、即插即用的方法，将视频生成过程分为时间运动细化和空间质量提升两个阶段。VideoElevator能在11GB以下显存的GPU上运行，支持多种扩散模型的协作，为高质量AI视频生成提供了新的解决方案。

CogVideo - 开源视频生成模型，支持高效单GPU推理

CogVideoXGithubICLR'23开源项目文本到视频视频生成

CogVideoX和CogVideo通过大规模预训练模型和3D因果VAE技术，实现高质量的文本到视频生成。CogVideoX-2B可在单个3090 GPU上进行推理，生成效果几乎无损。提供详尽的快速入门指南、模型结构介绍和使用案例。探索CogVideoX和CogVideo在Huggingface、WeChat、Discord等平台上的应用，获取更多技术细节和更新。

SubtitleDog - 多语言视频字幕生成与翻译的AI解决方案

AI工具AI翻译GPU加速多语言支持字幕生成器隐私保护

SubtitleDog是一款AI驱动的视频字幕生成和翻译工具，支持100多种语言。它使用大语言模型提高翻译准确性，并通过GPU加速、人声分离和智能增强算法优化处理效率。该工具支持批量处理、字幕编辑，并保护用户隐私。SubtitleDog为视频制作者提供高效、准确且经济实惠的字幕解决方案。

dreamtalk - 音频驱动的表情丰富说话头像生成系统

AI表情生成DreamTalkGithub开源项目扩散模型生成说话人头像音频驱动

DreamTalk是一个创新的音频驱动说话头像生成系统，采用扩散概率模型技术。该系统能生成高质量、表情丰富的说话头像视频，适应多种说话风格。DreamTalk在处理歌曲、多语言语音、噪声音频和非常规肖像等多样化输入时表现优异。通过结合扩散概率模型，DreamTalk实现了准确的唇形同步和生动的面部表情，为不同说话风格提供了灵活支持。

ChatGpt Sora - 基于Sora模型的开源平台实现文本到视频转换

AI工具AI视频创作ChatGpt SoraOpenAISora模型文本生成视频

ChatGpt Sora是一个基于OpenAI Sora模型的开源平台，实现文本到视频的转换。平台提供直观的界面，用户只需输入文本即可生成高质量视频。适用于专业人士和爱好者，简化视频制作流程。虽然Sora模型尚未公开，ChatGpt Sora通过模拟API为开发者提供测试环境。该平台展示了AI在视频生成领域的应用潜力，为创作者提供了探索OpenAI Sora技术的机会。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号