AVDC

从无动作视频学习行为的AI训练框架

AVDC是一个创新的AI训练框架，能够从无动作视频中学习行为策略。该项目支持Meta-World、iTHOR等多个环境，提供完整的代码库、预训练模型和详细文档。AVDC具有灵活的训练和推理功能，方便研究人员快速上手和复现实验结果，为计算机视觉和机器人学习领域带来新的可能性。

访问官网

文档

Awesome-Video-Diffusion - 人工智能视频生成与编辑技术资源大全

AI视频Github开源项目扩散模型文本到视频视频生成视频编辑

本文汇集了视频生成、编辑、修复和理解领域的最新扩散模型研究。内容包括开源工具箱、基础模型、评估基准和指标等。涵盖基础视频生成、可控生成、长视频生成、3D视频生成等多个方向，为视频AI技术研究和开发提供全面参考。

LaVIT - 大语言模型理解生成视觉内容的统一框架

GithubLaVIT多模态大语言模型开源项目视觉内容理解视觉内容生成预训练策略

LaVIT项目是一个创新的多模态预训练框架，旨在增强大语言模型处理视觉内容的能力。该项目通过动态离散视觉标记化技术，将图像和视频转换为离散标记序列，使大语言模型能够理解和生成视觉内容。LaVIT支持图像和视频的理解、生成，以及多模态提示生成，为计算机视觉和自然语言处理的融合提供了新的可能性。

openvla-7b - 基于视觉和语言的开源机器人动作生成模型

GithubHuggingfaceOpenVLA图像文本处理开源项目机器人控制机器学习模型视觉语言行为模型

OpenVLA-7B是一个开源的视觉-语言-动作模型，基于97万个机器人操作数据训练。该模型将语言指令和摄像机图像转化为机器人动作，支持多种机器人控制，并可通过微调适应新任务。OpenVLA-7B采用MIT许可证，适用于零样本指令执行和新领域迁移。

LLaVA-NeXT-Video-7B-hf - 先进多模态AI模型实现视频和图像理解

GithubHuggingfaceLLaVA-NeXT-Video人工智能多模态大语言模型开源项目模型视频理解

LLaVA-NeXT-Video-7B-hf是一个开源多模态AI模型，通过视频和图像数据的混合微调，实现了出色的视频理解能力。该模型支持多视觉输入和多提示生成，在VideoMME基准测试中表现优异。基于Vicuna-7B语言模型，可处理视频问答和图像描述等视觉任务。模型支持4位量化和Flash Attention 2优化，提供灵活高效的使用方式。

computer-vision-in-action - 计算机视觉实战指南：涵盖基础理论及前沿技术

CharmveGithubL0CVMaiwei AI Lab开源项目机器学习计算机视觉

本项目提供全面且前沿的计算机视觉学习资源，涵盖深度学习基础、神经网络模型及其优化方法。核心内容包括卷积神经网络、循环神经网络以及现代技术如Transformer、强化学习和迁移学习。通过实战项目和详细的代码实现，用户可以学习图像分类、目标检测、语义分割和3D重建等应用。此外，项目提供在线运行的notebook，简化本地调试过程。

videocomposer - 灵活可控的视频合成与运动模式生成工具

AI生成GithubVideoComposer动作控制开源项目扩散模型视频合成

VideoComposer是一个开源的视频合成模型，能够同时控制生成视频的空间和时间特征。它支持文本、草图、参考视频等多种输入形式，为用户提供灵活的创作方式。项目包含预训练模型和用户界面，便于研究人员和开发者进行视频合成实验。

magvit - 单模型实现多种视频合成任务的创新技术

GithubMAGVIT开源项目机器学习深度学习视频生成计算机视觉

MAGVIT是一种创新的视频生成技术，采用掩码生成视频变换器实现单一模型解决多种视频合成任务。该项目在视频生成质量、效率和灵活性方面表现出色，能够执行类别条件生成、帧预测和多任务视频处理。MAGVIT在UCF-101、BAIR Robot Pushing、Kinetics-600等多个基准测试中取得优异成绩，展示了其在视频生成领域的应用前景。

VTimeLLM - 创新视频大语言模型实现精准时刻理解

GithubVTimeLLM多阶段训练大语言模型开源项目时间边界感知视频理解

VTimeLLM是一种先进的视频大语言模型，专注于精细化视频时刻理解和推理。该模型采用边界感知三阶段训练策略，包括图像-文本特征对齐、多事件视频时间边界识别和高质量视频指令微调。这种方法显著提升了模型的时间理解能力，使其在多项视频理解任务中表现优异。

DynamiCrafter - 将开放域图像转化为动态视频的AI动画工具

AI动画DynamiCrafterGithub图像动画化开源项目视频插帧视频生成

DynamiCrafter是一个图像动画化项目,能够基于文本提示将静态图像转换为动态视频。该项目利用预训练的视频扩散模型,生成高分辨率、连贯性强的动画。除了基础的图像动画化功能,DynamiCrafter还支持故事视频生成、帧插值和循环视频生成等应用。该项目在ECCV 2024会议上进行了口头报告,并在多项图像到视频生成基准测试中表现出色。

motionagent - AI视频自动生成平台

GithubMotionAgent图像生成开源项目脚本生成视频生成音乐生成

MotionAgent是一个基于深度学习的视频生成工具，集成了脚本创作、场景图生成、视频制作和背景音乐创作功能。该工具支持根据指定主题自动生成脚本，可生成高分辨率视频和自定义风格背景音乐。MotionAgent基于ModelScope开源模型社区开发，为视频创作提供了自动化解决方案。

相关项目

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

白日梦AI

白日梦AI提供专注于AI视频生成的多样化功能，包括文生视频、动态画面和形象生成等，帮助用户快速上手，创造专业级内容。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

讯飞绘镜

讯飞绘镜是一个支持从创意到完整视频创作的智能平台，用户可以快速生成视频素材并创作独特的音乐视频和故事。平台提供多样化的主题和精选作品，帮助用户探索创意灵感。

讯飞文书

讯飞文书依托讯飞星火大模型，为文书写作者提供从素材筹备到稿件撰写及审稿的全程支持。通过录音智记和以稿写稿等功能，满足事务性工作的高频需求，帮助撰稿人节省精力，提高效率，优化工作与生活。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com