Project Icon

make-a-video-pytorch

基于 PyTorch 的最新文本到视频生成器

此项目实现了 Meta AI 的 Make-A-Video 在 PyTorch 下的版本,利用伪 3D 卷积和时序注意力技术,显著增强了视频的时序一致性。支持图像和视频帧的处理,并且可轻松适用于 DALL-E2 和 Imagen 等模型。项目提供了完整的安装和使用指南,并支持空间和时间一致性的 Unet 模型。

LaVie - 级联潜在扩散模型实现高质量视频生成
AI视频制作GithubLaVie开源项目文本生成视频潜在扩散模型视频生成
LaVie是一个基于级联潜在扩散模型的文本到视频生成框架。它通过基础模型生成、视频插值和超分辨率三个步骤,可生成16至61帧、最高1280x2048分辨率的高质量视频。该框架支持多种采样方法和参数调整,用户可通过简单命令生成不同风格视频。LaVie开源了模型代码和预训练权重,便于学术研究和商业应用。
DALLE2-pytorch - Pytorch实现的OpenAI DALL-E 2
DALL-E 2GithubPytorch开源项目文本到图像神经网络自监督学习
DALL-E 2的Pytorch实现由OpenAI开发,采用先进的神经网络技术将文本描述转化为高质量图像。本版本特别优化扩散先验网络,提供高性能的模型变体。开源项目鼓励开发者通过GitHub和Hugging Face参与贡献,并在Discord社区进行交流和支持。
stable-video-diffusion-img2vid-xt-1-1 - 高性能图片转视频生成模型,支持1024x576像素视频制作
GithubHuggingfaceStable Video Diffusion人工智能模型商业授权图像转视频开源项目模型生成式AI
Stable Video Diffusion 1.1是Stability AI开发的图像生成视频AI模型,基于SVD Image-to-Video [25 frames]优化而来。它可将单张图片转换为25帧、1024x576分辨率的短视频,采用6FPS帧率和Motion Bucket Id 127参数,输出效果比1.0版本更稳定。该模型适用于艺术创作、教育等领域,支持非商业和商业用途。用户可通过Stability AI的generative-models仓库获取和使用该模型。
MotionGPT - 文本转动作生成的通用平台
GithubLLaMAMotionGPTPyTorchfinetuning开源项目模型评估
MotionGPT是通过微调大型语言模型(LLMs)来实现通用运动生成的开源项目。项目提供详细的安装指南、预训练模型及数据集应用实例,支持高效的文本到动作转换及生成。用户可以轻松实现姿态可视化和SMPL网格渲染。项目页面详细介绍了多种使用场景,适用于各种运动生成需求。
Dream Machine AI - AI视频创作平台 文本图像快速转化高质量视频
AI工具AI视频生成Luma Dream Machine图像转视频文本转视频高质量视频
Dream Machine AI是一个先进的AI视频生成平台,可将文本和图像快速转换为高质量、逼真的视频。平台采用先进的变换器模型,每120秒可生成120帧视频。它能处理复杂的时空动作,确保视频内容物理准确且连贯一致,同时保持角色一致性,模拟真实世界物理特征,呈现自然流畅的镜头移动。目前平台免费开放,支持创建多种类型的高质量AI视频。
sd-webui-text2video - 基于Auto1111的多样化text2video模型实现
GithubLoRAModelScopeStableDiffusion WebUIText2videoVideoCrafter开源项目
基于Auto1111的webui依赖,该扩展实现了ModelScope和VideoCrafter等text2video模型,无需登录即可使用。要求至少6GB的VRAM,支持不同帧数和分辨率的视频生成。项目包含多次更新,新增功能如VAE设置、提示权重和WebAPI,并支持LoRA训练。提供详细的模型下载指南,并欢迎社区的贡献与支持。
StableVideo - 通过文本驱动实现一致性扩散的视频编辑技术
GithubHuggingFaceStableVideodiffusion开源项目文本驱动视频编辑
StableVideo 通过采用最新的文本驱动一致性扩散算法,提供了创新的视频编辑技术。用户可以下载预训练模型和示例视频,用于视频帧的编辑和渲染。该工具支持多种配置,提供详细的安装和运行指南,便于在本地进行实验。借助 ControlNet 和 Text2LIVE 等开源资源,StableVideo 展示了其在视频处理领域的强大应用潜力。如果该项目对研究有帮助,请参考相关学术论文。
EasyAnimate - 基于Transformer的高分辨率长视频生成框架
AI绘图EasyAnimateGithub开源项目深度学习视频生成计算机视觉
EasyAnimate是一个开源的高分辨率长视频生成框架。该项目基于Transformer架构,采用类Sora结构和DIT技术,使用Transformer作为视频生成的扩散器。EasyAnimate支持训练扩散模型生成器、处理长视频的VAE和元数据预处理。用户可直接使用预训练模型生成多种分辨率的6秒24帧视频,也可训练自定义基线模型和Lora模型实现特定风格转换。
DALLE-pytorch - 文本到图像转换的先进实现
DALL-EGithubPytorch图像生成开源项目文本到图像转换自动编码器
基于OpenAI的DALL-E以及CLIP技术,DALLE-pytorch是一种开源的AI解决方案,可将文本高效转化为图像。该工具在Pytorch框架下开发,支持包括OpenAI预训练的VAE在内的多种训练模式。DALLE-pytorch不仅采用了深度可逆网络和稀疏注意力技术,而且提供了高灵活性和可扩展性,适合多种数据集。
ShortVideoGen - 高效AI短视频生成平台
AI工具ShortVideoGen人工智能文本转视频短视频生成订阅计划
ShortVideoGen是一个创新的text to video平台,结合先进的AI Video Generator技术,将文本快速转化为带音频的短视频。用户只需三步即可完成创作:输入文本、自定义参数、生成视频。平台提供多种订阅选项,适应不同需求。网站还展示了多样化的视频示例,突显其广泛应用价值。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号