Project Icon

video-diffusion-pytorch

开源项目实现文本到视频生成新突破

video-diffusion-pytorch项目实现了基于扩散模型的文本到视频生成技术。该开源项目采用时空分解U-net结构,将2D图像生成扩展至3D视频领域。支持文本条件生成、BERT编码和批量训练等功能。目前在移动MNIST数据集上表现良好,为研究人员和开发者提供了探索视频生成新前沿的工具。该技术有望在复杂视频生成任务中取得进展。

AnimateDiff - 为文本到图像模型赋予动画生成能力的即插即用模块
AnimateDiffGithub开源项目文本生成动画社区模型稳定扩散运动模块
AnimateDiff是一个即插即用模块,可将文本到图像模型转变为动画生成器,无需额外训练。通过学习可迁移的运动先验,它适用于Stable Diffusion系列的多种变体。该项目支持使用社区模型生成动画、MotionLoRA控制以及SparseCtrl RGB和草图控制等功能。AnimateDiff增强了文本到视频模型的控制能力,能生成高质量动画。
audio-diffusion - 使用Hugging Face扩散器包应用扩散模型以合成音乐
GithubHugging Faceaudio-diffusiondiffusion modelsmel spectrogram开源项目生成音频
audio-diffusion项目使用Hugging Face的diffusers包,将扩散模型应用在音乐合成领域,不再局限于图像生成。项目介绍了条件音频生成、预训练模型的使用、Mel谱图处理,在谷歌Colab和本地环境下的训练方法。项目包含实际案例和最新更新,展示了如何用扩散模型生成和插值音频。此外,还提供了从音频文件生成Mel谱图数据集的详细指南,涵盖多种技术细节和操作方法。
Latte - 创新的潜在扩散Transformer视频生成技术
AI模型GithubLatteTransformer开源项目深度学习视频生成
Latte是一种新型视频生成模型,采用潜在扩散Transformer技术。该模型在多个标准数据集上表现优异,并支持文本到视频的生成。项目提供PyTorch实现、预训练模型和相关代码,为视频生成研究提供了重要参考。Latte在建模视频分布方面采用了创新方法,为未来研究提供了新的思路。
stable-diffusion-2-1-base - 基于稳定扩散技术的高质量文本到图像生成模型
GithubHuggingfaceStable Diffusion人工智能绘图开源项目文本生成图像模型深度学习计算机视觉
stable-diffusion-2-1-base是Stability AI开发的文本到图像生成模型,基于潜在扩散技术。该模型在大规模图像数据集上训练,可根据文本提示生成512x512分辨率的高质量图像。相比之前版本,2.1版本在图像质量和文本理解能力上有所提升。模型适用于艺术创作、设计辅助等场景,可通过Hugging Face Diffusers库轻松使用。
XXMix_9realistic_v1 - 基于diffusers的高质文本到图像转换模型
GithubHuggingfacestable-diffusionstable-diffusion-diffuserstext-to-image头像开源项目模型模型信息
该项目利用stable-diffusion和diffusers技术,将文本转换为逼真的图像,展现动态光影效果,同时融入多位知名艺术家的风格,提供丰富的视觉体验。
DiffusionFromScratch - 实践教程:从零构建和训练稳定扩散模型
GithubStable DiffusionUNet图像生成开源项目教程机器学习
DiffusionFromScratch是一个开源项目,提供精简代码库用于重建稳定扩散模型。项目特点包括单Python脚本实现、支持MNIST和CelebA数据集训练,以及提供多个Colab笔记本。这些笔记本涵盖模型架构探索、UNet模型构建和基于文本生成MNIST图像等内容。项目还展示了演示输出和音乐视频生成示例,为学习稳定扩散模型提供了实用资源。
diffusers - 模块化的预训练扩散模型库,支持图像、音频和3D结构生成
DiffusersGithubHuggingFace图像生成开源项目音频生成预训练扩散模型
🤗 Diffusers 是一个生成图像、音频和3D结构的预训练扩散模型库,提供易用的推理管道和可定制的模型组件。它支持多种调度器和预训练模型,适用于多种任务和应用场景,并兼容 PyTorch 和 Flax 框架。用户可以简单生成内容或训练自定义扩散模型。
scoresdeve-ema-celeba-64 - 无条件图像生成的高效DiffusionPipeline
AI绘图DiffusersGithubHuggingfaceunconditional-image-generation图像生成开源项目模型模型推理
该项目通过diffusers库的DiffusionPipeline实现无条件图像生成,使用eurecom-ds/celeba数据集,并兼容CUDA设备,提供了加载预训练模型和生成图像的高效方案。模型通过固定种子实现一致的推理输出,适用于AI研究和开发。用户可以自定义推理步骤,满足不同场景下的图像生成需求,拓展计算机视觉应用。
realistic-vision-v12 - 基于文本生成逼真图像的新技术
AI绘图GithubHuggingfaceRealistic Visiondiffusersstable-diffusion图像生成开源项目模型
Realistic Vision 1.2结合稳定扩散技术和diffusers库,从文本生成高质量的逼真图像。采用CreativeML-OpenRAIL-M许可证,项目为数字创作提供了灵活性和创新性。通过简单的文本提示,用户可以生成多种符合视觉需求的图像,适用于多个创意领域。
CVPR23_LFDM - 潜在流扩散模型实现条件图像到视频生成
GithubLFDM图像到视频生成开源项目条件生成深度学习潜在流扩散模型
CVPR23_LFDM项目提出了一种基于潜在流扩散模型的条件图像到视频生成方法。该方法在MUG、MHAD和NATOPS数据集上展示了生成流畅自然的人脸表情和人体动作视频的能力。项目开源了预训练模型、演示代码和详细的模型训练流程,为计算机视觉研究提供了有价值的资源。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计 是一个多功能的在线设计和创意平台,提供广泛的设计工具和资源,以满足不同用户的需求。从专业的图形设计师到普通用户,无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑,稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合,帮助用户轻松实现创意设计。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号