StreamingT2V

先进的长视频生成技术实现连贯动态和可扩展内容

StreamingT2V 长视频生成文本到视频一致性动态视频 Github 开源项目

StreamingT2V是一种创新的自回归技术，专门用于生成长时间、连贯一致的视频内容。该技术无需分段处理即可创建动态丰富的视频，确保了时间上的连贯性，同时保持与文本描述的高度契合和单帧图像的优质表现。目前已实现生成1200帧（约2分钟）的视频，并具有进一步延长的潜力。值得注意的是，StreamingT2V的性能不局限于特定的文本到视频模型，这意味着随着基础模型的进步，视频质量有望进一步提升。

访问官网

Github

Huggingface

介绍相关项目

Latte - 创新的潜在扩散Transformer视频生成技术

AI模型GithubLatteTransformer开源项目深度学习视频生成

Latte是一种新型视频生成模型，采用潜在扩散Transformer技术。该模型在多个标准数据集上表现优异，并支持文本到视频的生成。项目提供PyTorch实现、预训练模型和相关代码，为视频生成研究提供了重要参考。Latte在建模视频分布方面采用了创新方法，为未来研究提供了新的思路。

VGen - 多功能开源视频生成工具库

AI模型GithubVGen开源项目视频生成阿里巴巴

VGen是一个功能丰富的开源视频生成工具库。它整合了多个先进的视频生成模型，可根据文本、图像、动作和主体等输入创建高质量视频。VGen提供可视化、采样、训练和推理等实用工具，支持图像到视频、文本到视频等多种任务。该项目具有良好的扩展性和完整性，由阿里巴巴集团通义实验室开发。

Story2Video - 一键将文字故事转换成高质量2K社交媒体视频

2K视频AI工具Story2Video社交媒体视频视频制作视频定制

Story2Video是一款创新的在线工具，能将文字故事转换为高质量2K社交媒体视频。该平台提供多项定制功能，包括背景、语言、声音和文本样式调整，用户可在短时间内完成个性化设置。此外，Story2Video还配备了实时进度追踪功能，方便用户随时查看视频制作状态。这一工具适合需要在社交媒体上分享引人注目视频内容的个人和企业用户。

SEINE - 短视频到长视频生成的SEINE模型，支持生成过渡效果和视频预测

GithubSEINEStable DiffusionVchitect开源项目视频扩散模型视频生成

SEINE模型是一个专为短视频到长视频生成设计的视频扩散模型，支持过渡效果和视频预测。作为Vchitect视频生成系统的一部分，SEINE基于稳定扩散v1.4模型，支持从文本生成视频的框架LaVie。用户通过配置脚本可生成不同条件下的视频，文档中提供了详细的设置和使用说明。项目提供模型下载链接，并展示了实际的输入图像和输出视频效果。代码以Apache-2.0开源许可发布，可用于学术研究和商业用途。

Comprehensive-Transformer-TTS - 基于非自回归 Transformer 的 TTS

GithubPyTorchTTS开源项目持续时间建模语音合成非自回归变换器

该项目采用非自回归Transformer技术，集成多种最新状态转换模型。Comprehensive-Transformer-TTS不仅提供监督与非监督持续时间建模, 也支持多种数据集和SOTA技术，如Fastformer和Long-Short Transformer，力求在文本到语音转换领域取得领先成果。

generative-models - SV4D与SV3D一类的创新模型

GithubSDXL-TurboSV3DSV4D开源项目热门稳定AI视频合成

Generative Models项目展示了多个创新模型如SV4D与SV3D，专注于视频到4D扩散建模和图像到视频的多视角合成，旨在提供高分辨率和时间连贯性的研究工具。最新技术报告和视频概览现已发布，支持通过简单的脚本和快速入门指南直接体验模型效果，适用于研究及教育用途。

ComfyUI-I2VGenXL - I2VGenXL 模型为 ComfyUI 带来高清视频生成新体验

AI模型ComfyUIGithubI2VGenXL图像转视频开源项目视频生成

ComfyUI-I2VGenXL 项目将 I2VGenXL 模型集成到 ComfyUI 中，实现高质量视频生成。该项目支持 1280*704 分辨率输出，通过正负提示词控制生成过程。其自然动效和优质光影效果使其成为当前表现出色的高清视频模型。项目设计了标准工作流，支持文生视频和图生视频，并集成自动补帧功能，为视频创作提供完整解决方案。

FreeNoise - 通过噪声重新调度实现无调谐的更长视频传播

FreeNoiseGithubLongerCrafter噪声重排开源项目无调优视频生成

FreeNoise是一种基于噪声重调的无调参长视频生成方法，不需要调参，仅需增加不到20%的时间即可实现高质量、长时间视频生成，支持多达512帧。该方法兼容VideoCrafter2、AnimateDiff和LaVie等视频框架，支持单一和多提示词的文本转视频生成，最新支持256x256分辨率。详情请参见项目页面和arXiv论文。

VideoBooth - 基于图像提示的AI视频生成新突破

GithubVideoBooth人工智能图像提示开源项目扩散模型视频生成

VideoBooth是一个AI视频生成项目，利用扩散模型技术基于图像提示创建视频。该项目将静态图像主体转化为动态视频，实现图像到视频的转换。VideoBooth采用两阶段训练方法，提供安装、推理和训练指南。项目还公开了专门数据集，为研究提供资源。

CogVideoX-5b-I2V - 开源图像到视频生成模型支持多种精度和量化推理

AI模型CogVideoXGithubHuggingface图像到视频开源项目模型深度学习视频生成

CogVideoX-5b-I2V是一个开源的图像到视频生成模型，参数规模为5B。该模型可生成6秒长、8帧/秒、720x480分辨率的视频，支持多种精度和量化推理。通过diffusers库可快速部署，单GPU运行时内存占用较低。模型提供量化推理功能，适用于小内存GPU，并可通过torch.compile加速。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号