Project Icon

V-Express

渐进式训练提升肖像视频生成质量

V-Express项目提出条件性丢弃新方法,实现肖像视频生成的渐进式训练。该方法平衡不同控制信号强度,增强音频等弱信号作用,同时考虑姿态、图像和音频,生成高质量肖像视频。项目优化内存使用,支持长视频生成,提供多种重定向策略,适用不同场景。开源代码和模型可供学术及商业用途,但使用时需遵守相关法规。

audio2photoreal - AI驱动的音频转人物对话视频技术
AI合成Github对话场景开源项目深度学习计算机视觉音频到真人化身
audio2photoreal项目实现了音频到逼真人物对话视频的自动转换。该开源项目集成了面部表情和全身动作生成模型,能根据音频输入合成自然的人物表情和动作。项目提供预训练模型、训练代码和数据集,便于研究者复现和改进。这一技术为虚拟人物制作和视频合成领域开辟了新的可能性。
first-order-model - First Order Motion Model:图像动画的高效解决方案
DockerFirst Order Motion ModelGithubPython图像动画开源项目数据集
First Order Motion Model项目提供了一种先进的图像动画运动模型,通过驾驶视频和源图像生成逼真的动画序列。支持包括VoxCeleb、Fashion和MGIF在内的多种数据集,提供详细的安装和使用指南。项目支持Python和Docker,确保了环境兼容性,还提供Colab和Kaggle的在线演示。此外,该项目还具备面部交换功能,适用于监督和非监督的视频编辑任务。
SyncTalk - 同步技术驱动的高质量说话头像合成
CVPRGithubSyncTalk人工智能头像合成开源项目计算机视觉
SyncTalk项目通过三平面哈希表示法实现高度同步的说话头像视频合成。该技术生成同步的唇部运动、面部表情和稳定的头部姿势,同时还原发型细节,创造高分辨率视频。在保持人物身份的同时,项目显著提升了说话头像的自然度和真实感。
XMem - 长时视频对象分割的解决方案,基于人类多尺度记忆模型
Atkinson-Shiffrin记忆模型ECCVGPU内存优化GithubXMem开源项目视频对象分割
XMem项目采用Atkinson-Shiffrin记忆模型,提供了一种全新的视频对象分割(VOS)方法。通过结合不同时间尺度的记忆单元,有效避免在处理长时视频时出现的计算和GPU内存问题。XMem可处理超过10000帧的视频,在有限GPU资源下仍保持高效,处理速度达每秒20帧,并附带简化版GUI。项目中还提供了详细的训练和推理指南,适用于实验和实际应用。
PIDM - 人像图像生成技术,支持姿态和外观定制
本项目采用去噪扩散模型实现高质量人像图像生成,并支持姿态和外观控制。经过在DeepFashion数据集的训练,该方法可在5天内利用多GPU实现高精度样本生成。提供预训练模型下载和详细的训练与推理指南,支持自定义数据集。实验比较显示,该模型在多种先进方法中表现优异。相关代码和生成结果可在GitHub及Google Colab中体验。
CVPR2022-DaGAN - 基于深度感知的说话头像视频生成技术
DaGANGithub人工智能对抗生成网络开源项目深度感知视频生成
DaGAN是一种新型深度感知生成对抗网络,旨在生成高质量的说话头像视频。该方法利用面部深度信息提升生成效果,可适用于卡通和真人头像。在VoxCeleb1数据集上,DaGAN展现出优异性能。项目开源了预训练模型、在线演示和训练代码,便于研究复现。作为CVPR 2022的成果,DaGAN代表了说话头像生成领域的重要进展。
VILA - 创新的视觉语言模型预训练方法
GithubVILA多模态开源项目视觉语言模型量化预训练
VILA是一种新型视觉语言模型,采用大规模交错图像-文本数据预训练,增强了视频和多图像理解能力。通过AWQ 4位量化和TinyChat框架,VILA可部署到边缘设备。该模型在视频推理、上下文学习和视觉思维链等方面表现出色,并在多项基准测试中获得了优异成绩。项目完全开源,包括训练和评估代码、数据集以及模型检查点。
StoryDiffusion - 实现长序列图像和视频的一致性生成
AI生成GithubStoryDiffusion一致性自注意力开源项目长序列图像生成长视频生成
StoryDiffusion是一个专注于长序列图像和视频生成的AI项目。该项目采用一致性自注意力机制,实现角色连贯的图像生成,并通过运动预测器在压缩图像语义空间中预测条件图像间的运动。StoryDiffusion不仅能生成连贯的漫画,还可创作长时间、高质量的视频,为故事创作和视觉内容生成提供了新的技术方案。
SpecVQGAN - 使用视觉提示生成高保真声音的方法
GithubSpecVQGANTransformer代码本声谱图开源项目训练模型
SpecVQGAN项目提出了一种利用视觉提示生成声音的方法。通过将训练数据集缩小到一组代表向量(代码本),这些代码本向量可被控地进行采样,从而根据视觉提示生成新声音。项目使用VQGAN的训练方法在频谱图上训练代码本,并通过GPT-2变体的transformer在视觉特征条件下自回归地采样代码本条目。这种方法可以生成长时间、相关且高保真的声音,并支持多种数据类别。
sd-vae-ft-mse - 改进稳定扩散自编码器提升图像重建效果
GithubHuggingfaceStable Diffusion图像生成开源项目模型模型微调深度学习自动编码器
sd-vae-ft-mse是一款经过微调的稳定扩散自编码器,在LAION-Aesthetics和LAION-Humans数据集上训练。该模型旨在提高图像重建质量,尤其是人脸细节。相比原始模型,它在PSNR和SSIM等指标上有明显提升,能够生成更平滑的图像。该模型可作为VAE组件轻松集成到现有的diffusers工作流中,用于稳定扩散图像生成。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

白日梦AI

白日梦AI提供专注于AI视频生成的多样化功能,包括文生视频、动态画面和形象生成等,帮助用户快速上手,创造专业级内容。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

讯飞绘镜

讯飞绘镜是一个支持从创意到完整视频创作的智能平台,用户可以快速生成视频素材并创作独特的音乐视频和故事。平台提供多样化的主题和精选作品,帮助用户探索创意灵感。

Project Cover

讯飞文书

讯飞文书依托讯飞星火大模型,为文书写作者提供从素材筹备到稿件撰写及审稿的全程支持。通过录音智记和以稿写稿等功能,满足事务性工作的高频需求,帮助撰稿人节省精力,提高效率,优化工作与生活。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号