Project Icon

Collaborative-Diffusion

多模态控制的面部生成与编辑,协作扩散模型

Collaborative Diffusion项目展示了如何通过多模态控制生成和编辑面部图像,保证生成结果与输入条件一致。该项目使用动态扩散器在每一步选择性处理不同模态,确保身份信息的准确性。最新更新包括对FreeU的支持、单模态面部生成推理脚本,以及适用于不同分辨率的模型训练和推理代码,满足多样化应用需求。

stable-diffusion-v1-5 - 文本到图像生成的多平台兼容潜在扩散模型
AI绘图GithubHuggingfaceStable Diffusion开源项目文本到图像模型生成对抗网络生成艺术
Stable Diffusion v1-5 是一个使用潜在扩散技术的文本到图像生成模型,可生成高逼真度的图像。该模型经过多次优化与微调,兼容Diffusers库及多种用户界面,强调安全性并配备NSFW检查器,适用于研究、艺术创作及设计领域。此模型针对不同GPU环境设计,具有高效的生成性能。
FontDiffuser - 多尺度内容聚合与风格对比学习的字体生成模型
AAAI2024AI字体生成FontDiffuserGithub一次性生成开源项目扩散模型
FontDiffuser是一个基于多尺度内容聚合和风格对比学习的字体生成模型。它能够生成新颖字符和风格,支持跨语言生成(如中文到韩文)。该模型在处理复杂字符和大幅风格变化方面表现优异,达到了领先水平。FontDiffuser生成的结果可与InstructPix2Pix结合用于进一步装饰。项目开源并提供在线演示。
DiffGesture - 音频驱动协同语音手势生成的扩散模型框架
AI动画Github开源项目扩散模型计算机视觉语音驱动手势生成跨模态学习
DiffGesture是一个基于扩散模型的框架,旨在生成与音频同步的协同语音手势。该框架通过扩散条件生成过程和音频-手势变换器捕捉跨模态关联,并使用手势稳定器和无分类器引导保持时间一致性。DiffGesture生成的手势具有良好的模式覆盖和音频相关性,在多个数据集上展现出优秀性能。
stable-diffusion-2-1-unclip - 基于文本和图像嵌入的Stable Diffusion 2.1增强版
GithubHuggingfaceStable Diffusion图像生成开源项目模型模型卡训练数据限制与偏见
Stable Diffusion 2.1的增强版可接受CLIP图像嵌入并生成图像变体,通过噪声水平调节控制。适用于艺术创作、设计和研究用途,探索生成模型的偏见和局限。开发者为Robin Rombach和Patrick Esser,使用CreativeML Open RAIL++-M开放许可,但需注意生成的内容可能存在偏见或不当风险。
HunyuanDiT-v1.2-Diffusers - 基于多分辨率扩散技术的中文图像生成模型
GithubHuggingfaceHunyuanDiT中文理解人工智能图像生成多分辨率开源项目模型
HunyuanDiT-v1.2-Diffusers是一个开源的文本到图像生成模型,基于多分辨率Diffusion Transformer架构实现中英文文本理解。模型在文本-图像一致性、AI伪影控制、主体清晰度和美学评分等维度进行了测试评估,支持长文本输入和中国文化元素理解,可用于多样化的图像生成场景。
PIDM - 人像图像生成技术,支持姿态和外观定制
本项目采用去噪扩散模型实现高质量人像图像生成,并支持姿态和外观控制。经过在DeepFashion数据集的训练,该方法可在5天内利用多GPU实现高精度样本生成。提供预训练模型下载和详细的训练与推理指南,支持自定义数据集。实验比较显示,该模型在多种先进方法中表现优异。相关代码和生成结果可在GitHub及Google Colab中体验。
IP-Adapter-FaceID - 基于面部ID的多风格人像生成技术
GithubHuggingfaceIP-Adapter-FaceIDStable Diffusion人脸识别图像生成开源项目模型深度学习
IP-Adapter-FaceID 是一个开源AI模型,利用面部识别技术的ID嵌入生成多样化风格的人像图像。用户只需提供文本提示和面部图像,就能创建保持ID一致性的各种风格人像。该项目还包括SDXL版本和专门的肖像模式,进一步增强了图像生成能力。这一技术为数字艺术创作和个性化内容生成提供了新的可能性。
normal-depth-diffusion - 通用法线深度扩散模型实现高细节3D生成
3D模型AI生成GithubNormal-Depth Diffusion Model图像生成开源项目深度学习
Normal-Depth Diffusion Model是一个创新的文本到3D生成模型,采用法线深度扩散技术生成细节丰富的3D模型。该项目支持单视图和多视图生成,提供预训练权重、推理和训练代码,以及Objaverse数据集的多视图渲染图像。这一模型为3D内容创作开辟新途径,可应用于艺术设计等多个领域。
clip-guided-diffusion - 文本生成图像,多功能扩散模型
AI绘图CLIP Guided DiffusionGithubKatherine Crowsonpyglide图像生成开源项目
CLIP Guided Diffusion项目提供文本生成图像功能,支持多种参数和提示词权重设置。此项目采用高效扩散模型,通过命令行或Python接口操作,支持GPU加速,提供丰富的图像尺寸和调校选项,适合生成高质量多样化的视觉内容。
StreamDiffusion - 高性能实时AI图像生成框架
AI绘图GithubStreamDiffusion图像处理实时生成开源项目深度学习
StreamDiffusion是一个开源的高性能AI图像生成框架,专为实时交互应用设计。它采用流批处理、残差无分类引导等创新技术,大幅提升了扩散模型的生成速度。在RTX 4090显卡上,使用SD-turbo模型可实现每秒106帧的文生图速度,LCM-LoRA与KohakuV2模型组合也能达到每秒38帧。该项目为开发实时AI图像生成应用提供了有力支持。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

白日梦AI

白日梦AI提供专注于AI视频生成的多样化功能,包括文生视频、动态画面和形象生成等,帮助用户快速上手,创造专业级内容。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

讯飞绘镜

讯飞绘镜是一个支持从创意到完整视频创作的智能平台,用户可以快速生成视频素材并创作独特的音乐视频和故事。平台提供多样化的主题和精选作品,帮助用户探索创意灵感。

Project Cover

讯飞文书

讯飞文书依托讯飞星火大模型,为文书写作者提供从素材筹备到稿件撰写及审稿的全程支持。通过录音智记和以稿写稿等功能,满足事务性工作的高频需求,帮助撰稿人节省精力,提高效率,优化工作与生活。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号