cross-image-attention

跨图像注意力机制实现零样本外观迁移

Cross-Image Attention 零样本外观迁移语义对应图像生成自注意力机制 Github 开源项目

该项目开发了一种跨图像注意力机制，实现了零样本外观迁移。这种方法利用生成模型的语义理解，在保持目标结构的同时，将外观应用到不同形状的对象上。该技术适用于多种对象类别，对形状、大小和视角变化具有适应性。项目提供了代码实现、使用指南和演示，便于研究人员探索和应用。

External-Attention-pytorch - 注意力机制和主干网络的PyTorch实现合集

AttentionFightingCVGithub代码库开源项目深度学习计算机视觉

该项目提供了多种注意力机制和主干网络的PyTorch实现代码。涵盖External Attention、Self Attention、Squeeze-and-Excitation等注意力机制,以及ResNet、MobileViT等主干网络。代码结构清晰,注释详细,既可帮助初学者理解核心原理,也可作为科研和工业应用的可复用组件。项目适合深度学习爱好者学习和实际使用。

pix2pix - 利用条件对抗网络的图像到图像翻译实现

Conditional Adversarial NetworksCycleGANGithubImage-to-Image TranslationPyTorchpix2pix开源项目

使用条件对抗网络实现图像到图像翻译，支持从建筑立面生成到日夜转换等多种任务。该项目能在小数据集上快速产生良好结果，并提供改进版的PyTorch实现。支持多种数据集和模型，并附有详细的安装、训练和测试指南。

Imagen - 文字生成图片的AI技术

AI工具AI开发COCO FIDImagen扩散模型文本到图像模型训练热门语言模型

Imagen，一种先进的AI图片生成工具，利用深度语言理解和极致的图像真实性，实现从文字到图像的转换。此模型不仅在COCO数据集上刷新了技术记录，还通过高效的U-Net架构和强大的文本编码系统，优化了图文一致性和图像质量。鉴于潜在的社会影响和数据集偏差问题，当前未开放源代码或公共演示版本。

diffusion-classifier - 利用大规模文本到图像生成模型实现零样本分类

Diffusion ClassifierGithubICCV 2023Stable Diffusionzero-shot分类开源项目生成模型

本项目展示了如何利用大型文本图像生成模型如Stable Diffusion进行零样本分类，无需额外训练。该生成分类方法在多项基准测试中表现优越，超过其他扩散模型的知识提取方法。通过从ImageNet的类条件扩散模型中提取标准分类器，该模型即使在仅使用弱增强的情况下也表现出强大的分类性能和分布转移的稳健性。本研究推进了生成模型在下游任务中的应用，是对多模态组合推理能力的重要探索。

StyleShot - 多样化风格迁移的AI图像生成开源项目

AI绘图GithubStyleShot图像风格迁移开源项目深度学习计算机视觉

StyleShot是一个开源的AI图像生成项目，专注于实现广泛的风格迁移能力。通过风格感知编码器和StyleGallery数据集，它能够模仿3D、扁平、抽象等多种风格，无需测试时微调。项目在风格迁移性能上展现出优势，为图像风格化研究提供了新的方向和可能性。

Generative-AI - 多模态图像合成与编辑技术及其分类

Data ModalityGenerative AIGithubMultimodal Image Synthesis and EditingTaxonomyVisual AIGC开源项目

该项目附有一篇综述论文，全面分析了多模态图像合成与编辑（MISE）和视觉AIGC的发展情况，并根据数据模态和模型架构进行了分类研究。通过此项研究，科研人员和技术开发者可以深入了解神经渲染、扩散方法、自回归方法及对抗生成网络（GAN）等不同技术及其应用，帮助更好地掌握多模态图像合成技术的前沿进展与实际应用。

DCLGAN - 无监督图像转换的双重对比学习方法实现更真实几何变换

DCLGANGithub图像转换对比学习开源项目无监督学习生成对抗网络

DCLGAN是一种新型无监督图像到图像转换模型，采用双重对比学习方法。相比CycleGAN，它能实现更真实的几何变换；相比CUT，具有更高的稳定性和性能。DCLGAN适用于多种图像转换任务，如猫狗互换和马斑马互换。项目提供了预训练模型和使用指南，便于研究者进行实验和评估。

pytorch-CycleGAN-and-pix2pix - PyTorch中的高效CycleGAN和pix2pix图像翻译

CycleGANGithubPyTorchpix2pix图像翻译开源项目神经网络

该项目提供了PyTorch框架下的CycleGAN和pix2pix图像翻译实现，支持配对和无配对的图像翻译。最新版本引入img2img-turbo和StableDiffusion-Turbo模型，提高了训练和推理效率。项目页面包含详细的安装指南、训练和测试步骤，以及常见问题解答。适用于Linux和macOS系统，兼容最新的PyTorch版本，并提供Docker和Colab支持，便于快速上手。

zero123-diffusers - 单图转3D模型的AI技术突破

3D对象GithubHuggingfaceZero-1-to-3人工智能图像生成开源项目模型研究模型

Zero-1-to-3项目展示了AI领域的重要进展，实现从单一2D图像到3D模型的转换。基于Stable Diffusion技术，该项目为研究人员提供了探索大规模模型部署和生成模型特性的新工具。尽管在真实感和文本渲染方面有待改进，但其在计算机视觉和3D建模领域的应用前景广阔。使用时需谨慎，确保符合伦理标准。

OpenAI-CLIP - 从零开始实现CLIP模型：探索文本与图像的多模态关联

CLIPGithubOpenAI图像编码器多模态开源项目文本编码器

本项目实现了CLIP模型，基于PyTorch进行开发，通过训练文本和图像数据，探索其相互关系。详细的代码指南和实用工具展示了模型在自然语言监督任务中的表现和实际应用，适合多模态学习的研究者和开发者使用。

相关项目

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com