富文本到图像生成: 增强文本到图像生成的控制能力

富文本到图像生成:增强文本到图像生成的控制能力

在人工智能和计算机视觉领域,文本到图像生成一直是一个热门且具有挑战性的研究方向。近年来,随着扩散模型和大规模语言模型的发展,文本到图像生成的质量有了显著提升。然而,如何更精确地控制生成过程,以实现更具创意和个性化的图像生成,仍然是一个值得探索的问题。最近,来自马里兰大学、Adobe和卡内基梅隆大学的研究人员提出了一种新颖的富文本到图像生成方法,为这一问题提供了一个富有创意的解决方案。

富文本到图像生成的核心思想

该方法的核心思想是利用富文本编辑器中的各种格式化选项,如字体大小、颜色、样式和脚注等,来增强对文本到图像生成过程的控制。研究人员巧妙地将这些格式化信息与扩散模型相结合,实现了对生成图像的精确控制,包括token重新加权、精确的颜色渲染、局部风格控制和细节区域合成等功能。

富文本到图像生成示例

方法实现

该方法的实现主要包括两个步骤:

首先,将普通文本输入到扩散模型中,计算交叉注意力图以将每个token与空间区域关联起来。
然后,使用从编辑器获得的富文本提示(以JSON格式存储,为每个token span提供属性),通过一种新的基于区域的扩散方法,将每个区域的属性渲染成一个全局连贯的图像。

主要功能和应用

1. 字体颜色控制

研究人员使用字体颜色来控制生成对象的精确颜色。例如,可以生成"一座哥特式教堂(颜色为#b26b00)在日落时分,背景是美丽的风景"。

颜色控制示例

2. 脚注功能

脚注被用来为选定的文本元素提供补充描述。这使得用户可以为图像的特定部分添加更详细的描述,而不会影响主要提示的简洁性。

脚注功能示例

3. 字体样式控制

就像字体样式区分各个文本元素的样式一样,研究人员提出使用它来定义生成图像中特定区域的艺术风格。例如,可以生成"一个美丽的花园(以克洛德·莫奈的风格)和背景中的雪山(以浮世绘的风格)"。

样式控制示例

4. 字体大小控制

字体大小用于指示最终生成中每个token的权重。这是通过在每个交叉注意力层的softmax之前重新加权指数注意力分数来实现的。例如,可以通过增大"菠萝"的字体大小,在生成的披萨中添加更多的菠萝。

大小控制示例

技术实现细节

该方法的技术实现基于Python 3.8和PyTorch 1.11,支持通过Hugging Face使用Stable Diffusion v1-5、Stable Diffusion XL或ANIMAGINE-XL模型。研究人员还提供了详细的安装和使用说明,使得其他研究者和开发者可以轻松复现和扩展这项工作。