【深度学习】SDXL中的Offset Noise,Diffusion with Offset Noise,带偏移噪声的扩散

https://www.crosslabs.org//blog/diffusion-with-offset-noise

带有偏移噪声的扩散
针对修改后的噪声进行微调,使得稳定扩散能够轻松生成非常暗或非常亮的图像。
作者:尼古拉斯·古藤伯格
|
2023年1月30日

马里奥兄弟使用稳定扩散挖掘隧道。左图显示了未使用偏移噪声的原始结果,右图使用偏移噪声显示了更丰富的黑色调。
在这里插入图片描述

稳定扩散在使用偏移噪声前(左)和使用偏移噪声后(右)

去噪扩散概率模型(Denoising Diffusion Probabilistic Models)是一种相对较新的生成神经网络模型,可以从从数据中学习到的高维概率分布中生成样本。其他解决同类问题的方法包括生成对抗网络(Generative Adversarial Networks)、归一化流(Normalizing Flows)以及各种形式的自回归模型,这些模型一次或分批对维度进行采样。此类模型的主要应用之一是在图像合成中,扩散模型在图像质量方面最近竞争力很强,特别是在生成全局连贯的图像构图方面。稳定扩散(Stable Diffusion)是一个预训练的、公开可用的模型,能够使用这种技术生成一些惊人的结果。然而,它有一个有趣的限制,似乎大多没有被注意到。如果你试图让它生成特别暗或特别亮的图像,它几乎总是生成平均值相对接近0.5的图像(全黑图像为0,全白图像为1)。例如:

在这里插入图片描述

左上:暴雨中的黑暗小巷(0.301);右上:白色背景上的单色线条艺术标志(0.709);左下:阳光明媚的雪坡(0.641);右下:仅有火把照亮的广场(0.452)

大多数情况下,这些图像仍然是合理的。但是,这种平均值趋近于0.5的软约束可能导致图像显得淡化、亮雾区域平衡其他暗区域、高频纹理(在标志中)而不是空白区域、灰色背景而不是白色或黑色等。虽然有些可以通过手动后期处理来修正或调整,但这里也存在一个更大的潜在限制,即场景的整体色调可能与表现和构图的其他方面相关,这样扩散模型就无法像其他方法那样自由探索这些方面。但为什么会这样呢?我是想象中的效果还是这些结果是“正确的”?这是训练数据的问题、架构的问题还是扩散模型本身的问题?(事实证明是最后一个)。

不过,首先,为了确保我没有想象出这些效果,我尝试针对一张全黑图像对稳定扩散进行微调。通常,对稳定扩散(SD)进行微调效果很好——有一种称为Dreambooth的技术可以教SD新的特定概念,比如特定的人的脸或特定的猫,几十张图像和几千次梯度更新就足够让模型学会特定对象的样子。将其扩展到一万步,它甚至可以开始记住特定的图像。

但当我针对这张全黑图像进行了3000步微调后,对于“全黑图像”的生成结果仍然如下:

在这里插入图片描述

使用提示:“全黑图像”

所以看来不仅SD开箱即用时无法生成过于暗或亮的图像,而且它甚至无法学会这样做。除非对其进行一些修改。

要理解发生了什么,帮助很大的是研究一下扩散模型正在学习反转的内容。通常,扩散模型被公式化为特定前向随机过程的逆过程——重复添加少量“独立同分布”(iid)的高斯噪声。也就是说,每个像素在潜在空间中在每一步都接收自己的随机样本。扩散模型学习在进行了一些步后,从图像中找到返回原始图像的方向。给定这个可以“向真实图像倒退”的模型,你从纯噪声开始,反转噪声过程以得到新的图像。

问题在于,你在前向过程中永远不会完全擦除原始图像,因此,从纯噪声开始的逆过程模型并不能完全回到图像的真实分布。相反,那些噪声最后破坏的特征在逆过程中变化最小——这些特征继承自用于开始过程的潜在噪声样本。乍一看可能不明显,但如果你研究前向过程如何破坏图像,长波长特征需要更长时间才能被噪声破坏:

这就是为什么使用相同的潜在噪声种子但不同提示往往会生成在整体构图上相关但在个体纹理或小尺度图案上不同的图像。扩散过程不知道如何改变这些长波长特征。而最长的波长特征是整个图像的平均值,也是独立样本之间变化最小的特征。这个问题在目标对象的维度越高时越严重,因为独立噪声样本集合的标准差与1/N成比例。因此,如果你生成一个4维向量,这可能不是大问题——你只需要两倍的样本来获得最低频率分量与最高频率分量。但在512x512分辨率的稳定扩散中,你生成的是一个3 x 64^2 = 12288维的对象。所以最长波长变化比最短波长慢大约100倍,意味着你需要考虑成百上千步才能捕捉到,而默认值大约是50(对于一些复杂的采样器,甚至低至20)。

似乎增加采样步数确实可以帮助SD生成更极端的图像,但我们可以做得更好,并提供一个即插即用的解决方案。诀窍在于我们教扩散模型逆转的噪声结构。因为我们使用的是iid样本,我们有这个1/N效应。但如果我们使用的噪声看起来像每个像素的iid样本加上整个图像相同的单个iid样本呢?用代码术语来说,目前的训练循环使用的噪声如下:noise = torch.randn_like(latents)但我可以使用这样的噪声:noise = torch.randn_like(latents) + 0.1 * torch.randn(latents.shape[0], latents.shape[1], 1, 1)这将使模型学习自由改变零频分量,因为该分量现在比基础分布快随机化约10倍(选择0.1在我的有限数据和训练时间内效果很好——如果我设得太大,它会倾向于主导模型的现有行为,但如果设得太小,我不会看到改善)。

用这样的噪声进行约一千步的微调,仅需40张手工标注的图像,就足以显著改变稳定扩散的行为,而不会让它在以前能够生成的东西上变得更糟。以下是文章上方四个提示的对比结果:
在这里插入图片描述

右上:暴雨中的黑暗小巷(0.032);左上:白色背景上的单色线条艺术标志(0.974);左下:阳光明媚的雪坡(0.858);右下:仅有火把照亮的广场(0.031)

在这里插入图片描述

星空在使用偏移噪声前后

在这里插入图片描述

超级英雄在黑暗小巷中与植物怪物战斗前后

结论
有许多论文讨论了改变去噪扩散模型的噪声调度,以及使用不同于高斯分布的噪声,甚至完全去除噪声而使用其他破坏操作如模糊或遮罩。然而,大多数关注点似乎是加速推理过程——能够使用更少的步数。似乎没有太多关注关于噪声(或图像破坏操作)的设计决策如何限制可以轻松合成的图像类型。然而,这对于这些模型的美学和艺术用途来说非常相关。对于深入定制这些模型并进行自己的微调的个别艺术家来说,针对某个项目调整使用这种偏移噪声并不难。你可以使用我们的检查点文件(在访问此文件前请阅读最后的注意事项)。但是,用少量图像进行微调,结果永远不会像大项目可以实现的那样普遍或好。

因此,我想以一个请求结束,向那些参与训练这些大型模型的人:请在下次进行大规模训练时,在训练过程中加入一点这样的偏移噪声。它应该显著增加模型的表现范围,允许在生成标志、剪切图、自然明亮和黑暗的场景、强色彩照明的场景等方面得到更好的结果。这是一个非常简单的技巧!

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/web/12918.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

Springboot+Vue项目-基于Java+MySQL的高校专业实习管理系统(附源码+演示视频+LW)

大家好!我是程序猿老A,感谢您阅读本文,欢迎一键三连哦。 💞当前专栏:Java毕业设计 精彩专栏推荐👇🏻👇🏻👇🏻 🎀 Python毕业设计 &…

Linux文件:重定向底层实现原理(输入重定向、输出重定向、追加重定向)

Linux文件:重定向底层实现原理(输入重定向、输出重定向、追加重定向) 前言一、文件描述符fd的分配规则二、输出重定向(>)三、输出重定向底层实现原理四、追加重定向(>>)五、输入重定向…

关于 vs2019 c++20 规范里的 STL 库里模板 decay_t<T>

(1) 这个模板,在库代码里非常常见。 decay 英文是“衰弱,消减” 的意思,大概能感觉到就是要简化模板参数 T 的类型,去掉其上的修饰符。因为常用且复杂,故单独列出其源码和注释。先举例其应用场景…

基于Springboot的学生心理压力咨询评判(有报告)。Javaee项目,springboot项目。

演示视频: 基于Springboot的学生心理压力咨询评判(有报告)。Javaee项目,springboot项目。 项目介绍: 采用M(model)V(view)C(controller)三层体系…

Yalmip使用教程(8)-常见报错及调试方法

博客中所有内容均来源于自己学习过程中积累的经验以及对yalmip官方文档的翻译:https://yalmip.github.io/tutorials/ 这篇博客将详细介绍使用yalmip工具箱编程过程中的常见错误和相应的解决办法。 1.optimize的输出参数 众所周知,optimize是yalmip用来求…

PS滤镜插件Camera Raw 15.4升级,开启智能修图

前段时间Adobe 更新了photoshop 的智能AI填充功能,深受很多设计师朋友的喜爱。Camera Raw作为PS的一个滤镜插件对RAW图片的处理上面有一定的优势,Camera Raw 15.4升级了,开启智能修图木事,一起来看看吧! Camera Raw滤镜…

【2024华为HCIP831 | 高级网络工程师之路】刷题日记(18)

个人名片:🪪 🐼作者简介:一名大三在校生,喜欢AI编程🎋 🐻‍❄️个人主页🥇:落798. 🐼个人WeChat:hmmwx53 🕊️系列专栏:&a…

ClassificationPrimitive 内部原理

ClassificationPrimitive 内部原理 发明 ClassificationPrimitive的真是个天才。其原理是利用 webgl 的模板缓冲区实现。 渲染两次, 首先是绘制模板, 然后绘制真正的内容。 示意图: function createClass() {const { program, uniforms } WebGLProgram.buildPrograms(gl, …

代码随想录算法训练营第36期DAY22

DAY22 654最大二叉树 自己做的时候忽略了:nums.length>1的题给条件。所以每次递归都要判断是否size()>1,不要空的。 /** * Definition for a binary tree node. * struct TreeNode { * int val; * TreeNode *left; * TreeNode *rig…

牛客网刷题 | BC84 牛牛学数列2

目前主要分为三个专栏,后续还会添加: 专栏如下: C语言刷题解析 C语言系列文章 我的成长经历 感谢阅读! 初来乍到,如有错误请指出,感谢! 描述 这次牛牛又换了个数…

「AIGC」Python实现tokens算法

本文主要介绍通过python实现tokens统计,避免重复调用openai等官方api,开源节流。 一、设计思路 初始化tokenizer使用tokenizer将文本转换为tokens计算token的数量二、业务场景 2.1 首次加载依赖 2.2 执行业务逻辑 三、核心代码 from transformers import AutoTokenizer imp…

React: memo

React.memo 允许你的组件在 props 没有改变的情况下跳过重新渲染。 const MemoizedComponent memo(SomeComponent, arePropsEqual?)React 通常在其父组件重新渲染时重新渲染一个组件。你可以使用 memo 创建一个组件,当它的父组件重新渲染时,只要它的新…

《海峡科技与产业》是什么级别的期刊?是正规期刊吗?能评职称吗?

问题解答 问:《海峡科技与产业》期刊是什么级别? 答:国家级 主管单位:中华人民共和国科学技术部 主办单位:科技部海峡两岸科学技术交流中心 问:《海峡科技与产业》影响因子? 答:…

随笔:棋友们

我是在小学二年级学会中国象棋的,准确说,是学会象棋的下棋规则的,师傅是二舅。我最早的对手就是同学波仔。波仔比我略早学会象棋,总用连珠炮欺负我,开局几步棋就把我将死。我不知道怎么破解。轮到我先走时,…

扭亏为盈的赛力斯,真正进入稳态了吗?

“72小时内大定破1万台”。5月15日,问界新M5开启全国大规模交付,从当前取得的成绩来看,赛力斯的“富贵”似乎还将延续。 其实,此前基于问界新M7等车型的爆火,赛力斯已经找到了创收轨道。财报显示,2024年一…

alist网盘自动同步

alist网盘自动同步 alist可以设置目录定时转存到各个网盘,做到夸网盘,多备份的效果可以将自己挂载的alist 下的各个目录相互间进行同步,原理是采用alist原始api调用执行同步原理1.匹配文件名称是否相同,2.文件大小是否相同,相同会…

一文详细解析Google编码规范工具cpplint的下载安装与使用

目录 一、什么是cpplint 二、cpplint能实现的功能 三、cpplint的下载与使用 1、配置python环境 2、安装cpplint 四、cpplint常用命令讲解 1、常用命令查看 2、常用命令详解 3、命令使用方式 五、 cpplint的实用技巧 1、集成cpplint 1.1、修改调用接口. 1.2、直接把…

数据结构(C):树的概念和二叉树初见

目录 🍺0.前言 1.树概念及结构 2.认识一棵树 3.树的表示 3.1树在实际中的运用(表示文件系统的目录树结构) 4.二叉树 4.1特殊的二叉树 4.2二叉树的性质 💎5.结束语 🍺0.前言 言C之言,聊C之识&…

卷积模型的剪枝、蒸馏---蒸馏篇--NST特征蒸馏(以deeplabv3+为例)

本文使用NST特征蒸馏实现deeplabv3+模型对剪枝后模型的蒸馏过程; 一、NST特征蒸馏简介 下面是两张叠加了热力图(heat map)的图片,从图中很容易看出这两个神经元具有很强的选择性:左图的神经元对猴子的脸部非常敏感,右侧的神经元对字符非常敏感。这种激活实际上意味着神经…

C++ 日志库 log4cpp 编译、压测及其范例代码 [全流程手工实践]

文章目录 一、 log4cpp官网二、下载三、编译1.目录结构如下2.configure 编译3.cmake 编译 四、测试五、压测源码及结果1.运行环境信息2.压测源码3.压测结果 文章内容:包含了对其linux上的完整使用流程,下载、编译、安装、测试用例尝试、以及一份自己写好…