当前位置:   article > 正文

可生成高清视频的Stable Diffusion,分辨率提升4倍,人像丝滑!

stable diffusion怎么改清晰度

来源:量子位

免费玩的Stable diffusion,又出新变种了!

38f3422edd3b71cdabf709f61f1785be.gif

古典人像丝滑切换,还都是4倍超分辨率水平,细节也就多了亿点点吧,眉毛发丝都根根分明。

86deaa1c6ac9ad1641a5618497e5597a.png

还能从一盘草莓意大利面,丝滑变成一份蓝莓面。

40e71d1b1a0a67249898fbf52f2537e8.gif

这就是最近在推特上火了Stable Diffusion视频版2.0.

它能够通过Real-ESRGAN进行上采样,让生成画面达到4倍超分。

9ceb7e8b587dfbffd036f7e0361f3354.png

要知道,之前Stable Diffusion生成的图像如果想要高清,还得自己手动提升分辨率。

现在直接二合一,在谷歌Colab上就能跑!

食用指南

Colab上的操作非常简单,基本上就是傻瓜式按照步骤运行即可。

a55a4b358b5eb152e9b6c276666db0c0.png

需要注意的是,过程中要从个人Hugging Face账户中复制token登入。

拉取模型前,记得在Hugging Face上授权,否则会出现403错误。

搞定以上问题后,就能来用Stable Diffusion来生成高清视频了。

3d7a7f252f0f622f059cca992e72ad1e.png

生成一段视频需要给出2个提示词,然后设置中间的步数,以及是否需要上采样。

a187d8157b91284d19c7fff39eb8e46b.png

中间步骤越多,生成所需的时间越长;同样上采样也会一定程度上加长生成时间。

还能直接用代码来跑,修改几个简单的参数就能搞定。

fe44ca74a644eb3c84ee17c6ede63270.png

除了线上模式外,该模型还支持本地运行,项目已在GitHub上开源。

注意需要额外安装Real-ESRGAN。

7dd065e55d009009588860c2f8e918ce.png

超分算法来自腾讯

简单来说,这次Stable Diffusion的变种版本就是把生成的图片,通过超分辨率方法变得高清。

Stable Diffusion的原理,是扩散模型利用去噪自编码器的连续应用,逐步生成图像。

687ec3fe90ec6053a344da9b8a85a5af.png

一般所言的扩散,是反复在图像中添加小的、随机的噪声。而扩散模型则与这个过程相反——将噪声生成高清图像。训练的神经网络通常为U-net。

36bd63f50e6f7e4bc48a681bb38d0713.png

不过因为模型是直接在像素空间运行,导致扩散模型的训练、计算成本十分昂贵。

基于这样的背景下,Stable Diffusion主要分两步进行。

924891ef3d40253422d5cbb9a1677831.png
首先,使用编码器将图像x压缩为较低维的潜在空间表示z(x)。

其中上下文(Context)y,即输入的文本提示,用来指导x的去噪。

2be985db186ab163a9cd86ee3d03b578.jpeg

它与时间步长t一起,以简单连接和交叉两种方式,注入到潜在空间表示中去。

随后在z(x)基础上进行扩散与去噪。换言之, 就是模型并不直接在图像上进行计算,从而减少了训练时间、效果更好。

再来看超分辨率部分。

用到的方法是腾讯ARC实验室此前开发的Real-ESRGAN,被ICCV 2021接收。

e1dd345e78cc43522863ed1abd3f2fa3.png

它可以更有效地消除低分辩率图像中的振铃和overshoot伪影

面对真实风景图片,能更逼真地恢复细节,比如树枝、岩石、砖块等。

dea381f38ca6de2eb9f02c09364ea9f4.png

原理方面,研究人员引出了高阶退化过程来模拟出更真实全面的退化,它包含多个重复的经典退化过程,每个又具有不同的退化超参:

bb7991446b9e9fd02c6556e9561b9f84.png

下图为Real-ESRGAN进行退化模拟的示意图:

6b1cf55443e1a82c48021140b672bae7.png

采用的是二阶退化,具体可分为在模糊(blur)、降噪(noise)、resize、JPGE压缩几个方面。

到训练环节,Real-ESRGAN的生成器用的是RRDBNet,还扩展了原始的×4 ESRGAN架构,以执行resize比例因子为×2和×1的超分辨率放大。

bd82c53689a90cb66be8013002d70ea2.png

想要单独使用这种超分算法也不是问题。

在GitHub上下载该模型的可执行文件,Windows/Linux/MacOS都可以,且不需要CUDA或PyTorch的支持。

70b4a3755ce3c5e0590227560b492ea3.png

下好以后只需在终端执行以下命令即可使用:

./realesrgan-ncnn-vulkan.exe -i input.jpg -o output.png

值得一提的是,Real-ESRGAN的一作Wang Xintao是图像/视频超分辨率领域的知名学者。

他本科毕业于浙江大学本科,香港中文大学博士(师从汤晓鸥),现在是腾讯ARC实验室(深圳应用研究中心)的研究员。

此前曾登顶GitHub热榜的项目GFPGAN也是他的代表作。

7af607f17800591535209abfe1eb91af.png

One More Thing

前两天,大谷老师也发布了用Stable Diffusion生成了一组少女人像,效果非常奈斯。

710ac6823695b18a43aa88e017dbb46c.gif

顺带让我们都完成了一下“阅女无数”的成就(doge)。

7a51fe53a56fa26ebb8e17b7bcda71f3.png

Stable Diffusion还能玩出哪些新花样?你不来试试吗?

Colab试玩:
https://colab.research.google.com/github/nateraw/stable-diffusion-videos/blob/main/stable_diffusion_videos.ipynb

GitHub地址:
https://github.com/nateraw/stable-diffusion-videos

Hugging Face授权:
https://huggingface.co/CompVis/stable-diffusion-v1-4

参考链接:
[1]https://twitter.com/_nateraw/status/1569315090314444802
[2]https://www.bilibili.com/video/BV1yd4y1g7Wz?spm_id_from=333.999.0.0

推荐阅读

欢迎大家加入DLer-计算机视觉技术交流群!

大家好,群里会第一时间发布计算机视觉方向的前沿论文解读和交流分享,主要方向有:图像分类、Transformer、目标检测、目标跟踪、点云与语义分割、GAN、超分辨率、人脸检测与识别、动作行为与时空运动、模型压缩和量化剪枝、迁移学习、人体姿态估计等内容。

进群请备注:研究方向+学校/公司+昵称(如图像分类+上交+小明)

9f60a9a07f2fc0ecf5e862136bdced1f.jpeg

声明:本文内容由网友自发贡献,不代表【wpsshop博客】立场,版权归原作者所有,本站不承担相应法律责任。如您发现有侵权的内容,请联系我们。转载请注明出处:https://www.wpsshop.cn/w/weixin_40725706/article/detail/967448
推荐阅读
相关标签