首页
AI资讯
文章详情

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

2024-09-15
AI资讯
原创文章

27
0
0
0

0°

帅气的我简直无法用语言描述！

2769 文章
0 粉丝
0 关注

最近更新

1.「法外狂徒」ChatGPT！30年老律师用它旁征博引，结果被禁止执业

2.刚刚，谷歌发布超大杯Gemini，全面对标GPT-4，前2个月免费！

3.GPT-4推理能力暴涨32%，谷歌新型思维链效果超CoT，成本降至1/40

文章目录

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

“让GAN再次伟大？”

萧箫发自凹非寺
量子位 | 公众号 QbitAI

扩散模型的图像生成统治地位，终于要被GAN夺回了？

就在大伙儿喜迎新年之际，英伟达一群科学家悄悄给StyleGAN系列做了个升级，变出个PLUS版的StyleGAN-T，一下子在网上火了。

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

无论是在星云爆炸中生成一只柯基：

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

还是基于虚幻引擎风格渲染的森林：

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

都只需要接近0.1秒就能生成！

同等算力下，扩散模型中的Stable Diffusion生成一张图片需要3秒钟，Imagen甚至需要接近10秒。

不少网友的第一反应是：

GAN，一个我太久没听到的名字了。

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

很快谷歌大脑研究科学家、DreamFusion第一作者Ben Poole赶来围观，并将StyleGAN-T与扩散模型做了个对比：

在低质量图像（64×64）生成方面，StyleGAN-T要比扩散模型做得更好。

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

但他同时也表示，在256×256图像生成上，还是扩散模型的天下。

所以，新版StyleGAN生成质量究竟如何，它又究竟是在哪些领域重新具备竞争力的？

StyleGAN-T长啥样？

相比扩散模型和自回归模型多次迭代生成样本，GAN最大的优势是速度。

因此，StyleGAN-T这次也将重心放在了大规模文本图像合成上，即如何在短时间内由文本生成大量图像。

StyleGAN-T基于StyleGAN-XL改进而来。

StyleGAN-XL的参数量是StyleGAN3的3倍，基于ImageNet训练，能生成1024×1024高分辨率的图像，并借鉴了StyleGAN2和StyleGAN3的部分架构设计。

它的整体架构如下：

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

具体到细节上，作者们对生成器、判别器和文本对齐权衡机制进行了重新设计，用FID对样本质量进行量化评估，并采用CLIP来对文本进行对齐。

在生成器上，作者们放弃了StyleGAN3中能实现平移同变性（equivariance）的架构，转而采用了StyleGAN2的部分设计，包括输入空间噪声以及跳层连接等，以提升细节随机变化的多样性。

在判别器上，作者们也重新进行了设计，采用自监督学习对ViT-S进行训练。

随后，作者采用了一种特殊的截断（truncation）方法来控制图像生成的效果，同时权衡生成内容的多样性。

只需要控制参数ψ，就能在确保CLIP分数（用于评估图像生成效果）变动不大的情况下，改善生成图像的风格多样性。

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

随后，作者们用64个英伟达A100训练了4周，最终得到了这版StyleGAN-T。

那么它的生成效果如何呢？

超快生成低分辨率图像

作者们对当前最好的几种GAN、扩散模型和自回归模型进行了评估。

在微软的MS COCO数据集上，StyleGAN-T实现了64×64分辨率下最高的FID。

（其中，FID是计算真实图像和生成图像特征向量距离的评估用值，数值越低，表示生成的效果越接近真实图像）

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

但在更高的256×256分辨率生成上，StyleGAN-T还是没有比过扩散模型，只是在生成效果上比同样用GAN的LAFITE要好上不少：

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

如果进一步将生成时间和FID分别作为纵轴和横轴，放到同一张图上来对比，还能更直观地对比生成质量和速度。

可见StyleGAN-T能保持在10FPS的速度下生成256×256分辨率图像，同时FID值逼近LDM和GLIDE等扩散模型：

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

而在文本生成图像功能上，作者们也从文本特征、风格控制等方面对模型进行了测试。

在增加或改变特定的形容词后，生成的图像确实符合描述：

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

即便是快速生成的图像，也能迅速控制风格，如“梵高风格的画”or“动画”等：

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

当然，偶尔也有失败案例，最典型的就是生成带字母要求的图像时，显示不出正常字母来：

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

作者们正在努力整理代码，表示不久之后就会开源。

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

作者介绍

作者们均来自图宾根大学和英伟达。

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

一作Axel Sauer，图宾根大学博士生，此前在卡尔斯鲁厄理工学院（KIT）获得本硕学位。目前感兴趣的研究方向是深度生成模型、神经网络架构和实证研究。

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

二作Tero Karras，英伟达杰出研究科学家，对英伟达RTX技术有重要贡献，也是StyleGAN系列的主要作者，主要研究方向是计算机图形学和实时渲染。

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

不过在这波GAN掀起的“文艺复兴”浪潮下，也出现了“StyleGAN时代迎来终结”的声音。

有网友感慨：

在这之前，最新StyleGAN生成的图像总能让我们大吃一惊，然而现在它给我们的印象只剩下“快”了。

英伟达超快StyleGAN回归，比Stable Diffusion快30多倍，网友：GAN好像只剩下快了

你认为GAN还能撼动扩散模型的统治地位吗？

论文地址：
https://arxiv.org/abs/2301.09515

项目地址：
https://github.com/autonomousvision/stylegan-t

《流浪地球2》不够科幻：这不都是进行中的国家级课题嘛！（狗头）

拆解苹果M2 Pro笔记本，内存变成4条4GB，散热片还缩小了

发评论，每天都得现金奖励！超多礼品等你来拿

后，在评论区留言并审核通过后，即可获得现金奖励，奖励规则可见：查看奖励规则

暂无评论...

关联网址

关联标签

相关文章

何恺明新作：简单框架达成无条件图像生成新SOTA！与MIT合作完成

何恺明新作：简单框架达成无条件图像生成新SOTA！与MIT合作完成

让GAN再次伟大！拽一拽关键点就能让狮子张嘴&大象转身，汤晓鸥弟子的DragGAN爆火，网友：R.I.P. Photoshop

让GAN再次伟大！拽一拽关键点就能让狮子张嘴&大象转身，汤晓鸥弟子的DragGAN爆火，网友：R.I.P. Photoshop

OpenAI当红新星宋飏：最新研究获评「终结扩散模型」，16岁上清华

OpenAI当红新星宋飏：最新研究获评「终结扩散模型」，16岁上清华

谷歌P图神器来了！不用学不用教，输入一句话，分分钟给结果

谷歌P图神器来了！不用学不用教，输入一句话，分分钟给结果

「法外狂徒」ChatGPT！30年老律师用它旁征博引，结果被禁止执业

「法外狂徒」ChatGPT！30年老律师用它旁征博引，结果被禁止执业