NVIDIA 自动引导技术:改善扩散模型中的图像质量和变化
划重点:
- 💡 NVIDIA 提出的自动引导方法在扩散模型中使用较小的模型来引导生成过程,显著改善了图像生成的质量和多样性。
- 💡 通过自动引导方法,研究人员在 ImageNet-512和 ImageNet-64等基准测试中取得了新的记录成绩,实现了对图像生成质量的显著提升。
- 💡 这一创新方法在解决当前方法存在的局限性的同时,为生成高质量和多样化图像提供了更高效、更有效的解决方案。
NVIDIA 近期提出了一种名为自动引导的新方法,旨在改善扩散模型中图像的质量和变化,而不影响其与给定条件(如类标签或文本提示)的一致性。当前的方法通常会以牺牲多样性为代价来提高图像质量,从而限制了它们在医学诊断和自动驾驶等各种现实场景中的适用性。然而,克服这一挑战可以提升人工智能系统在生成逼真且多样化图像方面的性能,推动当前人工智能能力的边界。
目前解决这一挑战的方法主要是使用无分类器引导(CFG),它使用无条件模型来引导有条件模型。虽然 CFG 改善了提示对齐和图像质量,但降低了图像变化。这种权衡发生在图像质量和变化的影响在本质上是纠缠在一起的,难以独立控制它们。此外,CFG 局限于有条件生成,并存在任务差异问题,导致图像构成的偏斜和过于简化的图像。这些限制影响了方法的性能,并限制了它在生成多样化和高质量图像方面的应用。
NVIDIA 的研究人员提出了一种名为自动引导的新方法,它涉及使用主模型的规模较小、训练时间较短的版本来引导生成过程,而不是使用无条件模型。这种方法通过将图像质量与变化解耦,从而更好地控制这些方面,同时保持与主模型相同的条件,确保生成图像的一致性。这种创新方法显著提高了图像生成的质量和变化,在 ImageNet-512和 ImageNet-64等基准测试中刷新了记录,可以应用于有条件和无条件模型。

该方法的核心是训练主模型的规模较小、训练时间较短的引导模型。论文详细介绍了去噪扩散过程,通过反转随机损坏过程生成合成图像。研究人员使用 Fréchet Inception Distance(FID)和 FDDINOv2等指标对模型进行评估,结果显示图像生成质量有了显著提高。例如,在 ImageNet-512中使用小模型(EDM2-S),自动引导将 FID 从2.56提高到1.34,超越了现有方法。
广泛的定量结果证明了自动引导的有效性。该方法在公开可用的网络上实现了64×64和512×512图像分辨率的 FID 记录,表明图像质量有了显著提升,而没有牺牲多样性。评估包括比较不同方法的表格,展示了自动引导在 CFG 和其他基线方法上的优越性能。例如,该方法在 ImageNet 数据集上实现了87.5% 的准确率,超过了先前的最先进水平。
这种改进扩散模型中图像质量的新方法涉及使用模型的规模较小、训练时间较短的引导模型。所提出的自动引导方法克服了像 CFG 这样的现有方法的局限性。这种创新方法在基准测试中取得了最先进的成绩,显著推进了人工智能研究领域,为生成高质量和多样化图像提供了更高效、更有效的解决方案。
全球首个大模型Agent产品爆款出场!动动嘴让PC成为打工人
【新智元导读】有了这个实在的Agent小助手,文秘小帅的办公流程,简直叫一个行云流水。最近,有了一个神秘助手的小帅,办公效率比过去提高了十倍不止。今天,他需要把销售人员的销售金额做个排序,再把清单通过钉钉发给张总。不用多费口舌,小助手立马准确读取了小帅的需求。随后,小助手干脆利落地给自己列出了行动计划,不到一分钟,销售金额从高到低排序的清单,就赫然出现在了桌面上。站长网2023-08-29 14:18:070004报道称,Tumblr 所有者正在与 OpenAI 和 Midjourney 就训练数据达成协议
划重点:-💡Tumblr和WordPress.com的所有者Automattic正与AI公司Midjourney和OpenAI就提供用户帖子的训练数据进行谈判。-💡据报道,Automattic计划推出一个新设置,允许用户选择退出与第三方(包括AI公司)的数据共享。站长网2024-02-28 09:56:1000003799元 网友入手真我GT5 1TB顶配版:连网盘钱都省了
快科技9月6日消息,一位网友入手了真我GT524GB1TB顶配版,官方售价是3799元。他说,开了20多个APP,再回到第一个都没遇到杀后台的情况,比我上一台12GB手机强太多,以后也不用担心杀后台了;1TB的存储按照我的使用速度,估计也够我钉好几年了,连开网盘存照片的钱都省了。站长网2023-09-06 21:36:250000小米:人像虚化、夜景渲染、图像去噪算法已应用于13Ultra
小米公司宣布,其相机算法团队在计算机视觉领域的顶级学术会议CVPR2023MIPI和NTIRE赛事中获得了4项冠军。这些冠军分别涉及夜景耀斑去除、夜景摄影渲染、视频上色-一致性、360全景超分辨率-视频。此外,小米表示,本次获奖的人像虚化、夜景渲染、图像去噪算法已经应用于小米13Ultra中。站长网2023-05-08 11:14:440000ChatGPT开源替代品!Hugging Face的HuggingChat号称媲美GPT-3.5
目前,市面上已经有不少ChatGPT/GPT4开源替代品,想体验相关产品可访问《有哪些类似chatgpt产品?17个ChatGPT/GPT4开源替代品推荐(附网址)》一文了解。最近HuggingFace发布了开源聊天机器人HuggingChat,用户可以在浏览器中免费试用或根据自己需要进行自定义。站长网2023-04-26 10:52:040002