开发者生态
morning
如何建立扩散语言模型
2026-08-31
1 阅读
约5分钟阅读
volodia
字号:
内容简介:自回归和扩散语言模型当今广泛使用两种生成式人工智能算法。对于图像或视频等连续数据,最先进的方法基于扩散模型。对于文本或代码等离散数据,标准方法是自回归模型。本文探讨了离散数据的另一种替代方案,一种基于现代扩散范式的替代方案。主流语言模型是自回归的:它们从左到右生成标记,一次一个,每个标记都以其之前的标记为条件。这种方法很强大,但它也有固有的局限性: 无法纠正错误:一旦发出令牌,就无法对其进行修改,因此早期的错误会加剧。生成速度很慢:生成序列需要与令牌一样多的步骤,并且自然不适合快速并行生成。因果关注:一代人只回顾过去,从不展望未来。扩散模型采用不同的方法。他们不是一次生成一个标记的文本,而是一次生成整个序列,从最初的猜测开始,并通过多个步骤迭代地完善它。这带来了几个优点:生成可以通过使用更少或更多的步骤来权衡速度和质量,可以沿途纠正错误,并且每个步骤都涉及双向上下文。自回归 LLM 一次生成一个标记,从左到右,采取与标记一样多的步骤(上)。 Diffusion LLM(例如此处所示的 Gemma Diffusion)从粗略的完整草案开始,并在几轮(底部)中并行细化每个位置,在每一步重写整个序列,而不是发出单个令牌。图片来源:M. Grootendorst 和 Gemma Diffusion。将扩散应用于语言长期以来一直是一个悬而未决的问题。 2024 年,该领域达到了一个转折点,扩散模型在质量方面与自回归模型具有竞争力。到 2026 年,随着领先行业实验室 Mercury 2(Inception Labs)、Gemma Diffusion(Google)和 Nemotron Diffusion(NVIDIA)的发布,扩散法学硕士将成为现实。本文追溯了这些现代模型背后的思想和论文。背景:高斯扩散 在介绍语言扩散之前,我们首先简要概述用于图像生成的高斯扩散。然后我们将通过类推建立离散扩散。通过迭代去噪生成 扩散模型的核心概念是去噪。扩散模型不是一次性绘制图像,而是逐步生成图像,从纯随机噪声开始,每一步都会去除一点噪声,直到出现连贯的图像。通过许多小步骤生成图像比一次性生成图像要简单得多,这就是扩散模型如此有效的原因。模型如何学习去噪?诀窍是通过展示噪声逐渐转化为图像的示例来进行教学。扩散通过两个互补的过程来实现这一点。首先,前向过程获取干净的源图像并将其转化为纯噪声,一次一步。其次,反向过程学习反转这种变换,将纯噪声变回图像;它接受前向过程产生的图像到噪声轨迹的训练。前向过程 前向过程采用干净的训练图像并生成一系列噪声逐渐增加的图像,追踪从干净数据到纯噪声的路径。它通过在每一步混合越来越多的随机高斯噪声来实现这一点,直到图像分解为纯静态。这一步根本不需要学习——我们只是添加噪声——但它非常有用,因为它产生了无穷无尽的训练数据:图像转换为噪声的例子,反之亦然。图像上的高斯扩散轨迹。从左到右阅读,前进的过程逐渐增加噪音,直到一张干净的狗照片溶解成纯粹的静态。该轨迹将作为逆过程的训练数据。逆向过程 逆向过程是实际学习发生的地方。我们训练一个模型,通过逆向执行前向过程产生的步骤,将噪声转换为图像。高斯扩散的反向路径。再次从左到右,训练生成反向过程以反向再现前向过程的轨迹,从噪声开始,并重建原始图像。具体来说,给定一个噪声图像,我们训练一个机器学习模型来将噪声与底层图像分离,或者等效地,预测添加的噪声或干净图像本身,因为给定噪声输入,知道一个决定另一个。一旦模型能够做到这一点,生成就很简单:从纯噪声开始,要求模型进行估计并去除其中的一部分,然后重复。每一次传递都会使样本更接近看起来像的东西
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱