Transformers as In-Context Samplers: From Closed-Form Diffusion to Estimation-Free Sampling

📄 arXiv: 2609.08981v1 📥 PDF

作者: Arman Adibi, Alireza Jafari, Mohammad Ghavamzadeh, Hadi Daneshmand

分类: cs.LG, cs.AI, stat.AP, stat.CO, stat.ML

发布日期: 2026-09-08


💡 一句话要点

提出变换器作为上下文采样器以解决数据生成问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 上下文学习 数据生成 变换器 能量基础采样 语义主题采样

📋 核心要点

  1. 现有方法在数据生成任务中缺乏有效的上下文学习能力,限制了其应用范围。
  2. 论文提出冻结的变换器可以模拟迭代生成采样器,扩展了上下文学习的应用至数据生成。
  3. 实验证明,变换器能够实现闭式扩散采样器,并在语义主题采样中展现出U形能量分布特征。

📝 摘要(中文)

越来越多的研究表明,大型语言模型不仅仅是统计记忆器,而是能够进行上下文学习:在测试时仅使用提示中提供的示例进行推理,而无需任何参数更新。先前的理论工作已表明,这一能力扩展到监督学习任务,如线性回归。我们证明了上下文学习进一步扩展到数据生成:冻结的变换器可以从上下文样本模拟迭代生成采样器。我们首先展示了变换器可以实现闭式和光滑闭式扩散采样器。该构造为softmax注意力确定了具体的生成角色:它计算责任权重和加权经验平均,而前馈层实现欧拉更新。为了将这些构造与预训练语言模型进行实证关联,我们研究了语义主题采样:由来自共同语义类别的单词组成的提示,如动物、食物或城市。在变换器层中,归一化的隐藏状态表现出两阶段几何:它们在中间层向均匀球形参考移动,然后在输出附近返回到结构化的主题相关表示。我们进一步测量了这些隐藏状态云的相互粒子能量,并观察到相同的U形模式。然后我们证明变换器可以近似能量基础采样器,在各层构造相同的U形能量。

🔬 方法详解

问题定义:本论文旨在解决大型语言模型在数据生成任务中的上下文学习能力不足的问题。现有方法在生成任务中无法有效利用上下文信息,限制了其生成质量和多样性。

核心思路:论文的核心思路是证明冻结的变换器能够模拟迭代生成采样器,进而实现上下文学习在数据生成中的应用。通过分析变换器的结构,揭示其在生成过程中的潜在能力。

技术框架:整体架构包括两个主要模块:首先是闭式扩散采样器的实现,其次是通过语义主题采样进行实证分析。变换器的softmax注意力和前馈层在生成过程中发挥关键作用。

关键创新:最重要的技术创新在于展示了变换器不仅可以进行传统的上下文学习,还能够在数据生成中模拟复杂的生成过程,特别是通过能量基础的采样方法构造U形能量分布。

关键设计:在设计中,采用了特定的参数设置以优化softmax注意力的责任权重计算,并通过前馈层实现了有效的欧拉更新,确保生成过程的稳定性和准确性。通过对隐藏状态的归一化处理,增强了模型对语义主题的捕捉能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,变换器在语义主题采样任务中展现出显著的性能提升,尤其是在生成质量和多样性方面。具体而言,模型在不同主题的生成任务中均表现出U形能量分布,验证了其生成能力的有效性和一致性。

🎯 应用场景

该研究的潜在应用领域包括自然语言生成、对话系统和内容创作等。通过提升语言模型在数据生成任务中的表现,可以为各种应用提供更高质量的生成结果,推动智能助手和创作工具的发展,具有重要的实际价值和未来影响。

📄 摘要(原文)

A growing body of work establishes that large language models are not mere statistical memorizers, but are capable of in-context learning: performing inference at test time using only examples provided in the prompt, without any parameter updates. Prior theoretical work has shown that this capability extends to supervised learning tasks such as linear regression. We prove that in-context learning extends further to \emph{data generation}: frozen transformers can simulate iterative generative samplers from in-context samples. We first show that transformers can realize closed-form and smoothed closed-form diffusion samplers. The construction identifies a concrete generative role for softmax attention: it computes responsibility weights and weighted empirical averages, while feedforward layers implement Euler updates. To empirically relate these constructions to pretrained language models, we study \emph{semantic-topic sampling}: prompts consisting of words drawn from a common semantic category, such as animals, foods, or cities. Across transformer layers, the normalized hidden states exhibit a two-stage geometry: they move toward a uniform spherical reference in intermediate layers and then return to structured, topic-dependent representations near the output. We further measure an interacting-particle energy on these hidden-state clouds and observe the same U-shape pattern. We then prove that transformers can approximate an energy-based sampler, constructing the same U-shape energy across the layers.