ASPIRO: Any-shot Structured Parsing-error-Induced ReprOmpting for Consistent Data-to-Text Generation

📄 arXiv: 2310.17877v1 📥 PDF

作者: Martin Vejvar, Yasutaka Fujimoto

分类: cs.CL, cs.AI, cs.LG

发布日期: 2023-10-27

备注: Accepted to Findings of EMNLP2023, code available at https://github.com/vejvarm/ASPIRO


💡 一句话要点

提出ASPIRO以解决数据到文本生成中的解析错误问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 数据到文本生成 大型语言模型 解析错误 一致性验证 自然语言处理 模板生成 机器学习

📋 核心要点

  1. 现有方法在结构化数据转化为文本时,往往依赖于示例实体的复制,导致生成的模板缺乏灵活性和一致性。
  2. ASPIRO通过引导大型语言模型生成实体无关的模板,并结合实时解析检查和一致性验证,解决了这一问题。
  3. 实验结果表明,ASPIRO在生成RDF三元组的语言表达时,解析错误率平均降低66%,在多个指标上表现优异。

📝 摘要(中文)

我们提出了ASPIRO,一种在零到少量样本设置下将结构化数据转化为简短模板句子的方案。与以往方法不同,我们的方法直接引导大型语言模型(LLMs)生成与实体无关的模板,而不是依赖于模型忠实复制给定示例实体或手动验证/制作模板。我们结合了算法解析检查触发的LLM重新提示,以及基于PARENT指标的生成一致性验证,以实时识别和纠正模板生成问题。与直接LLM输出相比,ASPIRO在DART数据集上生成RDF三元组的语言表达时,平均减少了66%的解析错误率。我们的最佳5-shot text-davinci-003设置在Rel2Text数据集上获得了BLEU 50.62、METEOR 45.16、BLEURT 0.82、NUBIA 0.87和PARENT 0.8962的得分,有效与近期微调的预训练语言模型竞争。

🔬 方法详解

问题定义:本论文旨在解决结构化数据转化为文本时的解析错误问题。现有方法通常依赖于示例实体的复制,导致生成的模板缺乏灵活性和一致性,且难以适应不同的输入数据。

核心思路:ASPIRO的核心思路是引导大型语言模型直接生成与实体无关的模板,而不是依赖于具体的示例。这种设计使得生成的模板在面对不同数据时更加灵活,并能实时调整。

技术框架:ASPIRO的整体架构包括数据输入、模板生成、解析检查和一致性验证四个主要模块。首先,输入结构化数据,然后通过LLM生成初始模板,接着进行解析检查,最后通过PARENT指标进行一致性验证和实时调整。

关键创新:ASPIRO的主要创新在于结合了LLM重新提示和算法解析检查,能够在生成过程中实时识别和纠正错误。这与传统方法的静态生成和后期验证形成了鲜明对比。

关键设计:在参数设置上,ASPIRO采用了5-shot的text-davinci-003模型,并在损失函数中引入了PARENT指标,以确保生成模板的一致性和准确性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

ASPIRO在DART数据集上实现了66%的解析错误率降低,显示出其在生成RDF三元组语言表达方面的显著优势。此外,在Rel2Text数据集上,ASPIRO的5-shot设置在多个评估指标上均表现出色,BLEU得分达到50.62,METEOR得分为45.16,显示出与最新微调预训练语言模型的竞争力。

🎯 应用场景

ASPIRO的研究成果在多个领域具有潜在应用价值,包括自然语言生成、智能问答系统和数据驱动的内容创作等。通过提高数据到文本生成的准确性和灵活性,ASPIRO能够为信息提取和自动化内容生成提供更可靠的支持,推动相关技术的发展。

📄 摘要(原文)

We present ASPIRO, an approach for structured data verbalisation into short template sentences in zero to few-shot settings. Unlike previous methods, our approach prompts large language models (LLMs) to directly produce entity-agnostic templates, rather than relying on LLMs to faithfully copy the given example entities, or validating/crafting the templates manually. We incorporate LLM re-prompting, triggered by algorithmic parsing checks, as well as the PARENT metric induced consistency validation to identify and rectify template generation problems in real-time. ASPIRO, compared to direct LLM output, averages 66\% parsing error rate reduction in generated verbalisations of RDF triples on the DART dataset. Our best 5-shot text-davinci-003 setup, scoring BLEU of 50.62, METEOR of 45.16, BLEURT of 0.82, NUBIA of 0.87, and PARENT of 0.8962 on the Rel2Text dataset, competes effectively with recent fine-tuned pre-trained language models.