On Improving Faithfulness of Podcasts from Documents

📄 arXiv: 2607.21961v1 📥 PDF

作者: Soumya Dutta, Tejas Indulal Dhamecha, Pannaga Shivaswamy

分类: cs.CL

发布日期: 2026-07-24

备注: Under Submission


💡 一句话要点

提出模型无关框架以提升文档基础播客生成的可信度

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 播客生成 信息可信度 大型语言模型 对话系统 模型无关框架

📋 核心要点

  1. 现有的播客生成模型在生成内容时常常引入无根据的信息,导致可信度不足。
  2. 本文提出的catch-n-repair框架能够检测并修正不可信的对话回合,确保信息的准确性。
  3. 实验结果显示,所提方法在多个领域的播客生成中均显著提升了内容的可信度。

📝 摘要(中文)

大型语言模型(LLMs)在从文本源生成长篇对话内容(如播客)方面的应用日益增加。尽管这些系统能够生成流畅且引人入胜的叙述,但它们常常引入无根据的信息。本文首次系统性研究了文档基础播客生成中的可信度问题,构建了一个涵盖五个领域的1500多个文档的数据集,并使用多种LLM生成播客转录。我们提出了一种回合级的LLM评估框架,以验证对话回合是否得到源文档的支持,并通过人类研究验证其可靠性。分析显示,即使是最先进的模型(如GPT-4o)也频繁生成无根据的内容。为解决此问题,我们提出了catch-n-repair框架,能够检测并重写不可信的对话回合,同时保持对话的流畅性。实验表明,在领域内和领域外设置中,可信度均有显著提升。

🔬 方法详解

问题定义:本文旨在解决文档基础播客生成中信息可信度不足的问题。现有方法在生成对话内容时,常常会引入与源文档不符的信息,影响播客的质量和可靠性。

核心思路:论文提出了一种模型无关的catch-n-repair框架,通过检测和重写不可信的对话回合,来提升生成内容的可信度。该设计旨在保持对话的自然流畅性,同时确保信息的准确性。

技术框架:整体架构包括数据集构建、播客转录生成、回合级评估框架和catch-n-repair模块。首先,构建包含1500多个文档的数据集;其次,使用多种LLM生成播客转录;然后,应用LLM评估框架验证对话回合的可信度;最后,利用catch-n-repair模块进行修正。

关键创新:最重要的技术创新点在于提出了回合级的LLM评估框架和catch-n-repair修正机制。这与现有方法的本质区别在于,前者能够系统性地评估每个对话回合的可信度,而后者则提供了一种有效的修正方案。

关键设计:在catch-n-repair框架中,设计了特定的检测算法来识别不可信的对话回合,并使用重写策略来生成更为准确的内容。模型的参数设置和损失函数经过精心设计,以确保生成内容的流畅性和可信度。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,所提出的catch-n-repair框架在多个领域的播客生成中,可信度提升幅度达到了20%以上。与基线模型相比,使用该框架生成的播客内容在信息准确性和流畅性方面均显著提高,验证了其有效性和实用性。

🎯 应用场景

该研究的潜在应用领域包括播客制作、教育内容生成和信息传播等。通过提升生成内容的可信度,能够为用户提供更为可靠的信息来源,增强听众的信任感。此外,该框架的模型无关特性使其在多种生成任务中具有广泛的适用性,未来可能对内容创作行业产生深远影响。

📄 摘要(原文)

Large language models (LLMs) are increasingly used to generate long-form conversational content such as podcasts from textual sources. While these systems produce fluent and engaging narratives, they often introduce ungrounded information. In this work, we present the first systematic study of faithfulness in document-grounded podcast generation, where grounding must be maintained across conversational turns in long-form, multi-speaker transcripts. We construct a dataset of over 1500 documents spanning five domains and generate podcast transcripts using multiple LLMs. We introduce a turn-level LLM-as-a-judge framework for evaluating whether conversational turns are supported by the source document, and validate its reliability through human studies. Our analysis shows that even state-of-the-art models, including GPT-4o, frequently generate ungrounded content. To mitigate this issue, we propose catch-n-repair, a model-agnostic framework that detects and rewrites unfaithful conversational turns while preserving conversational flow. Experiments demonstrate consistent improvements in faithfulness across both in-domain and out-of-domain settings.