A Confederacy of Models: a Comprehensive Evaluation of LLMs on Creative Writing

📄 arXiv: 2310.08433v1 📥 PDF

作者: Carlos Gómez-Rodríguez, Paul Williams

分类: cs.CL, cs.CY

发布日期: 2023-10-12

备注: Accepted for publication in Findings of EMNLP 2023


💡 一句话要点

评估多种LLM在创意写作中的表现

🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction)

关键词: 大型语言模型 创意写作 人机协作 评估标准 幽默感

📋 核心要点

  1. 现有的LLM在创意写作任务中面临挑战,尤其是在想象力和幽默感方面。
  2. 本研究通过评估多种LLM在特定创意写作场景中的表现,探索其在流畅性、连贯性等维度的能力。
  3. 实验结果表明,部分商业LLM在创意写作上与人类作者相当,而开源模型则表现较弱。

📝 摘要(中文)

本研究评估了一系列最新的大型语言模型(LLMs)在英语创意写作中的表现,这是一个需要想象力、连贯性和风格的复杂任务。我们选择了一个困难的开放场景,避免训练数据重用:描述普利策奖获奖小说《无政府状态的联盟》中主角伊格纳修斯·J·瑞利与一种史前飞行爬行动物——翼龙之间的单场战斗。我们要求多种LLM和人类撰写此故事,并进行人类评估,涉及流畅性、连贯性、原创性、幽默感和风格等多个标准。结果显示,一些最先进的商业LLM在大多数维度上与我们的作者相当或略有超越,而开源LLM则表现较差。人类在创造力上仍占优势,而幽默感则在能够与人类相媲美的LLM和无法处理幽默的LLM之间存在二元分化。我们讨论了研究的意义和局限性,并提出未来研究的方向。

🔬 方法详解

问题定义:本研究旨在评估不同LLM在创意写作中的表现,特别是在复杂的开放场景中,现有方法在想象力和幽默感方面存在不足。

核心思路:通过设计一个独特的写作任务,避免训练数据重用,比较多种LLM与人类作者在创意写作中的表现,旨在揭示LLM的优势和局限。

技术框架:研究首先选择了一个开放式写作场景,然后邀请多种LLM和人类作者进行创作,最后通过人类评估对结果进行分析,涉及多个评估维度。

关键创新:本研究的创新在于选择了一个独特且复杂的写作场景,避免了常见的训练数据重用问题,从而提供了更真实的评估环境。

关键设计:在评估过程中,采用了流畅性、连贯性、原创性、幽默感和风格等多个标准,确保了评估的全面性和客观性。实验中对LLM和人类作者的表现进行了系统对比。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,部分商业LLM在流畅性、连贯性和原创性等维度上与人类作者相当,而开源LLM的表现则明显落后。幽默感的处理能力在不同LLM之间存在显著差异,部分模型能够与人类相媲美。

🎯 应用场景

该研究的结果对创意写作、内容生成和人机协作等领域具有重要的应用价值。通过深入理解LLM在创意任务中的表现,可以为未来的AI创作工具提供改进方向,推动人机协作的进一步发展。

📄 摘要(原文)

We evaluate a range of recent LLMs on English creative writing, a challenging and complex task that requires imagination, coherence, and style. We use a difficult, open-ended scenario chosen to avoid training data reuse: an epic narration of a single combat between Ignatius J. Reilly, the protagonist of the Pulitzer Prize-winning novel A Confederacy of Dunces (1980), and a pterodactyl, a prehistoric flying reptile. We ask several LLMs and humans to write such a story and conduct a human evalution involving various criteria such as fluency, coherence, originality, humor, and style. Our results show that some state-of-the-art commercial LLMs match or slightly outperform our writers in most dimensions; whereas open-source LLMs lag behind. Humans retain an edge in creativity, while humor shows a binary divide between LLMs that can handle it comparably to humans and those that fail at it. We discuss the implications and limitations of our study and suggest directions for future research.