Probing the Creativity of Large Language Models: Can models produce divergent semantic association?

📄 arXiv: 2310.11158v1 📥 PDF

作者: Honghua Chen, Nai Ding

分类: cs.CL, cs.LG

发布日期: 2023-10-17

备注: Accepted for publication in Findings of EMNLP 2023


💡 一句话要点

探讨大型语言模型的创造力,评估其语义发散关联能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 创造力 发散关联任务 语义距离 解码策略 人机协作 自然语言处理

📋 核心要点

  1. 现有大型语言模型在创造性内容生成方面的能力尚未得到充分验证,缺乏系统性评估。
  2. 本研究采用发散关联任务(DAT)来客观测量模型的创造力,比较不同模型和解码策略的表现。
  3. 实验结果表明,GPT-4在贪婪搜索策略下超越96%的人类,而其他模型在随机采样和温度缩放下也取得了显著提升。

📝 摘要(中文)

大型语言模型在语言处理方面表现出色,但其生成创造性内容的能力尚不明确。本研究通过认知视角探讨大型语言模型的创造性思维,采用发散关联任务(DAT)作为客观测量工具,要求模型生成无关词并计算其语义距离。研究结果显示:使用贪婪搜索策略时,GPT-4的表现超过96%的人类,而GPT-3.5-turbo则超出人类平均水平。随机采样和温度缩放在除GPT-4外的模型中有效提高DAT得分,但在创造力与稳定性之间存在权衡。这些结果表明,先进的大型语言模型具有发散的语义关联,这是创造力的基本过程。

🔬 方法详解

问题定义:本研究旨在探讨大型语言模型的创造力,尤其是它们在生成无关词汇时的语义发散能力。现有方法未能系统评估模型的创造性表现,尤其是在不同解码策略下的表现差异。

核心思路:通过发散关联任务(DAT)来量化模型的创造性,要求模型生成语义上无关的词汇,并计算其语义距离,从而评估其创造性思维能力。

技术框架:研究采用了不同的解码策略,包括贪婪搜索、随机采样和温度缩放,比较不同大型语言模型(如GPT-4和GPT-3.5-turbo)的表现。整体流程包括模型输入、生成无关词汇、计算语义距离和评估创造性得分。

关键创新:本研究首次系统性地使用发散关联任务来评估大型语言模型的创造力,揭示了模型在生成无关词汇时的语义发散能力,填补了现有研究的空白。

关键设计:在实验中,贪婪搜索策略被用于评估模型的最佳表现,而随机采样和温度缩放则用于提高其他模型的DAT得分,研究中还探讨了创造力与稳定性之间的权衡。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,使用贪婪搜索策略时,GPT-4的表现超过96%的人类,而GPT-3.5-turbo的表现也超出人类平均水平。此外,随机采样和温度缩放在其他模型中有效提高了DAT得分,尽管存在创造力与稳定性之间的权衡。

🎯 应用场景

该研究的潜在应用领域包括创意写作、广告文案生成和游戏设计等,能够为内容创作提供新的思路和工具。通过提升大型语言模型的创造力,未来可能推动人机协作的创新方式,促进更具创意的人工智能应用。

📄 摘要(原文)

Large language models possess remarkable capacity for processing language, but it remains unclear whether these models can further generate creative content. The present study aims to investigate the creative thinking of large language models through a cognitive perspective. We utilize the divergent association task (DAT), an objective measurement of creativity that asks models to generate unrelated words and calculates the semantic distance between them. We compare the results across different models and decoding strategies. Our findings indicate that: (1) When using the greedy search strategy, GPT-4 outperforms 96% of humans, while GPT-3.5-turbo exceeds the average human level. (2) Stochastic sampling and temperature scaling are effective to obtain higher DAT scores for models except GPT-4, but face a trade-off between creativity and stability. These results imply that advanced large language models have divergent semantic associations, which is a fundamental process underlying creativity.