AvalonBench: Evaluating LLMs Playing the Game of Avalon
作者: Jonathan Light, Min Cai, Sheng Shen, Ziniu Hu
分类: cs.AI, cs.CL
发布日期: 2023-10-08 (更新: 2023-11-08)
💡 一句话要点
提出AvalonBench以评估大型语言模型在社交推理游戏中的表现
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 社交推理 游戏环境 决策能力 智能体评估
📋 核心要点
- 现有的LLM在复杂社交推理游戏中的决策和语言处理能力尚未得到充分评估。
- 论文提出AvalonBench,作为一个专门的游戏环境,旨在评估多智能体LLM在亚瓦隆游戏中的表现。
- 实验结果显示,LLM在与基于规则的机器人对战时表现不佳,胜率明显低于设计的基线对手。
📝 摘要(中文)
本文探讨了大型语言模型(LLMs)在战略社交推理游戏《抵抗:亚瓦隆》中的潜力。亚瓦隆游戏要求玩家在动态变化的游戏阶段中做出明智决策,并与其他玩家进行欺骗、推理和谈判。为此,本文引入了AvalonBench,一个综合性的游戏环境,旨在评估多智能体LLM。AvalonBench包含亚瓦隆游戏环境、基于规则的机器人作为基线对手,以及针对每个角色定制提示的ReAct风格LLM代理。评估结果显示,LLM在游戏中的表现存在明显差距,未来AvalonBench有望成为开发更高级LLM和智能体框架的良好测试平台。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在复杂社交推理游戏中的决策能力不足的问题。现有方法未能有效评估LLM在动态游戏环境中的表现,尤其是在需要推理和社交互动的场景中。
核心思路:AvalonBench的核心思路是创建一个专门的游戏环境,结合规则基础的对手和定制的LLM代理,以便全面评估LLM在亚瓦隆游戏中的表现。这样的设计使得研究者能够深入分析LLM在社交推理和决策过程中的能力。
技术框架:AvalonBench的整体架构包括三个主要模块:1)亚瓦隆游戏环境,提供游戏规则和动态变化;2)基于规则的机器人,作为基线对手进行对比;3)ReAct风格的LLM代理,针对每个角色设计特定的提示。
关键创新:AvalonBench的主要创新在于其综合性和针对性,能够同时评估多种类型的LLM代理在复杂社交推理游戏中的表现。这与现有方法的单一评估方式形成了鲜明对比。
关键设计:在设计中,LLM代理使用了定制的提示,以适应不同角色的需求。此外,实验中对胜率进行了详细记录,揭示了LLM与基线对手之间的性能差距。
🖼️ 关键图片
📊 实验亮点
实验结果显示,ChatGPT在扮演好角色时的胜率为22.2%,而基于规则的好角色机器人在相同设置下的胜率为38.2%。这一明显的性能差距突显了当前LLM在复杂社交推理游戏中的局限性,表明了进一步研究的必要性。
🎯 应用场景
AvalonBench的研究成果可广泛应用于游戏AI、社交机器人和智能对话系统等领域。通过深入理解LLM在复杂社交推理中的表现,未来可以推动更智能的对话系统和决策支持工具的发展,提升人机交互的自然性和有效性。
📄 摘要(原文)
In this paper, we explore the potential of Large Language Models (LLMs) Agents in playing the strategic social deduction game, Resistance Avalon. Players in Avalon are challenged not only to make informed decisions based on dynamically evolving game phases, but also to engage in discussions where they must deceive, deduce, and negotiate with other players. These characteristics make Avalon a compelling test-bed to study the decision-making and language-processing capabilities of LLM Agents. To facilitate research in this line, we introduce AvalonBench - a comprehensive game environment tailored for evaluating multi-agent LLM Agents. This benchmark incorporates: (1) a game environment for Avalon, (2) rule-based bots as baseline opponents, and (3) ReAct-style LLM agents with tailored prompts for each role. Notably, our evaluations based on AvalonBench highlight a clear capability gap. For instance, models like ChatGPT playing good-role got a win rate of 22.2% against rule-based bots playing evil, while good-role bot achieves 38.2% win rate in the same setting. We envision AvalonBench could be a good test-bed for developing more advanced LLMs (with self-playing) and agent frameworks that can effectively model the layered complexities of such game environments.