D2VBench: Benchmarking Large Language Models with Value Dilemmas in Daily Scenarios
作者: Siyi Hao, Yidi Cao, Linhao Yu, Yuqi Ren, Deyi Xiong
分类: cs.CL
发布日期: 2026-07-22
备注: 22 pages,11 figures
🔗 代码/项目: GITHUB
💡 一句话要点
提出D2VBench以解决大语言模型价值对齐评估问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大语言模型 价值对齐 评估基准 伦理问题 多项选择题 开放式问题 细粒度标注 日常困境
📋 核心要点
- 现有评估基准在日常场景中对价值困境的覆盖不足,无法有效评估大语言模型的价值对齐。
- 提出D2VBench基准,包含10,000个真实日常困境场景,结合多项选择题和开放式问题进行评估。
- 实验结果显示D2VBench在评估大语言模型的价值对齐方面具有高可靠性和稳健性,提供了更细致的评估工具。
📝 摘要(中文)
随着大语言模型(LLMs)在现实场景中的广泛应用,其输出的价值含义变得至关重要。然而,现有评估基准在日常场景中对价值困境的覆盖不足,且评估形式过于简单,无法有效评估LLMs的价值对齐。为了解决这些问题,本文提出了D2VBench,这是一个包含10,000个真实日常困境场景的价值对齐基准,基于158个手动标注的细粒度价值概念,通过LLMs与人类的多阶段协作构建而成。我们提出了一种混合评估范式,结合了多项选择题和开放式问题,对八种主流LLMs进行了全面评估。实验结果表明,D2VBench具有高可靠性和稳健性,能够有效反映LLMs在不同价值类别和维度上的对齐情况,为价值对齐研究提供了更现实和细致的工具。
🔬 方法详解
问题定义:本文旨在解决现有评估基准在日常场景中对价值困境覆盖不足的问题,现有方法无法有效评估大语言模型的价值对齐情况。
核心思路:D2VBench通过构建包含10,000个真实日常困境的基准,结合多项选择题和开放式问题的混合评估方式,旨在全面评估LLMs的价值对齐。
技术框架:D2VBench的构建分为多个阶段,包括人类与LLMs的协作生成困境场景,手动标注细粒度价值概念,以及设计混合评估范式。
关键创新:D2VBench的创新在于其大规模的真实日常困境场景和细粒度的价值概念标注,显著提升了对LLMs价值对齐的评估能力,与现有方法相比更具实用性和准确性。
关键设计:在设计中,采用了158个细粒度价值概念进行标注,评估过程中结合了多项选择题和开放式问题,以确保评估的全面性和深度。实验中还考虑了不同价值类别和维度的对齐情况。
🖼️ 关键图片
📊 实验亮点
实验结果表明,D2VBench在评估八种主流大语言模型时,展现出高可靠性和稳健性,能够有效反映模型在不同价值类别和维度上的对齐情况。具体性能数据和对比基线未详细列出,需进一步查阅原文以获取更多信息。
🎯 应用场景
D2VBench的研究成果可广泛应用于大语言模型的开发和评估,尤其是在需要考虑伦理和价值观的场景中,如自动化客服、内容生成和决策支持系统等。通过提供更细致的价值对齐评估工具,未来可以推动大语言模型在社会应用中的安全性和可靠性。
📄 摘要(原文)
With the wide application of large language models (LLMs) in real-world scenarios, the value implication of their outputs is crucial. However, existing evaluation benchmarks suffer from insufficient coverage of value dilemmas in daily scenarios involving multiple value conflicts and simplistic evaluation formalisms that fail to assess LLMs' value alignment. To address these issues, we propose D2VBench, a value alignment benchmark comprising 10,000 instances of real daily dilemma scenarios constructed through a multi-stage collaboration between LLMs and humans, grounded in 158 manually annotated fine-grained value concepts. For evaluation on the benchmark, we present a hybrid evaluation paradigm that integrates multiple-choice questions with open-ended questions. We conduct comprehensive evaluations on eight mainstream LLMs. Experimental results demonstrate that D2VBench exhibits high reliability and robustness, effectively reflecting the LLMs' alignment across different value categories and dimensions, and providing a more realistic and fine-grained tool for research on value alignment. The dataset is available at https://github.com/tjunlp-lab/D2VBench.