DORIS-MAE: Scientific Document Retrieval using Multi-level Aspect-based Queries

📄 arXiv: 2310.04678v3 📥 PDF

作者: Jianyou Wang, Kaicheng Wang, Xiaoyue Wang, Prudhviraj Naidu, Leon Bergen, Ramamohan Paturi

分类: cs.IR, cs.CL

发布日期: 2023-10-07 (更新: 2023-10-28)

备注: To appear in NeurIPS 2023 Datasets and Benchmarks Track

🔗 代码/项目: GITHUB


💡 一句话要点

提出DORIS-MAE以解决科学文献检索中的复杂查询问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 科学文献检索 复杂查询 数据集构建 大型语言模型 信息检索

📋 核心要点

  1. 现有文献检索方法在处理复杂多面的用户查询时表现不佳,缺乏有效的评估数据集支持。
  2. 提出DORIS-MAE任务,通过构建复杂查询的基准数据集和引入Anno-GPT框架,解决文献检索中的标注成本问题。
  3. 在对17种最新检索方法进行评估时,发现相较于传统数据集,性能显著下降,强调了对复杂查询处理方法的需求。

📝 摘要(中文)

在科学研究中,基于复杂多面的查询有效检索相关文献的能力至关重要。现有的评估数据集受限于高成本和高劳动强度的标注工作,难以有效代表复杂查询。为此,本文提出了一项新任务——基于多层次方面查询的科学文献检索(DORIS-MAE),旨在处理科学研究中用户查询的复杂性。我们开发了一个计算机科学领域的基准数据集,包含100个复杂查询案例及其相关文献,并为其生成了标注的相关性评分。此外,我们引入了Anno-GPT,一个可扩展的框架,用于验证大型语言模型在专家级数据集标注任务中的性能。通过LLM标注,DORIS-MAE数据集的成本降低了500倍,且质量未受影响。该数据集可扩展至4000多个子查询测试案例,且无需额外标注。

🔬 方法详解

问题定义:本文旨在解决科学文献检索中对复杂多面查询的有效处理问题。现有方法在面对此类查询时,往往缺乏足够的评估数据集,导致检索效果不理想。

核心思路:论文提出DORIS-MAE任务,通过构建一个包含复杂查询的基准数据集,结合Anno-GPT框架,显著降低标注成本并提高数据集的质量。

技术框架:整体架构包括数据集构建、复杂查询标注和检索方法评估三个主要模块。首先,收集复杂查询并生成相关文献;其次,利用Anno-GPT进行标注;最后,评估多种检索方法在该数据集上的表现。

关键创新:最重要的创新在于引入了Anno-GPT框架,使得大型语言模型能够高效地进行专家级数据集标注,降低了标注成本500倍,同时保持了标注质量。

关键设计:在数据集构建中,采用了100个复杂查询,每个查询配备100个相关文献,并为其生成了相关性评分。Anno-GPT框架的设计允许对标注过程进行自动化,减少了人工干预。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在对17种最新检索方法的评估中,DORIS-MAE数据集显示出显著的性能下降,强调了现有方法在处理复杂查询时的不足。这一发现促使研究者们重新审视和改进文献检索技术,以适应科学研究的需求。

🎯 应用场景

该研究的潜在应用领域包括科学文献检索、信息检索系统和智能问答系统等。通过提高复杂查询的处理能力,DORIS-MAE可以帮助研究人员更高效地获取相关文献,推动科学研究的进展。未来,该方法可能会影响其他领域的文献检索和数据挖掘技术。

📄 摘要(原文)

In scientific research, the ability to effectively retrieve relevant documents based on complex, multifaceted queries is critical. Existing evaluation datasets for this task are limited, primarily due to the high cost and effort required to annotate resources that effectively represent complex queries. To address this, we propose a novel task, Scientific DOcument Retrieval using Multi-level Aspect-based quEries (DORIS-MAE), which is designed to handle the complex nature of user queries in scientific research. We developed a benchmark dataset within the field of computer science, consisting of 100 human-authored complex query cases. For each complex query, we assembled a collection of 100 relevant documents and produced annotated relevance scores for ranking them. Recognizing the significant labor of expert annotation, we also introduce Anno-GPT, a scalable framework for validating the performance of Large Language Models (LLMs) on expert-level dataset annotation tasks. LLM annotation of the DORIS-MAE dataset resulted in a 500x reduction in cost, without compromising quality. Furthermore, due to the multi-tiered structure of these complex queries, the DORIS-MAE dataset can be extended to over 4,000 sub-query test cases without requiring additional annotation. We evaluated 17 recent retrieval methods on DORIS-MAE, observing notable performance drops compared to traditional datasets. This highlights the need for better approaches to handle complex, multifaceted queries in scientific research. Our dataset and codebase are available at https://github.com/Real-Doris-Mae/Doris-Mae-Dataset.