RAP: Research Attention Prediction Reveals Target-Conditioned Evidence Acquisition Biases
作者: Yingqian Wu, Jingcong Liang, Siyuan Wang, Zhenfei Yin, Philip Torr, Junchi Yu, Zhongyu Wei
分类: cs.AI, cs.CL
发布日期: 2026-09-09
💡 一句话要点
提出研究注意力预测模型以解决研究关注度评估难题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 研究注意力预测 大型语言模型 论文分享预测 指数加权移动平均 历史数据分析 科研效率提升
📋 核心要点
- 现有方法难以准确评估大型语言模型在研究注意力变化中的表现,缺乏可验证的结果。
- 论文提出了研究注意力预测(RAP),通过分析历史数据来预测未来研究方向的论文分享情况。
- 实验结果表明,尽管搜索有助于预测,但在组合准确性上仍低于EWMA基线,微调模型能显著提升预测性能。
📝 摘要(中文)
随着大型语言模型(LLMs)逐渐成为研究代理,其跟踪研究注意力变化的能力难以评估,因为评审和研究想法缺乏独特的可验证结果。本文提出了研究注意力预测(RAP),这是一个涵盖278个AI/ML领域和1390个事件的滚动基准。在每个截止点,LLM代理搜索时间限制的arXiv语料库,并预测未来六个月在八个固定研究方向上的论文分享。尽管搜索通常有帮助,但所有四个诊断模型在组合准确性上均表现不如精确计数的指数加权移动平均(EWMA)基线。我们识别出两个相关瓶颈。在累积历史访问下,状态传递在所有四个诊断模型中优于直接预测;而冻结证据重播将这一逆转的共享组件与面向预测的策略检索较少的近期证据联系起来。即使有确切的历史活动,未来特定更新仍然有限,只有GPT-5.5加上重新开放搜索稍微超越了EWMA。对已实现结果的微调使Qwen3-4B在后期来源的持出领域上预测的Spearman相关性提高了0.105,并在变化丰富的事件上也有提升。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在研究注意力变化跟踪中的评估难题,现有方法缺乏可验证的结果,导致准确性不足。
核心思路:提出研究注意力预测(RAP)模型,通过分析历史论文分享数据,结合时间限制的搜索策略,来提高对未来研究方向的预测能力。
技术框架:RAP模型包括数据收集、历史数据分析、预测模型训练和评估四个主要模块。首先从arXiv收集相关数据,然后利用LLM进行分析和预测。
关键创新:该研究的创新点在于引入了状态传递机制和冻结证据重播策略,显著改善了模型在历史数据利用上的表现,与传统方法相比,能够更有效地处理信息。
关键设计:模型采用了指数加权移动平均(EWMA)作为基线,设置了多种参数以优化预测效果,并通过微调提升了特定领域的预测准确性。实验中还使用了Spearman相关性作为评估指标。
🖼️ 关键图片
📊 实验亮点
实验结果显示,尽管所有四个诊断模型在组合准确性上均低于EWMA基线,但微调后的Qwen3-4B模型在后期来源的持出领域上Spearman相关性提高了0.105,且在变化丰富的事件上也表现出显著提升,验证了模型的有效性。
🎯 应用场景
该研究的潜在应用领域包括学术研究、科技趋势分析和文献推荐系统。通过准确预测研究注意力的变化,能够帮助研究人员更好地把握前沿动态,优化研究方向和资源配置,提升科研效率。未来,该模型可扩展至其他领域的趋势预测。
📄 摘要(原文)
Large language models (LLMs) increasingly act as research agents, yet their ability to track shifts in research attention is difficult to evaluate because reviews and research ideas lack uniquely verifiable outcomes. We introduce Research Attention Prediction (RAP), a rolling benchmark covering 278 AI/ML fields and 1,390 episodes. At each cut-off, an LLM agent searches a temporally restricted arXiv corpus and predicts the next six months' paper shares across eight frozen research directions. Search generally helps, but all four diagnostic models perform worse than an exact-count exponentially weighted moving average (EWMA) baseline in compositional accuracy. We identify two linked bottlenecks. Under cumulative-history access, State carry-forward outperforms direct Forecast for all four diagnostic models; frozen-evidence replay links a shared component of this reversal to Forecast-oriented policies retrieving a smaller share of recent evidence. Even with exact historical activity, future-specific updating remains limited, with only GPT-5.5 plus reopened Search slightly surpassing EWMA. Fine-tuning on realised outcomes improves Qwen3-4B's forecast Spearman correlation by 0.105 on held-out fields at later origins, with gains also on change-rich episodes.