Reproducing Omitted Temporal Expressions in Japanese News for Retrieval-Augmented Applications

📄 arXiv: 2609.09569v1 📥 PDF

作者: Tomoaki Yasuda, Shotaro Ishihara

分类: cs.CL

发布日期: 2026-09-09

备注: EMNLP 2026 Industry Track


💡 一句话要点

提出jaROTE以解决日本新闻中省略时间表达的问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 时间表达 信息检索 自然语言处理 规则基础 日本新闻

📋 核心要点

  1. 现有方法在处理日本新闻中的省略时间表达时,容易导致时间不匹配和理解不稳定。
  2. 本文提出jaROTE,通过使用发布日期作为上下文,重现省略的时间表达为具体日期或时间区间。
  3. 实验结果显示,jaROTE在性能上与大型语言模型相当,并且在时间限制下的检索表现显著提升。

📝 摘要(中文)

新闻文章中常常包含省略的时间表达,如仅提及日期或月份,这些表达需要参考发布日期进行解释。在搜索和检索增强生成(RAG)系统中,单独处理这些文章时,省略会导致时间不匹配和大型语言模型的不稳定解释。本文聚焦于在文章索引之前,利用发布日期作为外部上下文,重现省略的时间表达为具体的日期或时间区间。基于已有的时间表达提取和规范化技术,并结合对日本新闻文章的手动分析,提出了jaROTE,一个针对日本新闻的基于规则的处理管道。实验表明,jaROTE在两个新闻语料库上表现出色,性能与大型语言模型相当,同时提供快速、低成本的处理方案。进一步的研究表明,时间重现改善了时间限制下的词汇检索,展示了基于发布日期的规范化在日本新闻检索中的实际价值。

🔬 方法详解

问题定义:本文旨在解决日本新闻中省略时间表达的问题,现有方法在处理这些省略时容易导致时间不匹配和理解不稳定,影响检索效果。

核心思路:论文提出的jaROTE通过利用发布日期作为外部上下文,重现省略的时间表达为具体的日期或时间区间,从而提高检索的准确性和稳定性。

技术框架:jaROTE的整体架构包括时间表达提取、规范化和重现三个主要模块。首先提取文章中的时间表达,然后根据发布日期进行规范化,最后重现为具体的时间信息。

关键创新:jaROTE的主要创新在于其基于规则的处理管道,能够在低成本和高效的情况下,提供与大型语言模型相当的性能,解决了省略时间表达的具体化问题。

关键设计:在设计上,jaROTE采用了基于规则的算法,结合手动分析的结果,确保了时间表达的准确提取和重现。具体的参数设置和损失函数设计未在摘要中详细说明,需参考完整论文。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,jaROTE在两个新闻语料库上表现优异,性能与大型语言模型相当,且在时间限制下的词汇检索中显著提升,展示了其在实际应用中的有效性和优势。

🎯 应用场景

该研究的潜在应用领域包括新闻检索、信息检索系统和自然语言处理任务,尤其是在需要处理时间信息的场景中。通过提高时间表达的准确性,jaROTE能够显著提升检索系统的性能,具有广泛的实际价值和未来影响。

📄 摘要(原文)

News articles often contain omitted temporal expressions, such as day-only or month-only mentions, which must be interpreted with reference to the publication date. When such articles are indexed or processed as standalone text in search and retrieval-augmented generation (RAG) systems, these omissions can cause temporal mismatches and unstable interpretation by large language models. We focus on reproducing omitted temporal expressions as concrete dates or intervals using the publication date as external context before the articles are indexed for search and RAG applications. Specifically, building on established temporal-expression extraction and normalization techniques and informed by a manual analysis of Japanese news articles, we propose jaROTE, a rule-based pipeline for Japanese news. Experiments on two news corpora demonstrate that jaROTE achieves high performance, and remains competitive with LLMs while providing a fast, low-cost pipeline. We further show that temporal reproduction improves time-constrained lexical retrieval, demonstrating the practical value of publication-date-grounded normalization for Japanese news retrieval.