JobHop v2: A Large-Scale Career Trajectory Dataset from Unstructured Resumes

📄 arXiv: 2607.11715v1 📥 PDF

作者: Iman Johary, Guillaume Bied, Alexandru C. Mara, Tijl De Bie

分类: cs.CL

发布日期: 2026-07-13


💡 一句话要点

提出JobHop v2以解决职业轨迹数据不足问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 职业轨迹数据 大语言模型 数据提取 注释生成 劳动力市场分析 职位推荐 多语言简历

📋 核心要点

  1. 现有的职业轨迹数据集普遍较小且使用受限,缺乏丰富的注释和真实文本数据。
  2. 论文提出通过大语言模型从多语言简历中提取数据,构建了一个更大且注释更丰富的数据集JobHop v2。
  3. 实验结果显示,JobHop v2的提取器在与基线模型的比较中,表现接近标注者一致性上限,仅落后1.1-2.7个百分点。

📝 摘要(中文)

大规模、丰富注释的职业轨迹数据是劳动力规划、职位推荐和劳动市场分析的基础,但现有公开数据集普遍较小、使用受限或基于预先标准化的职业代码。本文提出JobHop v2,这是JobHop数据集的改进版本,通过从约440,000份多语言简历中提取数据而构建。该数据集包含355,315条职业轨迹,注释了ESCO职业代码、季度级时间信息和五级教育水平,显著提升了覆盖范围和注释的丰富性。相较于v1,JobHop v2引入了基于推理控制的LLM推断的重新设计提取管道,达到了100%的JSON解析率,并在评估中表现接近标注者一致性上限。

🔬 方法详解

问题定义:现有的职业轨迹数据集在规模和注释丰富性上存在不足,限制了劳动力市场分析和职位推荐的有效性。

核心思路:通过使用大语言模型(LLM)从大量多语言简历中提取职业轨迹数据,旨在提升数据集的规模和注释质量。

技术框架:整体架构包括数据收集、LLM提取、注释生成和评估四个主要模块。数据收集阶段从约440,000份简历中提取信息,LLM提取阶段采用推理控制机制进行数据处理。

关键创新:引入了基于推理控制的LLM推断和重试机制,确保了100%的JSON解析率,并且在注释质量上接近标注者一致性上限。

关键设计:在提取过程中,采用了更丰富的提取模式和修订的评估协议,确保了数据的准确性和可靠性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

在与多个基线模型的比较中,JobHop v2的最佳提取器表现出色,接近标注者一致性上限,落后仅1.1-2.7个百分点,显示出其在职业轨迹数据提取中的优越性和可靠性。

🎯 应用场景

JobHop v2的数据集可广泛应用于职业推荐系统、劳动力市场分析和人力资源管理等领域。其丰富的注释和大规模数据为研究人员和企业提供了宝贵的资源,推动了职业轨迹研究的深入发展,未来可能影响职业规划和招聘策略的制定。

📄 摘要(原文)

Large-scale, richly annotated career trajectory data underpins workforce planning, job recommendation, and labour market analysis, yet publicly available datasets are either small, closed to independent use, or built from pre-standardized occupational codes with LLM-synthesized rather than authentic free text. We present JobHop~v2, an improved version of the publicly available JobHop dataset, constructed through end-to-end large language model (LLM) extraction from a corpus of ${\sim}440{,}000$ pseudonymized, multilingual resumes provided by VDAB, the Flemish Public Employment Service. The released dataset comprises $355{,}315$ career trajectories annotated with ESCO occupational codes, quarter-level temporal information, and normalized five-level education attainment, broadening both the coverage and the annotation richness of the original release. Relative to v1, JobHop~v2 introduces a redesigned extraction pipeline based on reasoning-controlled LLM inference with a retry mechanism (achieving a 100% JSON parse rate), a richer extraction schema, and a revised evaluation protocol scored against three complementary annotation baselines. Evaluated against these baselines, our best extractor comes closest to the inter-annotator agreement ceiling among all compared models, trailing it by only 1.1-2.7 percentage points. The dataset and code are publicly released to support reproducible career-trajectory research.