JobHop v2: A Large-Scale Career Trajectory Dataset from Unstructured Resumes
作者: Iman Johary, Guillaume Bied, Alexandru C. Mara, Tijl De Bie
分类: cs.CL
发布日期: 2026-07-13
💡 一句话要点
提出JobHop v2以解决职业轨迹数据不足问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 职业轨迹数据 大语言模型 数据提取 注释生成 劳动力市场分析 职位推荐 多语言简历
📋 核心要点
- 现有的职业轨迹数据集普遍较小且使用受限,缺乏丰富的注释和真实文本数据。
- 论文提出通过大语言模型从多语言简历中提取数据,构建了一个更大且注释更丰富的数据集JobHop v2。
- 实验结果显示,JobHop v2的提取器在与基线模型的比较中,表现接近标注者一致性上限,仅落后1.1-2.7个百分点。
📝 摘要(中文)
大规模、丰富注释的职业轨迹数据是劳动力规划、职位推荐和劳动市场分析的基础,但现有公开数据集普遍较小、使用受限或基于预先标准化的职业代码。本文提出JobHop v2,这是JobHop数据集的改进版本,通过从约440,000份多语言简历中提取数据而构建。该数据集包含355,315条职业轨迹,注释了ESCO职业代码、季度级时间信息和五级教育水平,显著提升了覆盖范围和注释的丰富性。相较于v1,JobHop v2引入了基于推理控制的LLM推断的重新设计提取管道,达到了100%的JSON解析率,并在评估中表现接近标注者一致性上限。
🔬 方法详解
问题定义:现有的职业轨迹数据集在规模和注释丰富性上存在不足,限制了劳动力市场分析和职位推荐的有效性。
核心思路:通过使用大语言模型(LLM)从大量多语言简历中提取职业轨迹数据,旨在提升数据集的规模和注释质量。
技术框架:整体架构包括数据收集、LLM提取、注释生成和评估四个主要模块。数据收集阶段从约440,000份简历中提取信息,LLM提取阶段采用推理控制机制进行数据处理。
关键创新:引入了基于推理控制的LLM推断和重试机制,确保了100%的JSON解析率,并且在注释质量上接近标注者一致性上限。
关键设计:在提取过程中,采用了更丰富的提取模式和修订的评估协议,确保了数据的准确性和可靠性。
🖼️ 关键图片
📊 实验亮点
在与多个基线模型的比较中,JobHop v2的最佳提取器表现出色,接近标注者一致性上限,落后仅1.1-2.7个百分点,显示出其在职业轨迹数据提取中的优越性和可靠性。
🎯 应用场景
JobHop v2的数据集可广泛应用于职业推荐系统、劳动力市场分析和人力资源管理等领域。其丰富的注释和大规模数据为研究人员和企业提供了宝贵的资源,推动了职业轨迹研究的深入发展,未来可能影响职业规划和招聘策略的制定。
📄 摘要(原文)
Large-scale, richly annotated career trajectory data underpins workforce planning, job recommendation, and labour market analysis, yet publicly available datasets are either small, closed to independent use, or built from pre-standardized occupational codes with LLM-synthesized rather than authentic free text. We present JobHop~v2, an improved version of the publicly available JobHop dataset, constructed through end-to-end large language model (LLM) extraction from a corpus of ${\sim}440{,}000$ pseudonymized, multilingual resumes provided by VDAB, the Flemish Public Employment Service. The released dataset comprises $355{,}315$ career trajectories annotated with ESCO occupational codes, quarter-level temporal information, and normalized five-level education attainment, broadening both the coverage and the annotation richness of the original release. Relative to v1, JobHop~v2 introduces a redesigned extraction pipeline based on reasoning-controlled LLM inference with a retry mechanism (achieving a 100% JSON parse rate), a richer extraction schema, and a revised evaluation protocol scored against three complementary annotation baselines. Evaluated against these baselines, our best extractor comes closest to the inter-annotator agreement ceiling among all compared models, trailing it by only 1.1-2.7 percentage points. The dataset and code are publicly released to support reproducible career-trajectory research.