EXHOLD: Experience-Aware Real-Time Hold Control for Large-Scale Ride-Hailing Matching at DiDi
作者: Xu Liu, Kai Wan, Zihao Lu
分类: cs.LG
发布日期: 2026-07-10
💡 一句话要点
提出EXHOLD以解决大规模网约车匹配中的体验控制问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱八:物理动画 (Physics-based Animation)
关键词: 网约车 保持控制 体验优化 调度算法 多目标优化
📋 核心要点
- 现有的网约车保持策略依赖于启发式阈值,难以应对非平稳交通和多目标优化的挑战。
- EXHOLD通过两阶段框架,将体验感知评估与保持时间执行解耦,优化匹配过程中的满意度信号。
- 实验结果表明,EXHOLD显著提高了行程完成率和司机收入,减少了乘客取消率,提升了整体效率。
📝 摘要(中文)
在大规模网约车服务中,保持控制是提升乘客和司机体验的关键机制。通过选择性地延迟某些司机-订单配对,系统能够等待更好的机会,减少取消率并降低司机的无效努力。然而,现有的保持策略往往依赖于多种预测模型的启发式阈值,容易受到非平稳交通的影响,且难以针对多目标体验信号进行优化。为此,本文提出了EXHOLD,一个可部署的两阶段框架,将体验感知的配对评估与保持时间执行解耦。在第一阶段,我们通过优化统一目标来学习决策模型,将每个司机-订单配对分配到离散且可解释的体验层次。在第二阶段,我们通过对经验分位数的约束优化求解单调的保持时间调度,明确强制服务边界,最大化整体体验提升。通过在巴西DiDi生产系统中的随机A/B实验评估,结果显示EXHOLD在市场效率和体验上均有显著提升。
🔬 方法详解
问题定义:本文旨在解决大规模网约车匹配中的保持控制问题,现有方法依赖于启发式阈值,难以适应动态交通环境,且优化多目标体验信号存在困难。
核心思路:EXHOLD的核心思路是将体验感知的配对评估与保持时间的执行分开,通过两阶段的优化策略提升乘客和司机的整体体验。
技术框架:EXHOLD的整体架构分为两个阶段:第一阶段是决策模型学习,将司机-订单配对分配到不同的体验层次;第二阶段是通过约束优化求解保持时间调度,确保服务质量。
关键创新:EXHOLD的主要创新在于将体验评估与保持时间调度解耦,采用统一目标优化决策模型,显著提升了匹配效率和体验。
关键设计:在模型设计中,采用了可解释的体验层次划分和基于经验分位数的约束优化方法,确保了保持时间的单调性和服务边界的有效性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,EXHOLD在巴西DiDi生产系统中显著提高了行程完成率和司机收入,减少了乘客取消率,整体效率提升幅度显著。具体数据表明,EXHOLD的实施带来了市场效率的持续提升。
🎯 应用场景
EXHOLD的研究成果可广泛应用于网约车、共享出行等领域,提升乘客和司机的匹配体验,减少资源浪费。未来,该框架还可扩展至其他需要动态调度和资源分配的场景,如物流配送和公共交通调度等。
📄 摘要(原文)
In large-scale ride-hailing, hold control is a critical mechanism for improving passenger-driver experience. By selectively delaying certain driver-order pairs, the system waits for better opportunities, reduces cancellations, and mitigates wasted driver effort. However, existing industrial hold strategies often rely on heuristic thresholding over multiple predictive models, which can be brittle under non-stationary traffic and hard to optimize for multi-objective experience signals. We propose EXHOLD, a deployable two-stage framework decoupling experience-aware pair assessment from hold-time execution. In Stage I, we learn a decision model assigning each driver-order pair to discrete, interpretable experience tiers by optimizing a unified objective that aggregates satisfaction signals across the matching funnel. In Stage II, we solve for a monotone hold-time schedule via constrained optimization over empirical quantiles. This explicitly enforces service guardrails bounding the unnecessary holding of promising matches while maximizing overall experience improvement. We evaluate EXHOLD through randomized A/B experiments in DiDi's production system in Brazil. Results show consistent gains in marketplace efficiency and experience: EXHOLD increases trip completion and driver income, significantly reduces passenger cancellations, and improves funnel efficiency. Ablations and behavioral analyses confirm both stages are essential and that the policy makes calibrated decisions under spatiotemporal heterogeneity. EXHOLD is currently deployed, serving production traffic in Brazil.