PACE: Perceived-Latency-Aware Cascading Service Routing and Filler Control for QoE-Efficient Retrieval-Augmented Dialogue Serving

📄 arXiv: 2609.10372v1 📥 PDF

作者: Lin Huang, Yujuan Tan, Weisheng Li, Lixiang Zeng, Kun Yang, Suihan Xiao

分类: cs.CV, cs.AI, cs.RO

发布日期: 2026-09-09


💡 一句话要点

提出PACE框架以优化对话服务中的感知延迟问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control)

关键词: 对话系统 用户体验 感知延迟 自适应控制 缓存机制

📋 核心要点

  1. 现有方法在对话服务中未能有效平衡响应时间与质量,导致用户体验下降。
  2. PACE框架通过联合控制答案来源和填充内容,优化感知首次响应时间,提升用户体验。
  3. 实验结果显示,PACE在高负载下显著降低了响应时间,并减少了无效调用,提升了系统效率。

📝 摘要(中文)

本文提出了PACE框架,旨在通过将感知首次响应时间(PTFR)形式化为用户体验(QoE)目标,并在质量和成本约束下最小化该指标。与以往的级联路由、语义缓存或自适应检索方法不同,PACE同时控制响应的答案来源和填充等待窗口的内容。该框架在类人机器人销售服务中部署,结合了负载自适应级联路由器、联合路径填充控制器和波动感知缓存接纳机制。在75,000个CarQA请求的测试中,级联方法将纯LLM的PTFR在P95时减少了一半(0.29秒对比0.53秒)。自适应控制器在高负载下以相同质量实现了0.41秒的P95,性能比RAG提升了2.4倍。填充控制器将调用次数减少了94%,且无冲突。波动感知接纳机制将过时答案的比例从86%降至0%。

🔬 方法详解

问题定义:本文旨在解决对话服务中感知首次响应时间(PTFR)过长的问题,现有方法在响应质量和成本控制方面存在不足,无法有效满足用户体验需求。

核心思路:PACE框架通过同时控制答案来源和填充内容,优化用户在等待响应时的体验,确保在质量和成本约束下实现最优的PTFR。

技术框架:PACE框架包括三个主要模块:负载自适应级联路由器、联合路径填充控制器和波动感知缓存接纳机制。这些模块协同工作,以动态调整响应策略。

关键创新:PACE首次量化了填充答案冲突风险,并通过自适应控制策略显著提升了系统在高负载下的响应效率,区别于以往单一的路由或缓存策略。

关键设计:在设计中,采用了动态负载评估机制和冲突检测算法,确保填充控制器在无冲突的情况下减少调用次数,同时设置了阈值以限制过时答案的接纳。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果表明,PACE框架在75,000个CarQA请求中,级联方法将PTFR在P95时减少至0.29秒,相较于0.53秒的基线,提升幅度显著。同时,自适应控制器在高负载下实现了0.41秒的P95,性能比RAG提升了2.4倍,填充控制器则将调用次数减少了94%。

🎯 应用场景

PACE框架具有广泛的应用潜力,特别是在需要实时响应的对话系统中,如客服机器人、智能助手和销售服务等领域。通过优化用户体验,该框架能够提升用户满意度,并在高负载情况下保持系统的高效性,具有重要的实际价值和未来影响。

📄 摘要(原文)

We present the PACE, a framework for retrieval-augmented dialogue serving that formalizes Perceived Time-to-First-Response (PTFR) as a QoE objective and minimizes it under quality/cost constraints. Unlike prior work on cascaded routing, semantic caching, or adaptive retrieval, PACE jointly controls which answer source composes the response and what fills the waiting window. Deployed on a humanoid-robot sales service, it combines three mechanisms: a load-adaptive cascading router, a joint path-filler controller, and volatility-aware cache admission. On 75k CarQA requests, the cascade halves pure-LLM PTFR at P95 (0.29 vs 0.53s at c16). The adaptive controller reaches 0.41s P95, outperforming RAG by 2.4 times at high load with equal quality. The filler controller cuts calls by 94% with zero conflict. Volatility-aware admission reduces stale answers from 86% to 0%. A gating rule ensures the controller never worse than the baseline, with exposure bounded by one hold period. This is the first quantification of filler-answer conflict risk in deployed services.