ContinuityBench: A Benchmark and Systems Study of Stateful Failover in Multi-Provider LLM Routing

📄 arXiv: 2607.15899 📥 PDF

作者: Vishal Pandey, Gopal Singh

分类: cs.LG

发布日期: 2026-07-20


💡 一句话要点

提出ContinuityBench以解决多提供者LLM路由中的状态故障转移问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 状态故障转移 多提供者架构 对话连续性 大型语言模型 高可用性 历史转发策略 性能评估

📋 核心要点

  1. 核心问题:现有的无状态故障转移机制在保证API可用性的同时,无法保留对话历史,导致用户体验受损。
  2. 方法要点:提出了一种有状态的多提供者代理架构,结合历史转发策略,能够在故障转移时重建对话状态。
  3. 实验或效果:通过750次故障转移事件的实证评估,展示了99.20%的连续性保留率,显著优于传统方法。

📝 摘要(中文)

在生产环境中的大型语言模型(LLM)部署中,高API可用性并不等同于对话的连续性。当主要提供者发生故障或严格限流时,简单的无状态故障转移机制虽然能保持正常运行,但会悄然丢失对话历史,严重影响用户体验。为此,本文引入了两个新指标:连续性保留率(CPR)和连续性延迟开销(CLO)。我们提出了一种有状态的多提供者代理架构,利用历史转发策略在故障转移事件中无缝重建跨异构LLM端点的对话状态。此外,我们发布了continuity-bench,这是一个开放的评估工具,旨在高并发提供者故障条件下进行上下文保留的压力测试。实证评估显示,我们的有状态代理在750次故障转移事件中实现了99.20%的CPR,显著优于标准无状态架构的接近0%的保留率。

🔬 方法详解

问题定义:本文旨在解决在多提供者环境中,故障转移时对话状态丢失的问题。现有的无状态故障转移机制虽然能保持系统的可用性,但却无法保留用户的对话历史,导致用户体验受到严重影响。

核心思路:论文提出了一种有状态的多提供者代理架构,利用历史转发策略,在故障转移事件中能够无缝重建对话状态。这种设计旨在提高对话的连续性,确保用户在不同提供者之间切换时不会丢失上下文信息。

技术框架:整体架构包括多个模块:首先是请求接收模块,负责接收用户请求;其次是状态管理模块,维护对话状态;然后是故障检测模块,监测提供者的可用性;最后是历史转发模块,负责在故障发生时将对话状态转发给备用提供者。

关键创新:最重要的技术创新点在于引入了连续性保留率(CPR)和连续性延迟开销(CLO)这两个新指标,提供了一种量化对话状态保留能力的方法。与现有的无状态架构相比,该方法能够有效保留深层次的对话上下文。

关键设计:在设计中,采用了异步指数退避策略,并引入抖动机制,以防止在严格限流的备用API上发生级联重试风暴。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,提出的有状态代理在750次故障转移事件中实现了99.20%的连续性保留率(CPR),而标准的无状态架构几乎没有保留率,显示出显著的性能提升。这一成果为构建稳健的状态保留多模型推理系统奠定了基础。

🎯 应用场景

该研究的潜在应用领域包括大型语言模型的生产环境部署,尤其是在需要高可用性和对话连续性的场景,如客户服务、虚拟助手和在线教育等。通过提升对话的连续性,能够显著改善用户体验,增强系统的可靠性和智能化水平。

📄 摘要(原文)

In production large language model (LLM) deployments, high API availability guarantees do not equate to conversational continuity. When a primary provider experiences an outage or strict rate-limiting, naive stateless failover mechanisms successfully maintain uptime but silently discard conversation history, severely disrupting the user experience. To rigorously quantify and resolve this failure mode, we introduce two novel metrics: Continuity Preservation Rate (CPR) and Continuity Latency Overhead (CLO). We propose a stateful, multi-provider proxy architecture utilizing a History-Forwarding strategy to seamlessly reconstruct conversational state across heterogeneous LLM endpoints during failover events. Furthermore, we release continuity-bench,this https URL, an open evaluation harness designed to stress-test context preservation under high-concurrency provider failure conditions. Our empirical evaluation ($N=750$ failover events) demonstrates that our stateful proxy achieves a 99.20\% CPR [95\% CI: 98.27\%, 99.63\%], cleanly transferring deep conversational context to fallback providers, compared to a near-0\% preservation rate for standard stateless architectures. Finally, we characterize failover latency distributions, identifying the critical necessity of asynchronous exponential backoff with jitter to prevent cascading retry storms against strict-limit fallback APIs. Our results provide a principled foundation for building robust, state-preserving multi-model inference systems.