Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models

📄 arXiv: 2607.13093 📥 PDF

作者: Chen Li, Jiexiong Liu, Yi Li

分类: cs.CR, cs.AI

发布日期: 2026-07-20


💡 一句话要点

提出隐私保护的边缘云协作推理框架以解决大语言模型推理问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 边缘计算 隐私保护 大语言模型 协作推理 KV缓存 性能优化 量化技术

📋 核心要点

  1. 现有的推理方法面临响应延迟、硬件资源限制和用户隐私保护的挑战,难以满足实际需求。
  2. 本文提出了一种边缘云协作推理框架,通过端点认证的KV缓存实现隐私保护和高效推理。
  3. 实验结果表明,该框架在每个令牌的延迟上减少了46.1%,下行负载减少了67.4%,性能与全云推理相当。

📝 摘要(中文)

在设备端进行大语言模型(LLM)推理面临响应延迟、硬件资源有限和用户隐私保护的三重困境。全云推理提供强大的计算能力,但会暴露用户提示和对话数据,而独立的设备端推理对于大多数消费和嵌入式边缘设备来说不可行。本文提出了一种以隐私为中心的边缘云协作LLM推理框架,基于端点认证的KV缓存。局部端点处理输入预处理、嵌入计算、自适应特征优化、KV缓存认证、推测解码和低维模型头计算,而云端则进行认证解码推理、KV缓存管理、令牌验证和高维词汇投影。所有传输数据和截断的logits都经过量化和AES-GCM加密以保护隐私,核心轻量级模块、草稿参数和缓存访问策略保持在本地以避免泄漏。该框架支持包括仅CPU、配备GPU和嵌入式设备在内的异构设备,通过优化流式处理、批处理和量化ONNX部署实现。评估结果表明,该框架在每个令牌的延迟上最多减少46.1%,在下行负载上最多减少67.4%,并保持与全云推理相当的性能。

🔬 方法详解

问题定义:本文旨在解决在设备端进行大语言模型推理时的响应延迟、硬件资源限制和用户隐私保护等问题。现有方法往往在隐私和性能之间难以取得平衡。

核心思路:提出一种隐私中心的边缘云协作推理框架,利用端点认证的KV缓存,局部端点和云端协同工作,优化推理过程,同时保护用户数据隐私。

技术框架:该框架包括局部端点和云端两个主要模块。局部端点负责输入预处理、嵌入计算、特征优化、KV缓存认证等,而云端负责解码推理、缓存管理和令牌验证。数据在传输前经过量化和加密处理。

关键创新:最重要的创新在于通过端点认证的KV缓存实现了隐私保护与高效推理的结合,避免了全云推理带来的隐私泄露风险。

关键设计:框架中采用了轻量级模块设计,确保核心参数和缓存访问策略保持在本地,避免数据泄露。同时,优化了流式处理和批处理,以支持异构设备的高效推理。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,该框架在每个令牌的延迟上最多减少46.1%,在下行负载上减少67.4%,相较于基线的分割推理显著提升,同时保持了与全云推理相当的性能表现。

🎯 应用场景

该研究的潜在应用领域包括智能手机、物联网设备和嵌入式系统等,能够在保护用户隐私的前提下,实现高效的大语言模型推理。这一框架的设计为未来的边缘计算和云计算结合提供了新的思路,具有广泛的实际价值和影响力。

📄 摘要(原文)

On-device LLM inference faces a trilemma of response latency, limited hardware resources and user privacy. Full cloud inference delivers strong computing power but exposes user prompts and dialogue data, while standalone on-device inference is unfeasible for most consumer and embedded edge devices. This paper presents a privacy-centric edge-cloud collaborative LLM inference framework built on endpoint-authenticated KV cache. Local endpoints handle input preprocessing, embedding computation, adaptive feature optimization, KV cache authentication, speculative decoding and low-dimensional model head calculation, while the cloud conducts authenticated decoder inference, KV cache management, token verification and high-dimensional vocabulary projection. Endpoints fuse partial outputs, apply language-adaptive masking and sample target tokens. All transmitted data and truncated logits are quantized and AES-GCM encrypted for privacy, with core lightweight modules, draft parameters and cache access policies kept local to avoid leakage. The framework supports heterogeneous devices including CPU-only, GPU-equipped and embedded devices via optimized streaming, batching and quantized ONNX deployment. Evaluations demonstrate that the framework reduces per-token latency by up to 46.1\% and downlink payloads by up to 67.4\% over baseline split inference, retaining comparable performance to full cloud inference.