SmartRAG: Native Graph-Based RAG for Mobile Device

📄 arXiv: 2607.14661v1 📥 PDF

作者: Zhihan Jiang, Meng Li, Shenghao Liu, Keran Li, Ruiben Zhou, Xianjun Deng, Shuai Wang, Haipeng Dai

分类: cs.AI

发布日期: 2026-07-16

备注: 14 pages, 4 figures


💡 一句话要点

提出SmartRAG以解决移动设备上大语言模型的计算挑战

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 移动设备 大语言模型 命名实体识别 知识图谱 多跳推理 边缘计算 智能助手

📋 核心要点

  1. 现有方法在移动设备上部署大型语言模型时面临计算成本与硬件预算的矛盾,难以满足隐私和低延迟需求。
  2. SmartRAG通过将设备智能分解为感知、记忆、聚焦和思考四个模块,提出了一种新的框架设计,优化了模型的功能分配。
  3. 实验结果显示,SmartRAG在多个问答基准上实现了与更大模型相当的多跳推理性能,且在普通手机上运行,具有实际应用价值。

📝 摘要(中文)

在移动设备上部署大型语言模型(LLMs)作为个人助手需要满足隐私、低延迟和离线可用性等要求,但巨型模型的计算成本与严格的边缘硬件预算相冲突。本文提出SmartRAG,一个完全在设备上运行的框架,围绕感知、记忆、聚焦和思考四个协调模块组织智能助手。其核心是EvoNER,一个可持续学习的命名实体识别器,通过教师蒸馏更新逐步扩展标签库,能够在不重新训练主干LLM的情况下吸收未见过的实体类型。提取的知识存储在MRGraph中,一个三层的知识图谱,并通过结合图遍历、词汇匹配和密集语义搜索的混合管道在查询时检索。实验表明,SmartRAG在四个问答基准(TriviaQA、Natural Questions、HotpotQA、MultiHopQA)上表现出与高达18倍更大模型竞争的多跳推理性能,同时完全在普通智能手机上运行,满足实际的内存和延迟要求。

🔬 方法详解

问题定义:本文旨在解决在移动设备上部署大型语言模型时的计算成本与硬件预算之间的矛盾,现有方法无法有效平衡隐私、低延迟和离线可用性。

核心思路:SmartRAG的核心思想是将智能助手的功能分解为四个模块,通过模块间的协调合作来提升整体性能,从而避免单一模型的计算负担。

技术框架:SmartRAG框架包括四个主要模块:感知(Perception)、记忆(Memory)、聚焦(Focus)和思考(Thinking)。其中,EvoNER作为命名实体识别器,负责不断学习和扩展标签库,MRGraph则用于存储和检索知识。

关键创新:最重要的创新在于EvoNER的设计,它能够通过教师蒸馏更新逐步吸收新实体类型,而无需重新训练主干LLM,这在现有方法中是难以实现的。

关键设计:在技术细节上,SmartRAG采用三层知识图谱MRGraph,结合图遍历、词汇匹配和密集语义搜索的混合检索策略,确保在查询时高效获取知识,同时将LLM的调用限制在高价值的语义操作上。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,SmartRAG在四个问答基准上表现出色,使用量化的1.7B参数主干模型,其多跳推理性能与高达18倍更大模型相当,同时在普通智能手机上运行,满足实际的内存和延迟要求。

🎯 应用场景

该研究的潜在应用场景包括智能手机上的个人助手、智能家居控制系统以及其他需要在边缘设备上进行实时推理的应用。通过优化计算资源的使用,SmartRAG能够在保证隐私的前提下提供高效的智能服务,未来可能推动更多智能设备的普及与应用。

📄 摘要(原文)

Deploying large language models (LLMs) as personal assistants on mobile devices demands privacy, low latency, and offline availability, yet the computational cost of giant models clashes with strict edge-hardware budgets. We argue that this tension cannot be resolved by model compression alone; it requires decomposing on-device intelligence into complementary functional roles. We present SmartRAG, a fully on-device framework that organizes an intelligent assistant around four coordinated modules -- Perception, Memory, Focus, and Thinking. At the core of SmartRAG is EvoNER, a continually learnable named-entity recognizer that incrementally expands its label inventory through teacher-distilled updates, enabling the system to absorb previously unseen entity types without retraining the backbone LLM. Extracted knowledge is stored in MRGraph, a three-layer provenance-preserving knowledge graph, and retrieved at query time through a hybrid pipeline combining graph traversal, lexical matching, and dense semantic search. The on-device LLM is invoked only for high-value semantic operations -- labeling, planning, and answer synthesis -- keeping inference costs bounded. Experiments on four QA benchmarks (TriviaQA, Natural Questions, HotpotQA, MultiHopQA) show that SmartRAG with a quantized 1.7B-parameter backbone achieves multi-hop reasoning performance competitive with models up to 18$\times$ larger, while running entirely on commodity smartphones within practical memory and latency envelopes.