Agentic coding without the cloud: evaluating open-weight large language models on longitudinal data preparation tasks
作者: Mack Nixon, Liam Wright, Yevgeniya Kovalchuk, Alison Fang-Wei Wu, Martin Danka, Andy Boyd, David Bann
分类: cs.AI, cs.CL
发布日期: 2026-07-23 (更新: 2026-07-24)
备注: Presented at SLLS 2026; accepted at CLS 2026 and RSS 2026
🔗 代码/项目: GITHUB
💡 一句话要点
提出本地化开放权重模型以解决数据准备问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 数据准备 开放权重模型 本地部署 人工智能 数据治理 社会科学研究
📋 核心要点
- 现有方法在处理个人数据时受到数据治理要求的限制,无法使用云服务。
- 本文提出了一种开放源代码框架,旨在评估开放权重LLMs在数据准备任务中的有效性,确保敏感数据不离开本地环境。
- 实验结果表明,开放权重LLMs在消费者级硬件上表现出色,能够有效支持数据准备工作。
📝 摘要(中文)
大型语言模型(LLMs)和智能体在代码开发中被广泛应用,但由于数据治理要求,个人数据通常无法发送至第三方云服务。为此,本文提出了一种开放源代码框架,用于评估开放权重LLMs驱动的AI智能体在纵向人口研究中的数据准备任务的有效性。该框架包括一个经过整理的真实数据集、任务定义以及评估LLM生成的R代码和输出数据的自动化程序。通过基准测试,我们评估了LLMs在20个数据准备任务中的有效性,结果显示当前最先进的模型在任务完成率上达到了87.9%。
🔬 方法详解
问题定义:本文旨在解决在纵向人口研究中数据准备的瓶颈问题,现有方法因数据治理要求而无法使用云服务,限制了数据处理的效率。
核心思路:提出一种开放源代码框架,利用开放权重的LLMs在本地环境中处理数据,避免敏感数据传输至外部服务,从而满足数据治理的要求。
技术框架:框架包括三个主要模块:整理的真实数据集(包含来自英国队列研究的六轮数据的清理脚本)、任务定义(如类别协调和多波合并)以及自动化评估程序,用于评估LLM生成的R代码和输出数据。
关键创新:最重要的创新在于通过开放权重模型在本地环境中实现数据准备,避免了对云服务的依赖,确保了数据的隐私和安全。
关键设计:在实验中,使用了31-35B参数的最先进模型进行基准测试,评估了20个数据准备任务的完成率,结果显示平均任务完成率高达87.9%。
🖼️ 关键图片
📊 实验亮点
实验结果显示,开放权重LLMs在消费者级硬件上能够在20个数据准备任务中实现高达87.9%的平均任务完成率,表明其在治理限制环境下的有效性,具有广泛的应用前景。
🎯 应用场景
该研究的潜在应用领域包括社会科学研究、公共卫生研究和其他需要处理敏感个人数据的领域。通过提供一种本地化的数据准备解决方案,研究者可以在遵循数据治理要求的同时,利用AI技术提高数据处理的效率和准确性。
📄 摘要(原文)
Large language models (LLMs) and agents are now widely used tools in code development, with data typically sent to third-party cloud-based models. Their adoption in research using personal data is constrained by governance requirements that typically prohibit data transmission to external services. Locally deployable open-weight models offer an alternative since sensitive data never leave the local environment. We introduce an open-source framework for evaluating the efficacy of AI agents powered by open-weight LLMs on one of the most persistent bottlenecks in research on longitudinal population studies: data preparation. The framework comprises: a curated ground-truth dataset (cleaning scripts preparing six sweeps of data from a British cohort study), task definitions encompassing tasks such as category harmonization and multi-wave merging, and automated routines for evaluating the LLM-produced R code and outputted data. We benchmark LLMs across the (consumer grade) deployment spectrum to assess their efficacy in 20 data preparation tasks (creation of 102 variables). Current state-of-the-art, 31-35B parameter models almost saturated our benchmark ('average task completion' up to 87.9%). The performance of open-weight LLMs running on consumer-grade hardware shows promise of a viable path toward AI-assisted data preparation in governance-restricted research settings. Our framework is publicly available at: https://github.com/UCL-ARC/RRBench.