Agentic coding without the cloud: evaluating open-weight large language models on longitudinal data preparation tasks

📄 arXiv: 2607.21482v1 📥 PDF

作者: Mack Nixon, Liam Wright, Yevgeniya Kovalchuk, Alison Fang-Wei Wu, Martin Danka, Andy Boyd, David Bann

分类: cs.AI, cs.CL

发布日期: 2026-07-23

🔗 代码/项目: GITHUB


💡 一句话要点

提出本地化开源框架以解决数据准备瓶颈问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 数据准备 开源框架 本地部署 治理要求 纵向研究 AI辅助

📋 核心要点

  1. 现有的基于云的LLMs在处理个人数据时受到治理要求的限制,无法满足研究需求。
  2. 本文提出了一种开源框架,能够在本地环境中评估开源权重LLMs在数据准备任务中的有效性。
  3. 实验结果显示,当前最先进的模型在20个数据准备任务中表现优异,任务完成率高达87.9%。

📝 摘要(中文)

大型语言模型(LLMs)和智能体在代码开发中被广泛使用,但由于数据传输至第三方云服务的治理要求,个人数据的使用受到限制。为此,本文提出了一种开源框架,旨在评估基于开源权重LLMs的AI智能体在纵向人口研究中的数据准备任务的有效性。该框架包括一个经过整理的真实数据集、任务定义以及评估LLM生成的R代码和输出数据的自动化例程。通过对20个数据准备任务的基准测试,发现当前最先进的31-35B参数模型在任务完成率上达到了87.9%。开源权重LLMs在消费级硬件上的表现显示出在治理受限的研究环境中实现AI辅助数据准备的可行性。

🔬 方法详解

问题定义:本文旨在解决在治理受限的研究环境中,如何有效进行数据准备的问题。现有方法依赖于云服务,导致个人数据无法安全处理。

核心思路:提出一种本地化的开源框架,利用开源权重的LLMs进行数据准备,确保敏感数据不离开本地环境,同时评估其在实际任务中的表现。

技术框架:框架包括三个主要模块:整理的真实数据集、任务定义(如类别协调和多波合并)以及自动化评估例程。通过这些模块,能够系统地评估LLMs生成的R代码和输出数据。

关键创新:最重要的创新在于提供了一个可在本地部署的开源框架,避免了数据传输至外部服务的风险,与现有依赖云服务的方法形成鲜明对比。

关键设计:框架中采用了经过整理的真实数据集,定义了20个数据准备任务,并设计了自动化评估流程,以确保评估的全面性和准确性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果表明,当前最先进的31-35B参数模型在20个数据准备任务中的平均任务完成率高达87.9%,显示出开源权重LLMs在消费级硬件上的有效性,提供了在治理受限环境中进行AI辅助数据准备的可行性。

🎯 应用场景

该研究的潜在应用领域包括社会科学、公共卫生和其他需要处理敏感个人数据的研究领域。通过提供一个安全的本地化数据准备解决方案,研究人员能够在遵循数据治理要求的同时,利用AI技术提高数据处理效率,推动相关领域的研究进展。

📄 摘要(原文)

Large language models (LLMs) and agents are now widely used tools in code development, with data typically sent to third-party cloud-based models. Their adoption in research using personal data is constrained by governance requirements that typically prohibit data transmission to external services. Locally deployable open-weight models offer an alternative since sensitive data never leave the local environment. We introduce an open-source framework for evaluating the efficacy of AI agents powered by open-weight LLMs on one of the most persistent bottlenecks in research on longitudinal population studies: data preparation. The framework comprises: a curated ground-truth dataset (cleaning scripts preparing six sweeps of data from a British cohort study), task definitions encompassing tasks such as category harmonization and multi-wave merging, and automated routines for evaluating the LLM-produced R code and outputted data. We benchmark LLMs across the (consumer grade) deployment spectrum to assess their efficacy in 20 data preparation tasks (creation of 102 variables). Current state-of-the-art, 31-35B parameter models almost saturated our benchmark ("average task completion" up to 87.9%). The performance of open-weight LLMs running on consumer-grade hardware shows promise of a viable path toward AI-assisted data preparation in governance-restricted research settings. Our framework is publicly available at: https://github.com/UCL-ARC/RRBench.