DSWorld: A Data Science World Model for Efficient Autonomous Agents

📄 arXiv: 2607.15901 📥 PDF

作者: Zherui Yang, Fan Liu, Hao Liu

分类: cs.AI

发布日期: 2026-07-20


💡 一句话要点

提出DSWorld以提升自主数据科学代理的效率

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 数据科学 自主代理 强化学习 状态转移预测 大型语言模型 成本感知 模拟器 效率提升

📋 核心要点

  1. 现有自主数据科学代理依赖试错流程,导致计算成本高且效率低下。
  2. 提出数据科学世界模型,通过预测环境状态转移来优化数据科学操作的执行。
  3. DSWorld框架显著加速了代理训练和推理过程,提升了性能和效率。

📝 摘要(中文)

尽管自主数据科学代理在数据理解和决策方面具有强大能力,但仍然依赖于耗时的试错工作流程。为了解决这一瓶颈,本文提出了数据科学世界模型(Data Science World Model),通过预测当前工作流状态和候选操作下的环境状态转移,来预见数据科学操作的效果。我们进一步提出了DSWorld框架,结合了结构化状态构建、成本感知路由、轻量级真实执行和基于大型语言模型的模拟器。实验表明,DSWorld在强化学习代理训练中加速了约14倍,在基于搜索的推理中加速了约3至6倍,同时保持了竞争性能,并在状态转移预测任务中超越了最强的LLM基线35.6%。

🔬 方法详解

问题定义:本文旨在解决自主数据科学代理在执行数据科学操作时的高计算成本和低效率问题。现有方法依赖试错流程,导致资源浪费和时间延误。

核心思路:提出数据科学世界模型,通过预测环境状态转移,帮助代理在实际执行前预见操作效果,从而优化决策过程。

技术框架:DSWorld框架包括结构化状态构建、成本感知路由、轻量级真实执行和基于大型语言模型的模拟器,形成一个完整的执行环境模型。

关键创新:引入反思世界模型优化(Reflective World Model Optimization),结合强化学习策略,显著提升状态转移预测的准确性和效率。

关键设计:构建了一个包含8000个转移轨迹的数据集,采用误差感知的强化学习策略进行训练,确保模型在实际应用中的高效性和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,DSWorld在强化学习代理训练中加速了约14倍,在基于搜索的推理中加速了约3至6倍,且在状态转移预测任务中超越了最强的LLM基线35.6%,展现出显著的性能提升。

🎯 应用场景

该研究的潜在应用领域包括自动化数据分析、智能决策支持系统和数据科学教育等。通过提升自主数据科学代理的效率,DSWorld能够帮助企业和研究机构更快速地进行数据驱动决策,降低成本并提高生产力,未来可能在各行业中产生深远影响。

📄 摘要(原文)

Despite strong capabilities in data understanding and decision-making, autonomous data science agents still heavily rely on trial-and-error workflows that involve expensive computation. This bottleneck motivates models that can anticipate the effects of data science operations before real execution. In this paper, we introduce the concept of Data Science World Model, which model the data science execution environment by predicting environment state transitions conditioned on current workflow states and candidate operations. We further propose DSWorld, a practical framework that combines structured state construction, cost-aware routing, lightweight real execution, and an LLM-based simulator for expensive operations. To support training, we construct an 8K-scale transition trajectory dataset and introduce Reflective World Model Optimization, an error-aware reinforcement learning strategy for improving transition prediction. Experiments show that DSWorld accelerates RL-based agent training by approximately $14\times$ and search-based inference by approximately $3$-$6\times$ while maintaining competitive performance, and outperforms the strongest LLM baseline by 35.6% on transition prediction tasks. The code is available atthis https URL.