An Experimental Design Approach to Evaluating Agentic AI's Autonomous Model Discovery

📄 arXiv: 2607.06413v1 📥 PDF

作者: Hao He, Xueying Liu, Chris J. Kuhlman, Xinwei Deng

分类: stat.ME, cs.AI

发布日期: 2026-07-07

备注: 39 pages, 11 figures, 6 tables. Data and code available at the GitHub repository listed in the paper


💡 一句话要点

提出实验设计框架以评估自主模型发现的智能体AI

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自主模型发现 智能体AI 实验设计 数据建模 推理努力 性能评估 优化指标

📋 核心要点

  1. 现有方法无法充分表征智能体AI的自主模型发现行为,尤其是在随机性和适应性方面的挑战。
  2. 论文提出了一种实验设计框架,通过系统评估和量化模型发现过程中的变异性,识别关键影响因素。
  3. 在网络单词形成游戏的测试平台上,研究发现推理努力与成本和过程复杂性之间的关系,提供了有价值的见解。

📝 摘要(中文)

随着大型语言模型编码代理在开放式数据建模和分析中的应用日益增多,这些代理的自主模型发现行为因其随机性和适应性而无法通过单一基准运行充分表征。本文提出了一种实验设计和分析框架,系统性地评估这一发现过程,量化其变异性,并识别重要因素。该框架将这些代理视为随机模型发现操作符,映射任务特定的发现数据和优化目标到拟合模型。我们在受控实验因素下研究了Codex和Claude Code两个操作符,并对多个响应(如输出质量、成本、时间和过程复杂性)进行了回归模型和推断分析。最后,我们开发了一种效用对齐的典范分解,以表征推理努力效应的主导方向,并评估该方向是否与性能-成本效用方向一致。

🔬 方法详解

问题定义:本文旨在解决智能体AI在自主模型发现过程中的评估不足,现有方法无法有效捕捉其随机性和适应性带来的变异性。

核心思路:通过提出一种实验设计和分析框架,系统性地评估智能体的模型发现过程,量化其变异性,并识别影响模型发现的关键因素。

技术框架:该框架将智能体视为随机模型发现操作符,映射任务特定的发现数据和优化目标到拟合模型。研究中控制了多个实验因素,包括推理努力、任务、优化指标和训练数据组成。

关键创新:提出的效用对齐的典范分解是本研究的核心创新,能够表征推理努力效应的主导方向,并评估其与性能-成本效用方向的一致性。

关键设计:在实验中,针对每个代理-任务-指标组合,进行了多响应的回归模型和推断分析,关注输出质量、成本、时间和过程复杂性等关键参数。通过这些设计,研究揭示了推理努力与成本和复杂性之间的关系。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,推理努力对模型发现的输出质量、成本和过程复杂性有显著影响。具体而言,在不同的代理-任务-指标组合中,研究发现推理努力的变化与成本和复杂性之间存在明确的关联,为智能体AI的优化提供了新的视角。

🎯 应用场景

该研究的潜在应用领域包括智能体AI在数据建模、分析和优化中的广泛应用,尤其是在需要自主决策和模型发现的场景。通过系统评估智能体的表现,能够为未来的AI系统设计提供重要指导,提升其效率和效果。

📄 摘要(原文)

Large language model coding agents increasingly perform open-ended data modeling and analysis. These agents are stochastic and adaptive, and therefore their autonomous model discovery behavior cannot be adequately characterized by a single benchmark run. In this work, we propose an experimental design and analysis framework for systematically evaluating this discovery process, quantifying its variability, and identifying important factors. The proposed framework treats these agents as stochastic model-discovery operators, which map task-specific discovery data and an optimization target to a fitted model. Specifically, we investigate two such operators, Codex and Claude Code, under controlled experimental factors including agent's reasoning effort, task, optimization metric, and composition of training data. For each agent-task-metric combination, regression models and inference are conducted for multiple responses such as output quality, dollar cost, wall-clock time, and process complexity. Furthermore, we develop a utility-aligned canonical decomposition to characterize the dominant direction of the reasoning-effort effect and to assess whether that direction aligns with a performance-cost utility direction. The proposed framework is demonstrated on a testbed of networked word-forming games with insightful findings on reasoning effort with respect to cost and process complexity.