Agentic Evaluation of Copyright Law Compliance

📄 arXiv: 2607.21799v1 📥 PDF

作者: Zheng Hui, Doni Bloomfield, Noam Kolt

分类: cs.CL, cs.CY

发布日期: 2026-07-23

备注: ICML 2026 Spotlight


💡 一句话要点

提出Copyright-Bench以评估LLM代理的版权合规性

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 版权合规 大型语言模型 评估基准 商业任务 用户偏好 时间压力 内容选择

📋 核心要点

  1. 现有方法缺乏有效框架,无法评估LLM代理在商业任务中遵循版权法的合规性。
  2. 提出Copyright-Bench基准,通过现实商业任务评估LLM代理在选择公共领域与受版权保护内容时的合规性。
  3. 实验结果显示,LLM代理在有公共领域替代品的情况下仍选择受版权保护内容,且开放权重模型的违规率在特定条件下增加。

📝 摘要(中文)

随着大型语言模型(LLM)代理在商业任务中越来越多地涉及检索和再现外部内容,确保其遵循版权法显得尤为重要。然而,目前缺乏有效的框架来评估这些代理的合规性。为此,本文提出了Copyright-Bench,一个旨在评估LLM代理遵循版权法的基准。该基准包含现实的商业任务,如网站开发、商品设计和商业计划书制作,要求代理在公共领域内容和受版权保护内容之间进行选择。评估中引入了不同用户偏好的提示变体以及时间压力的模拟。与人类基线相比,研究发现:代理在有公共领域替代品的情况下仍选择受版权保护的作品;对于开放权重模型,违反率在特定用户偏好和模拟时间压力下增加。

🔬 方法详解

问题定义:本文旨在解决如何有效评估大型语言模型(LLM)代理在商业任务中遵循版权法的合规性。现有方法未能提供足够的框架来判断代理在选择内容时的法律合规性。

核心思路:通过设计Copyright-Bench基准,模拟现实商业场景,评估LLM代理在选择公共领域与受版权保护内容时的决策过程,以此判断其合规性。

技术框架:Copyright-Bench包括多个模块,首先是任务设计模块,涵盖网站开发、商品设计和商业计划书制作等任务;其次是评估模块,使用不同的用户偏好和时间压力条件进行测试;最后是结果分析模块,比较LLM代理与人类基线的表现。

关键创新:最重要的创新在于引入了模拟用户偏好和时间压力的评估方式,能够更真实地反映LLM代理在实际应用中的决策行为,与传统评估方法相比,提供了更具针对性的合规性分析。

关键设计:在设计中,采用了多样化的提示变体以模拟不同用户需求,并设置了开放权重模型与闭合权重模型的对比实验,以分析不同模型在合规性上的表现差异。实验中还考虑了时间压力对决策的影响。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,LLM代理在选择内容时,即使有公共领域替代品可用,仍然倾向于选择受版权保护的作品。对于开放权重模型,特定用户偏好和时间压力的影响导致违规率显著增加,这一发现为未来的合规性研究提供了重要的参考。

🎯 应用场景

该研究的潜在应用领域包括法律合规性审查、内容创作工具以及商业智能系统。通过评估LLM代理的版权合规性,可以帮助企业在使用AI技术时避免法律风险,提升内容创作的合规性和安全性,具有重要的实际价值和未来影响。

📄 摘要(原文)

Large language model (LLM) agents increasingly perform commercial tasks that involve retrieving external content such as images and, where appropriate, reproducing that content. LLM agents should comply with the law, including copyright law. Presently, however, we lack adequate frameworks to assess whether they do so in practice. To that end, we introduce \textbf{Copyright-Bench}, a benchmark designed to evaluate \textit{LLM agents' compliance with} \emph{copyright law}. Copyright-Bench is comprised of realistic commercial tasks---website development, merchandise design, and pitch deck production---that involve agents selecting between public-domain content (the use of which is \textit{legal}) and copyrighted content (the use of which is \textit{infringing} in this setting).The evaluation introduces prompt variations that simulate different user preferences, as well as time pressure.Comparing state-of-the-art LLM agents against a human baseline, we find that: (1) agents select copyrighted works despite the availability of public-domain alternatives; and (2) for open-weights models, violation rates increase in response to certain user preferences and simulated time pressure.