SGA: Plug&Play Geometric Verification for Educational Video Synthesis

📄 arXiv: 2607.18116v1 📥 PDF

作者: Lopez Jhon, Hinojosa Carlos, Ghanem Bernard

分类: cs.AI, cs.CV, cs.GR, cs.MA, cs.MM

发布日期: 2026-07-20


💡 一句话要点

提出SGA模块以解决教育视频合成中的几何验证问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 教育视频合成 几何验证 大型语言模型 符号几何代理 视觉质量评分 动画生成 空间完整性

📋 核心要点

  1. 现有方法在生成教育动画时,难以确保空间正确性和视觉清晰性,尤其是在几何遮挡方面存在不足。
  2. 本文提出的SGA模块通过拦截LLM生成的代码,提取符号场景图并进行针对性优化,从而解决空间冲突问题。
  3. 实验结果显示,SGA在多个LLM骨干和管道配置中显著提升了视觉质量评分,达到了73.11的峰值MVQS。

📝 摘要(中文)

近年来的研究利用大型语言模型(LLMs)生成可执行代码,以创建教育动画,使用如Manim等库。然而,确保空间正确性和视觉清晰性仍然具有挑战性,现有框架往往强调教学内容而忽视几何遮挡。本文提出了符号几何代理(SGA),这是一个可插拔模块,能够拦截LLM生成的代码,进行部分执行以提取符号场景图,并在检测到空间冲突时应用针对性优化。此外,我们还引入了Manim视觉质量评分(MVQS),作为空间完整性的确定性无渲染代理。实验结果表明,SGA在MMMC-Code基准测试中,针对四个LLM骨干和两个代理管道,达到了73.11的峰值MVQS,相较于原始基线提高了16.1%,并在8种骨干与管道配置中改善了7种MVQS。

🔬 方法详解

问题定义:本文旨在解决教育视频合成中几何验证的不足,现有方法往往忽视空间正确性和视觉清晰性,导致生成的动画存在几何遮挡等问题。

核心思路:论文提出的SGA模块通过拦截LLM生成的代码,进行部分执行以提取符号场景图,并在检测到空间冲突时进行针对性优化,从而确保生成动画的几何正确性。

技术框架:SGA的整体架构包括代码拦截、符号场景图提取和空间冲突检测与优化三个主要模块。首先,拦截LLM生成的代码,然后提取场景图,最后针对检测到的空间冲突进行优化处理。

关键创新:SGA的最大创新在于其可插拔的设计,使其能够无缝集成到现有的代码中心动画管道中,并通过符号场景图的提取与优化,显著提升了动画的空间完整性。

关键设计:在SGA中,关键的参数设置包括冲突检测的阈值和优化策略,损失函数则侧重于空间完整性与视觉质量的平衡,确保生成动画既符合几何要求又具备良好的视觉效果。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,SGA在MMMC-Code基准测试中,针对四个不同的LLM骨干和两个代理管道,达到了73.11的峰值MVQS,相较于原始基线提高了16.1%。在8种骨干与管道配置中,SGA成功改善了7种MVQS,显示出其在多种场景下的有效性。

🎯 应用场景

该研究的潜在应用领域包括教育视频制作、在线教学平台和动画生成工具等。通过提高教育动画的空间正确性和视觉清晰性,SGA可以帮助教育工作者更有效地传达复杂概念,提升学习体验。未来,该技术可能在更广泛的多媒体内容生成中发挥重要作用。

📄 摘要(原文)

Recent work leverages Large Language Models (LLMs) to generate executable code for pedagogical animations using libraries such as Manim. However, ensuring spatial correctness and visual legibility remains challenging, as existing frameworks emphasize pedagogical content while overlooking geometric occlusions. We propose the Symbolic Geometric Agent (SGA), a plug-and-play module for code-centric animation pipelines that intercepts LLM-generated code, performs partial execution to extract symbolic scene graphs, and applies targeted refinement when spatial conflicts are detected. We further introduce the Manim Visual Quality Score (MVQS), a deterministic rendering-free proxy for spatial integrity. Experiments on the MMMC-Code benchmark across four LLM backbones and two agentic pipelines show that SGA achieves a peak MVQS of 73.11 (Code2Video + GPT-5.1), corresponding to a 16.1% relative improvement over the raw baseline, and improves MVQS in 7 of 8 backbone x pipeline configurations.