LLM-Driven AutoML for Cross-Lingual Handwritten OCR: Closed-Loop Neural Architecture Search with GPT-5, GPT-4o, and Claude Sonnet 4
作者: Mobina Kashaniyan, Amirhossein Ghassemi, Nasser Mozayani
分类: cs.CV, cs.AI, cs.LG
发布日期: 2026-07-20
💡 一句话要点
提出基于LLM的AutoML框架以解决跨语言手写OCR问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 跨语言识别 手写OCR 自动化机器学习 神经网络架构 大型语言模型 闭环反馈 性能优化
📋 核心要点
- 现有的手写OCR方法在跨语言识别中面临架构设计复杂、手动调优耗时等挑战。
- 本文提出的框架通过LLM自动生成和优化神经网络架构,实现了闭环的AutoML过程。
- 实验结果显示,所提出的方法在多个语言数据集上达到了超过93%的平均准确率,且推理延迟低于45毫秒。
📝 摘要(中文)
本文提出了一种完全自动化的闭环AutoML框架,利用GPT-5、GPT-4o和Claude Sonnet 4作为自主神经网络架构设计者,针对跨语言手写光学字符识别进行研究。每个大型语言模型独立生成、训练、评估并迭代优化神经网络架构,利用先前实验的性能反馈。该框架在阿拉伯语、波斯语和英语手写数据集上进行了270次独立实验,成功发现了准确且计算效率高的模型,无需手动架构设计、特定领域预处理或超参数调优。生成的模型在测试集上平均准确率超过93%,最佳准确率为98.1%,推理延迟在41到44毫秒之间。结果表明,大型语言模型可以作为有效的AutoML代理,支持跨语言的可扩展、脚本自适应和可重复的手写识别。
🔬 方法详解
问题定义:本文旨在解决跨语言手写光学字符识别中的架构设计复杂性和手动调优的低效问题。现有方法通常依赖于专家知识进行架构设计,缺乏自动化和适应性。
核心思路:论文提出的闭环AutoML框架利用大型语言模型(LLM)自动生成、训练和优化神经网络架构,依赖于性能反馈进行迭代改进,从而实现高效的手写OCR。
技术框架:整体框架包括三个主要模块:1) LLM生成网络架构;2) 训练和评估模型;3) 基于评估结果反馈进行架构优化。每个模块相互连接,形成闭环反馈机制。
关键创新:最重要的创新在于将大型语言模型作为自主架构设计者,突破了传统手动设计的限制,实现了高度自动化和适应性的手写OCR解决方案。
关键设计:在模型训练中,采用了特定的损失函数以优化识别精度,并通过迭代反馈机制调整网络结构和超参数设置,确保生成的模型在准确性和计算效率上达到最佳平衡。
🖼️ 关键图片
📊 实验亮点
实验结果显示,所提出的框架在270次独立实验中,生成的模型在测试集上平均准确率超过93%,最佳准确率达到98.1%。推理延迟保持在41到44毫秒之间,展现出良好的实时性能,显著优于传统手动设计的模型。
🎯 应用场景
该研究的潜在应用领域包括多语言文档处理、国际化手写识别系统以及教育领域的智能评估工具。通过实现高效的跨语言手写OCR,能够显著提升多语言环境下的信息获取和处理能力,具有广泛的实际价值和未来影响。
📄 摘要(原文)
We present a fully automated closed-loop AutoML framework that uses GPT-5, GPT-4o, and Claude Sonnet 4 as autonomous neural architecture designers for cross-lingual handwritten optical character recognition. Each large language model independently generates, trains, evaluates, and iteratively refines neural network architectures using performance feedback from previous trials. The framework is evaluated on Arabic, Persian, and English handwriting datasets through 270 independent experiments. It consistently discovers accurate and computationally efficient models without manual architecture design, domain-specific preprocessing, or hyperparameter tuning. The generated models achieve mean test accuracies above 93 percent, a best accuracy of 98.1 percent, and inference latency between 41 and 44 milliseconds. The results demonstrate that large language models can function as effective AutoML agents for neural architecture search, enabling scalable, script-adaptive, and reproducible handwriting recognition across languages.