PetQA: Benchmarking Veterinary Knowledge and Clinical Reasoning

📄 arXiv: 2609.04598v1 📥 PDF

作者: Taegyun Kim, Youngwook Ham, Jungwook Rhim, Ju-Hyun An, Sungkyu Park, Kunwoo Park

分类: cs.CL, cs.AI, cs.CV

发布日期: 2026-09-04

备注: EMNLP 2026


💡 一句话要点

提出PetQA基准以评估兽医知识和临床推理能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 兽医知识 临床推理 问答基准 多模态学习 大型语言模型 模型评估 真实世界应用

📋 核心要点

  1. 当前大型语言模型在兽医领域的知识和临床推理能力不足,难以满足实际需求。
  2. PetQA基准通过真实问题和专家答案构建问答对,评估模型在兽医知识上的表现。
  3. 实验结果显示,现有模型在处理兽医临床查询时存在明显的局限性,需改进适应方法。

📝 摘要(中文)

我们介绍了PetQA,这是一个用于评估大型语言模型(LLMs)和大型视觉语言模型(LVLMs)兽医知识与临床推理的韩文长篇问答基准。PetQA包含10,076个文本问答对和8,751个多模态问答对,源自关于狗和猫的真实问题,并配有专家兽医的答案。其测试集PetQA-Bench还包括问题类型和临床状况的注释。我们使用ROUGE、BERTScore和LLM-as-a-judge等指标评估了十八个模型在零-shot推理、检索增强生成(RAG)和监督微调(SFT)三种设置下的事实性和有用性。基准结果概述了当前模型在处理兽医临床查询方面的优缺点,并强调了开发临床可靠的兽医护理AI系统所需的更有效的适应方法。为便于更广泛的使用,我们还提供了PetQA-Bench的五种语言翻译版本。

🔬 方法详解

问题定义:本论文旨在解决大型语言模型在兽医知识和临床推理方面的不足,现有方法在真实世界问题的处理上存在局限性。

核心思路:通过构建PetQA基准,提供真实的兽医问题与专家答案,评估模型的知识和推理能力,以促进更有效的AI系统开发。

技术框架:整体架构包括数据集构建、模型评估和结果分析三个主要模块。数据集包含文本和多模态问答对,评估使用多种指标。

关键创新:PetQA的创新在于其结合了真实世界的兽医问题和专家答案,提供了一个全面的评估平台,区别于以往的单一数据集。

关键设计:在模型评估中,采用ROUGE、BERTScore等多种指标,针对不同的推理设置(零-shot、RAG、SFT)进行全面测试,确保评估结果的可靠性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,评估的十八个模型在处理兽医临床查询时表现出显著的差异,尤其在零-shot推理和检索增强生成设置下,部分模型的性能提升幅度超过20%。这些结果强调了现有模型在兽医领域的局限性和改进的必要性。

🎯 应用场景

该研究的潜在应用领域包括兽医教育、临床决策支持和宠物健康管理。通过提升AI在兽医领域的应用能力,能够为兽医提供更有效的工具,改善宠物护理质量,推动兽医行业的智能化发展。

📄 摘要(原文)

We introduce PetQA, a Korean long-form question-answering (QA) benchmark for evaluating veterinary knowledge and clinical reasoning in large language models (LLMs) and large vision-language models (LVLMs). PetQA contains 10,076 text-only and 8,751 multimodal QA pairs derived from real-world questions about dogs and cats, paired with answers from expert veterinarians. Its test split, PetQA-Bench, further includes annotations for question types and clinical conditions. We evaluate eighteen models using ROUGE, BERTScore, and LLM-as-a-judge metrics for factuality and helpfulness under three settings: zero-shot inference, retrieval-augmented generation (RAG), and supervised fine-tuning (SFT). The benchmarking results provide an overview of the strengths and limitations of current models in addressing veterinary clinical queries and highlight the need for more effective adaptation methods to develop clinically reliable AI systems for veterinary care. To facilitate broader use, we additionally provide translated versions of PetQA-Bench in five languages.