Understanding Tone-Dependent Inference Cost in Large Language Models

📄 arXiv: 2607.23915v1 📥 PDF

作者: Akhil Kumar, Om Dobariya

分类: cs.CL, cs.AI

发布日期: 2026-07-27

备注: 16 pages, 1 figure, 9-page Appendix


💡 一句话要点

研究提示语语气对大型语言模型推理成本的影响

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 推理成本 提示语语气 输出令牌 准确性分析

📋 核心要点

  1. 现有方法未能充分考虑提示语语气对大型语言模型推理成本和回答准确性的影响。
  2. 论文提出通过实验分析不同语气对LLM输出令牌消耗和准确性的影响,以优化推理成本。
  3. 实验结果表明,输出令牌长度的变化幅度显著,且不同语气条件下的推理成本变化可达44.3%。

📝 摘要(中文)

本研究考察了提示语的语气如何影响大型语言模型(LLM)回答的准确性和推理成本,后者通过输出令牌消耗体现。通过在570个问题的MMLU数据集上进行实验,研究了从谄媚到威胁的七种不同语气对准确性和推理成本的权衡。结果显示,输出令牌长度的变化远远超过了准确性的变化,且在不同语气条件下,输出令牌消耗的变化幅度可达44.3%。此外,分析了答案准确性与推理过程中平均输出令牌长度之间的权衡。对于ChatGPT模型4o和5-nano,粗鲁的语气占主导地位,而对于Gemini模型2.5 Flash和2.5 Flash Lite,粗鲁和中立的语气在帕累托最优前沿上占主导地位。研究发现,提示语的语气不仅影响答案质量,还影响现代LLM所消耗的可计费推理资源。

🔬 方法详解

问题定义:本研究旨在解决提示语语气对大型语言模型推理成本和回答准确性影响的具体问题。现有方法未能充分量化这种影响,导致推理资源的浪费。

核心思路:论文通过设计实验,系统地分析了七种不同语气对LLM输出的影响,旨在揭示语气与推理成本之间的关系,以便在实际应用中进行优化。

技术框架:整体架构包括数据集准备、模型选择、实验设计和结果分析四个主要模块。数据集使用570个问题的MMLU,模型包括多种LLM,实验设计涵盖不同语气的提示。

关键创新:最重要的技术创新在于量化了提示语语气对推理成本的影响,尤其是输出令牌消耗的变化,这在现有研究中尚属首次。

关键设计:在实验中,设置了不同的提示语语气,并使用了标准化的输出令牌计数方法,以确保结果的可比性和准确性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,在不同语气条件下,输出令牌消耗的变化幅度可达44.3%,而输出令牌长度的变化显著超过了准确性的变化。这一发现为优化大型语言模型的推理成本提供了新的视角。

🎯 应用场景

该研究的潜在应用场景包括智能客服、教育辅助工具和内容生成等领域。通过优化提示语的语气,可以有效降低推理成本,提高模型的经济性和实用性,未来可能对商业应用产生深远影响。

📄 摘要(原文)

We examine how prompt tone affects both accuracy of the LLM answers and inference cost as reflected in output-token consumption. Experiments were performed to understand the trade-offs between accuracy and inference cost on a 570 Question MMLU dataset for LLM models prompted in seven different tones from sycophantic to threatening. Our results show that the output-token-length variation substantially exceeded accuracy variation across all models. Output-token consumption varied by up to 44.3% across tone conditions. We also analyzed the tradeoff between the accuracy of the answers and the average output token length in the reasoning process. For the ChatGPT models 4o and 5-nano, the rude tone is quite dominant. For the Gemini models 2.5 Flash and 2.5 Flash Lite, the rude and neutral tones are dominant on the Pareto-optimal frontier. We find that prompt tone influences not only answer quality but also the amount of billable inference resources consumed by modern LLMs.