| 1 |
Evaluation of Contextual Understanding in Large Language Models |
提出基于知识图谱的评估框架以提升大语言模型的上下文理解能力 |
large language model |
|
|
| 2 |
Navigating the digital spectrum: Assessing political bias, stability, and downstream fairness in Large Language Models |
提出政治坐标测试框架以评估大语言模型的政治偏见与公平性 |
large language model |
|
|
| 3 |
Do Reviewers Still Reward Lexical Complexity? A Frozen-Rater Study of Preference Drift in 124K ICLR Reviews |
提出冷冻评审者模型以分析ICLR评审偏好变化 |
large language model |
|
|
| 4 |
Measuring LLM Sycophancy under Sustained Multi-Turn Pressure |
提出SPINE基准以评估LLM在持续压力下的谄媚行为 |
large language model |
|
|
| 5 |
Evaluating and Improving Evidence-Grounded Fact-Checking in LLMs via Multi-Round Evidence Ablation |
提出REAL框架以提升LLM的证据依赖性和事实核查能力 |
large language model |
|
|
| 6 |
Same Values, Different Languages? From Multilingual Probing to Steering LLMs Toward Chinese Social Values |
提出C-Voices数据集与价值向量引导方法以解决多语言价值对齐问题 |
large language model |
|
|
| 7 |
It's Not RoPE that Creates Sinks: The Role of Self-Concentration and Value-Non-Mixing in Attention |
分析自集中与价值非混合在注意力机制中的作用 |
large language model |
|
|
| 8 |
Combating Instruction Conflict via Energy-Driven Latent Conflict Detection |
提出ELCD以解决大语言模型中的指令冲突问题 |
large language model |
|
|
| 9 |
Compositional Multilingual and Behavioral Attribute Steering |
提出复合多语言与行为属性引导方法以提升大语言模型控制能力 |
large language model |
|
|
| 10 |
EviSI: An Evaluation Agent for Simultaneous Interpreting |
提出EviSI以解决同声传译评估问题 |
large language model |
|
|
| 11 |
Jacap: Robust KV Cache Eviction via Jacobian-Based Nonlinear Information Capacity Preservation |
提出Jacap以解决KV缓存驱逐中的信息容量保持问题 |
large language model |
|
|