| 1 |
MedGame: Storytelling Gamification Empowered by Large Language Models for Medical Education |
提出MedGame框架以提升医学教育中的故事化学习体验 |
large language model multimodal |
|
|
| 2 |
REFACT: Adaptive Fact Restatement for Compact and Faithful Chain-of-Thought Reasoning |
提出REFACT以解决长文本推理中的证据不足问题 |
large language model chain-of-thought |
✅ |
|
| 3 |
Token Budget Saturation and Mechanistic Early Detection of Reasoning Non-Convergence in Chain-of-Thought Models |
提出机制以早期检测链式思维模型的推理非收敛问题 |
chain-of-thought |
|
|
| 4 |
Where Animacy Lives in Large Language Models: Tracing the Circuits of the Animacy Concept |
提出一种方法以追踪大型语言模型中的生动性概念 |
large language model |
|
|
| 5 |
Chemical Chain-of-Thought Functions as a Hallucination-Prone Molecular Scratchpad |
提出化学链式思维函数以解决分子推理中的幻觉问题 |
chain-of-thought |
|
|
| 6 |
An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations |
提出多轴评估框架以解决音频描述评估挑战 |
large language model multimodal |
|
|
| 7 |
Adaptive Depth Sparse Framework: Similarity-Driven Resource Allocation for Pre-Trained LLMs |
提出自适应深度稀疏框架以降低预训练大语言模型的推理成本 |
large language model |
|
|
| 8 |
When Trivia Is Not Trivial: Everyday Knowledge Failures in Multilingual LLMs |
提出TriviaRoomQA基准以评估多语言LLM的日常知识表现 |
large language model |
|
|
| 9 |
MemTools: A Unified Research Framework for Interoperable Agent Memory |
提出MemTools框架以解决智能体记忆系统的互操作性问题 |
multimodal |
|
|
| 10 |
Capital Markets LLM Reliability Score (CM-LRS): From Plausible to Bankable |
提出CM-LRS以解决资本市场文档可银行性问题 |
large language model |
|
|
| 11 |
news-crawler-LM: A Small Long-Context Model For High-Quality News Crawling |
提出news-crawler-LM以解决新闻页面内容提取问题 |
large language model |
|
|
| 12 |
A Unified Moral-Value Dataset for Instruction Tuning |
构建统一道德价值数据集以解决指令调优问题 |
large language model |
✅ |
|
| 13 |
QuantiBias: Benchmarking Quantization-Induced Bias in LLMs |
提出QuantiBias基准以评估LLMs中的量化引起的偏见问题 |
large language model |
|
|
| 14 |
Transformer-Assisted LLM-Based Source Code Summarisation: to Enable More Secure Software Development |
提出Transformer辅助的LLM源代码摘要生成方法以提升软件安全性 |
large language model |
|
|
| 15 |
Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms |
提出Khondo基准以解决孟加拉文档包拆分问题 |
multimodal |
✅ |
|
| 16 |
Probing Latent Colombian Identity Inferences in Qwen2.5-7B with Natural Language Autoencoders |
探讨Qwen2.5-7B模型中的哥伦比亚身份推断 |
large language model |
|
|
| 17 |
Agentic Evaluation of Copyright Law Compliance |
提出Copyright-Bench以评估LLM代理的版权合规性 |
large language model |
|
|