| 1 |
The In-Car Sign Language Corpus (ICSL): A Multi-Modal Resource for Constrained-Space Sign Language Recognition |
提出车载手语语料库以解决共享出行中的手语识别问题 |
multimodal |
|
|
| 2 |
A Durability and Cross-Language Transfer Benchmark for a Validated Teaching-Feedback Classification Protocol |
提出耐用性与跨语言迁移基准以优化教学反馈分类 |
large language model |
|
|
| 3 |
Agentic Routing: The Harness-Native Data Flywheel |
提出Harness-Native代理路由以解决模型选择问题 |
large language model |
|
|
| 4 |
Beyond Sally-Anne: Evaluating Theory of Mind in LLMs using Epistemic Schelling Points |
提出EAST任务以评估LLMs的心智理论能力 |
large language model |
|
|
| 5 |
ProgramTab: Boosting Table Reasoning of LLMs via Programmatic Paradigm |
提出ProgramTab以解决大规模表格推理问题 |
large language model |
|
|
| 6 |
AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification |
提出AdvancedMathBench以评估高级数学证明生成与验证能力 |
large language model |
|
|
| 7 |
How Temperature Shapes Ideological Discourse in Retrieval-Augmented Generation? |
研究RAG框架中温度对意识形态话语的影响 |
large language model |
|
|
| 8 |
JobHop v2: A Large-Scale Career Trajectory Dataset from Unstructured Resumes |
提出JobHop v2以解决职业轨迹数据不足问题 |
large language model |
|
|
| 9 |
Production and Perception in LLMs: A Token Probability Approach |
通过令牌概率方法揭示LLMs中的生成与感知差异 |
large language model |
|
|
| 10 |
GEIS: A Generation-Evaluation-Improvement Loop of Agent Skills for Long-Form Article Generation |
提出GEIS以解决长篇文章生成中的信息覆盖与质量提升问题 |
large language model |
|
|
| 11 |
Are LLMs ready for HardChoices? |
检验大型语言模型在社会问题上的立场一致性 |
large language model |
|
|
| 12 |
UMoE:Unlocking Every Expert in Domain-Specific Training |
提出UMoE以优化领域特定训练中的专家池配置 |
large language model |
|
|
| 13 |
Relational Positioning as a Measurable Risk Object: History-Carried Lock-in and Self-Confabulation in Multi-Turn Human-AI Dialogue |
提出关系定位度量以解决多轮人机对话中的风险问题 |
large language model |
|
|
| 14 |
ToFu: A White-Box, Token-Efficient Agent Harness for Researchers |
提出ToFu以提升研究工作流的效率与灵活性 |
large language model |
|
|
| 15 |
RefineEvo: Planning-Guided Heuristic Evolution with Bidirectional Experience |
提出RefineEvo以解决组合优化问题的自动启发式设计 |
large language model |
|
|
| 16 |
Amplitude-Only FFN Intervention for Tool-Structured LLM Inference Method: Gated Evaluation Protocol, and Cross-Model Empirical Results |
提出幅度仅干预方法以优化工具结构化LLM推理 |
large language model |
|
|
| 17 |
Do LLMs Fabricate Legal Citations? A Bilingual Benchmark on Saudi Data Protection Law and the GDPR |
提出双语基准以评估大型语言模型在法律引用中的准确性 |
large language model |
|
|
| 18 |
MJ: Multi-turn LLM Jailbreaking via Decomposed Credit Assignment |
提出DC-GRPO框架以解决多轮对话中的信用分配问题 |
large language model |
|
|
| 19 |
Dimensionality in Satisfaction Ratings |
利用大语言模型分解客户满意度以提升体验分析 |
large language model |
|
|