Solar Open 2 Technical Report

📄 arXiv: 2607.20062v1 📥 PDF

作者: Sungrae Park, Sanghoon Kim, Gyoungjin Gim, Jungho Cho, Hyunwoong Ko, Minbyul Jeong, Minjeong Kim, Keunwoo Choi, Chaehun Shin, Chanwoong Yoon, Dongjun Kim, Eunwon Kim, Gyungin Shin, Hyeonju Lee, Hyungkyu Kang, Inseo Song, Jisu Bae, Jiyoon Han, Jiyun Lee, Joonkee Kim, Junyeop Lee, Mikyoung Cha, Sangwon Yu, Sehwan Joo, Seokyoon Kang, Seonghoon Yang, Seung Shin, Seunghyun Lee, Seungseop Lim, Seungyoun Shin, Sukyung Lee, Taegyeong Eo, Taehwan Oh, Taewhoo Lee, Wonho Song, Wonjun Oh, Wonseok Hwang, Yunsu Kim, Yura Shim, Hwalsuk Lee, Sunghun Kim, Du-Seong Chang, Kyunghyun Cho, Seungju Han, Yejin Choi, Junsuk Choe, Hwaran Lee, Minjeong Ban, Yun Taewon, Hwanjun Song, Jae-Gil Lee, KyungTae Lim, Alice Oh

分类: cs.CL

发布日期: 2026-07-22


💡 一句话要点

提出Solar Open 2以解决长时间跨度智能任务的挑战

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 长时间跨度任务 混合专家模型 上下文窗口 数据策划 多教师蒸馏 自然语言处理 智能助手

📋 核心要点

  1. 现有模型在处理长时间跨度的智能任务时,面临上下文窗口限制和数据利用效率低的问题。
  2. Solar Open 2通过混合注意力机制和高效的数据策划,提升了模型的上下文处理能力和训练效率。
  3. 在多个基准测试中,Solar Open 2在英语和韩语任务上均表现优异,超越了同类模型,展现了其强大的应用潜力。

📝 摘要(中文)

我们提出了Solar Open 2,这是一个250B-A15B混合专家语言模型,旨在处理长时间跨度的智能任务,相较于Solar Open 1(Solar Open 100B)进行了规模扩展。Solar Open 2通过混合注意力堆栈实现了1M-token的上下文窗口,采用每三个线性注意力层中插入一个softmax层的方式,不使用位置编码,并扩展了负特征值的门控增量规则。为了在固定计算预算下高效训练,我们通过更强的起始点和更高价值的数据实现了训练效率的提升。我们从Solar Open 1初始化Solar Open 2,转移了5.69B参数的共享骨架,并通过全面的预训练学习其他内容。数据方面,我们通过质量和稀缺性意识的数据策划和混合比例优化,将20T的数据池精炼为10T的混合数据,在相同的token预算下超越了Solar Open 1的配方。

🔬 方法详解

问题定义:本论文旨在解决长时间跨度智能任务中的上下文窗口限制和数据利用效率低下的问题。现有方法在处理复杂任务时,往往无法有效捕捉长时间依赖关系,导致性能下降。

核心思路:论文提出的核心思路是通过混合注意力机制,结合高效的数据策划,来扩展模型的上下文窗口并提升训练效率。通过这种设计,模型能够在更大的上下文中保持信息的连贯性。

技术框架:Solar Open 2的整体架构包括一个混合注意力堆栈,采用每三个线性注意力层中插入一个softmax层的方式,形成1M-token的上下文窗口。同时,模型在训练时使用了从Solar Open 1转移的共享骨架,并通过多教师在线策略蒸馏将多个领域专家整合为一个模型。

关键创新:Solar Open 2的关键创新在于其混合注意力机制和高效的数据策划策略。这种设计使得模型能够在不使用位置编码的情况下,仍然有效捕捉长时间依赖关系,显著提升了性能。

关键设计:在参数设置上,Solar Open 2采用了5.69B参数的共享骨架,并通过质量和稀缺性意识的数据策划,将20T的数据池优化为10T的高价值混合数据。此外,模型还引入了门控增量规则,以处理负特征值的情况。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在多个基准测试中,Solar Open 2在英语任务上超越了同类开源模型,如MMLU-Pro、LiveCodeBench和APEX-Agents,展现出卓越的性能。在韩语基准测试中,Solar Open 2的平均表现也高于所有对比模型,包括快速响应的封闭API,显示出其在多语言环境中的竞争力。

🎯 应用场景

Solar Open 2在长时间跨度的智能任务中具有广泛的应用潜力,包括自然语言处理、对话系统、智能助手等领域。其高效的上下文处理能力和优越的性能使其能够在实际应用中提供更为精准和智能的服务,推动相关技术的发展与应用。

📄 摘要(原文)

We present Solar Open 2, a 250B-A15B Mixture-of-Experts language model built for long-horizon agentic tasks, scaled up from Solar Open 1 (Solar Open 100B). To hold entire agent trajectories in a single context, Solar Open 2 reaches a 1M-token window through a hybrid attention stack that interleaves one softmax layer among every three linear-attention layers, using no positional encoding and a gated delta rule extended to negative eigenvalues. To train at this scale under a fixed compute budget, we make training efficient in two ways: a stronger starting point, and higher-value data. For the starting point, we initialize Solar Open 2 from Solar Open 1, transferring the 5.69B-parameter shared skeleton that survives the architectural change and learning everything else through full pre-training. For the data, we curate for value per token: quality- and rarity-aware data curation and mixture-ratio optimization refine a 20T pool into a 10T mixture that, at equal token budget, outperforms the Solar Open 1 recipe. To build its agent skills, we train twelve domain specialists across purpose-built scenarios, then consolidate them into a single model by Multi-teacher On-Policy Distillation (MOPD). Against comparably sized open-weight models on English benchmarks, Solar Open 2 leads on MMLU-Pro, LiveCodeBench, and the APEX-Agents agentic suite, and stays competitive with the strongest (DeepSeek-V4-Flash and MiMo-V2.5) elsewhere. On Korean benchmarks, Solar Open 2 records the highest average of any model compared, including fast-tier closed APIs, and on Ko-GDPval, an in-house Korean officework-agent benchmark, it is competitive with DeepSeek-V4-Pro (1.6T) at less than a sixth of its size.