7月23日
09:55
09:55官方一手arXiv: DeepSeek@Sungrae Park, Sanghoon Kim, Gyoungjin Gim, Jungho Cho, Hyunwoong Ko, Minbyul Jeong, Minjeong Kim, Keunwoo Choi, Chaehun Shin, Chanwoong Yoon, Dongjun Kim, Eunwon Kim, Gyungin Shin, Hyeonju Lee, Hyungkyu Kang, Inseo Song, Jisu Bae, Jiyoon Han, Jiyun Lee, Joonkee Kim, Junyeop Lee, Mikyoung Cha, Sangwon Yu, Sehwan Joo, Seokyoon Kang, Seonghoon Yang, Seung Shin, Seunghyun Lee, Seungseop Lim, Seungyoun Shin, Sukyung Lee, Taegyeong Eo, Taehwan Oh, Taewhoo Lee, Wonho Song, Wonjun Oh, Wonseok Hwang, Yunsu Kim, Yura Shim, Hwalsuk Lee, Sunghun Kim, Du-Seong Chang, Kyunghyun Cho, Seungju Han, Yejin Choi, Junsuk Choe, Hwaran Lee, Minjeong Ban, Yun Taewon, Hwanjun Song, Jae-Gil Lee, KyungTae Lim, Alice Oh
Solar Open 2 是一个 250B 参数(15B 激活)的混合专家(MoE)语言模型,上下文窗口达 1M token。它采用混合注意力机制,每 3 层线性注意力插入 1 层 softmax,无位置编码。训练上,从 Solar Open 1 初始化 5.69B 参数共享骨架,并通过质量与稀有度感知的数据筛选将 20T 语料缩减为 10T 以提升效率。通过多教师同策略蒸馏(MOPD)融合 12 个领域专家。在 MMLU-Pro、LiveCodeBench 和 APEX-Agents 上领先,韩语基准平均最高,Ko-GDPval 上以不到 1/6 参数量与 DeepSeek-V4-Pro (1.6T) 竞争。
事件专题

推荐理由:Solar Open 2 发了,250B MoE 模型,1M token 超长上下文,专门跑复杂智能体任务。MMLU-Pro 和 LiveCodeBench 都领先,韩语能力还特别强,比 DeepSeek-V4-Pro 小很多但性能接近。