AI 见闻
精选· 重要性 4/5

德国AI联盟发布开放权重30B模型Soofi S,在英德基准测试中领先

Hacker News (AI)··amai·约 8 分钟阅读
社区热度 144
中文导读

德国研究联盟发布Soofi S,一个完全在德国电信AI云上训练的开放权重30B模型,采用混合专家架构,在英语和德语基准测试中超越其他完全开放模型,标志着欧洲主权AI基础设施的重要进展。

德国人工智能联盟发布Sooi S,这是一款开放式30 B型号,在英语和德语中名列前茅重点- 德国一个研究联盟发布了开源语言模型Sooi S,该模型完全在德国电信的人工智能云基础设施上训练。- 该模型使用资源高效的混合架构,仅激活3. 31中的2。

每个令牌有60亿个参数,即使输入很长也能保持处理速度不变。- 由于非常关注德语训练数据,Sooi S在德语、英语和编程任务基准方面优于其他完全开放型号,例如Olmo 3 32 B和Atlantus 70 B。

更新-- 关于过度训练指控的声明补充2026年7月15日更新:发布后,批评者认为,按照经典龙猫缩放定律的标准,Soofi S严重“训练过度”。Google DeepMind于2022年发布了这些定律,描述了如何平衡模型大小和固定计算预算的训练数据。

他们确定的最佳点是每个参数大约20个代币。Sooi S突破了这个比例。拥有大约27万亿个代币和300亿个参数,它的比例为几百比一。仅考虑3。每个代币有20亿个活跃参数,比例跃升至几千比一。该项目的技术领导者迈克尔·弗洛姆(Michael Fromm)反驳了这一批评。

他认为这些规则不会简单地延续到专家混合(MoE)架构中。

弗洛姆说:“新的研究表明,密集模型的旧缩放定律不再适用于MoE架构。”原因在于MoE模型的构建方式。个人专家从看到相同的文档中受益,因此大型高质量数据集中的重复数据比密集模型的问题要小。作为比较,弗洛姆以英伟达为例,该公司在多达25万亿个代币上训练了自己的模型。

2026年7月13日原创文章:Sooi S是首批完全在德国电信慕尼黑工业人工智能云上训练的大型语言模型之一。开放式30 B模型使用精益混合架构和刻意偏向德语的培训组合。

由KI Bundesverband(德国人工智能协会)协调的德国研究财团发布了Soofi S 30 B-A3 B,这是一种开放语言模型,根据其预训练报告,该模型在英语和德语基准上获得了完全开放模型中的最高分,

超过了OLMo 3 32 B和Atlantus 70 B等之前的领导者。专为长期环境构建的精简架构Sooi S是一个专家混合模型。它包含31。总共60亿个参数,但仅激活约3个参数。每个生成的代币20亿美元。

这使得其计算成本更接近3B模型,而不是传统的30 B模型。该联盟采用了Nvidia Nemotron 3 Nano的架构,未经修改,这是一种将Mamba-2层与标准注意力层相结合的混合设计。

与典型变压器的主要区别是记忆行为。在传统模型中,存储用于注意力计算的先前令牌的KV缓存随着上下文长度线性增长。由于输入长且并行请求多,重新加载缓存将成为瓶颈。Sooi S的52层中只有6层保留了这样的缓存。

实际回报体现在发电吞吐量上。在40,000个令牌和32个并行请求的上下文长度下,Sooi S每秒在每个图形处理器中生成的令牌大约是140亿至240亿参数范围内的密集模型的八倍。

虽然随着环境的增长,传统模型的吞吐量显着下降,但Sooi S几乎持平,从4,000个到256,000个代币。唯一在测量中表现出类似行为的模型是阿里巴巴的Qwen 3。5 35 B-A3 B,也采用混合架构。

围绕德语建立的训练组合该财团总共处理了约27万亿个代币,分为三个阶段。在第一阶段,该模型从大约20万亿个代币中学习语言基础知识,这些代币从网络、代码、数学和特定领域文本的广泛组合中提取。第二阶段接下来是来自更高质量来源的约6万亿个代币,旨在加深早期学习的模式。

然后,更短的第三阶段通过在多达一百万个令牌的非常长文档上进行训练来扩展上下文窗口。对德语的刻意关注是核心。在第一阶段,德语占7。

占培训组合的2%;在第二阶段,这一比例上升到15%。3%。在Nvidia的Nemotron参考食谱中,所有非英语语言加起来仅占约5%。

对于数据源,该联盟结合了来自HPLT的德语网络文本、公开许可的德国共享资源库、FinePDF和FineWiki的德语部分以及包含来自916家德国出版物的1.93亿篇报纸文章的商业许可Genios数据库。

机器翻译和合成生成的德语文本使这一组合更加完美。德语和英语开放模型得分最高报告称,在针对其他16个开放模型的评估中,Sooi S在德语和英语的总得分方面领先于所有完全开放模型。

其中包括艾伦人工智能研究所的OLMo 3 32 B以及苏黎世联邦理工学院和EPFL的Atlantus 70 B。相对于每一个欧洲主权基准,该模型在该套件中的所有德国基准上都领先,有时甚至领先两位数。

在代码基准测试中,Soofi S得分73。8%的人在HumanEval,70。MBPP 2例,84例。2在德国MBPP变体上,是开源同行中最好的结果。在针对德国特定区域知识的INCLUDE-DE测试中,Soofi S以61分并列第一。

较大的Qwen 3分2分。5 35 B-A3 B。与Nemotron基线相比,德语数据食谱将语言熟练程度提高了15。1分,科学测试GPQA-Diamond得分9分。6分,不牺牲英语表现。

Soofi S在德国竞赛数学中表现不佳,在Minerva MATH-DE上得到56分,远落后于Qwen 3。5 35 B-A3 B(76. 5)和杰玛3 27 B(65. 6)。它还落后于NaturalQuestions中的开放事实检索。

后者可能与只有30亿个活动参数有关,这比密集的27 B模型可以存储更少的世界知识。

RULER长上下文测试还揭示了一个具体的弱点:当模型必须从长文本中提取频繁出现的单词时,Sooi S的点击率在超过32,000个上下文标记后下降到3%左右,而类似的Nemotron模型仍然管理60%至64%。

作者将其归因于他们的长上下文训练数据包含许多长文档,但缺乏为提取任务设计的合成数据。在剩下的12个RULER任务中,两个模型的执行情况大致相同。

主权基础设施和有记录的开放性该培训于3月至5月在慕尼黑德国电信工业人工智能云的512个Nvidia B200 GPU上进行,总计约253,000 GPU小时。

根据该报告,该设施完全依靠可再生能源运行,用来自伊茨巴赫运河的水冷却,并将废热输送到周围的Tucherpark社区。Sooi S是在该基础设施上进行的首批大型培训之一。

Soofi背后是一个由德国研究机构和公司组成的财团,由德国人工智能协会协调,德国联邦经济事务和能源部资助,作为欧洲IPCEI-CIS计划的一部分。

参与者包括弗劳恩霍夫研究所IAIS和IIS、德国人工智能研究中心(DFKI)、达姆施塔特工业大学、维尔茨堡大学、L3 S研究中心、柏林应用科学大学以及人工智能公司Ellamind和Merantix Momentum。

该项目的目标是建立一个开放的欧洲人工智能模型家族,可以在主权基础设施上运行并在工业应用中进行测试。研究人员正在发布模型权重以及选定的中间检查点(完整列车)

原文出处
German AI consortium releases Soofi S, an open 30B model that tops benchmarks

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读