Folia
← 返回头版

Kolibri正式发布:德国主权可控的开源大语言模型

Aleph Alpha发布了Kolibri开源语言模型,这是一个具有78B总参数、3B活跃参数的英德双语混合专家Transformer模型1。该模型支持最长1M tokens的上下文长度1,专为主权可控和监管合规的关键任务开发,已在Hugging Face平台开源,采用Apache 2.0许可证1。

Kolibri在性能和能力上实现了多维升级。在768个B200 GPU上训练,共包含约24T tokens的数据,其中20T用于预训练、3.44T用于中期训练和200B用于长上下文适应1。预训练数据中,21.3%为德语、62%为英语、14%为代码1。与三个月前完成预训练的前代Kolibri Origin相比,新版本在数学、编码、接地和长上下文任务上的表现可匹配参数量多达四倍的模型(如Nemotron 3 Super)1。模型通过Merlin-Arthur协议训练以减少幻觉现象,其在AA-Omniscience测试中的弃权能力从Origin的15%提升至44%1。在Honeypot基准上,Kolibri超越所有对比模型,包括更大的Nemotron 3 Super和Mistral Small 41。

德语预训练数据中,80%由Aleph Alpha自主策展或生成,20%来自开源数据集1。


评论