展开目录 ▾
#Aleph Alpha#Kolibri#开源权重#主权 AI#欧洲#合规

Aleph Alpha 开源 Kolibri:78B 只激活 3.46B,欧洲用「主权」切开源模型这条口子

Aleph Alpha 在德国统一日开源 Kolibri:英德双语 MoE,78B 总参数、每 token 约 3.46B 激活,1M 上下文,权重已在 Hugging Face 按 Apache 2.0 发布。它把「主权」拆成研发主权与部署主权两件事,并把 EU AI Act、GDPR 与版权合规写进训练数据治理(450 万条 URL 黑名单);本文拆解参数取舍、官方基准与 Cohere 合并背景。

预计阅读 5 分钟

一句话总结

10 月 3 日,德国海德堡的 Aleph Alpha 在德国统一日放出 Kolibri:英德双语 MoE,78B 总参数每 token 只激活约 3.46B,支持 1M 上下文,权重已经在 Hugging Face 上按 Apache 2.0 完全开放。它没有去争「最强开源模型」,而是明确站在另一个坐标上——面向公共管理、工业与国防的关键任务,把「主权」和「合规」当成产品本身来交付。

数据来源:Aleph Alpha 官方新闻稿《Aleph Alpha releases Kolibri》(海德堡,2026-10-05)、官方博客《Kolibri Has Landed: A Sovereign Open-Weight Model》(2026-10-03)、官方技术报告与模型卡。


发布的是什么:78B / 3.46B,英德双语,Apache 2.0

Kolibri(德语「蜂鸟」)是一个英文-德文 MoE Transformer:

  • 参数:78B 总参数、每 token 约 3.46B 激活(官方新闻稿写作「约 3B」);
  • 上下文:最长 1M token,官方建议复杂任务服务时控制在 256K 以内;
  • 许可:Apache 2.0,权重可直接下载、可跑在自己的硬件上。

Kolibri 的关键数字:78B 总参 / 3.46B 激活 / 1M 上下文 / 384 个专家 / 23% 德语语料 / Apache 2.0

取舍过程官方写得很具体:他们先做了 Kolibri Origin(30B 总参、3B 激活、65K 上下文)来验证整条流水线,再放大。实验中从 32B 一路加到 123B 时能力确实继续涨,但服务成本涨得更快——123B 在两块 H100 上只能同时处理 3 个 256K 长上下文请求,78B 能并发 18 个、解码还快 28%。于是停在 78B,并用 384 个小专家而不是少量宽专家来撑起容量。这个决定的含义是:模型不是给排行榜用的,是给「要自己买卡、自己上线」的客户用的。

为什么是德语:23% 语料 + 德语专用分词器

Kolibri 的差异化不从参数来,而从语言来。官方新闻稿给出的几条:

  • 德文文本约占其预训练数据的 23%,模型被训练成「用德语推理」;
  • 分词器针对德语优化,同一段德语文本能压成更少的 token,直接省的是推理成本;
  • 联合创始人 Samuel Weinbach 的说法是:分词器和「用德语思考」都是围绕德语应用的日常需求设计的。

AI 圈的一个默认假设是「英文够强,其他语言自然溢出」。Kolibri 反着做:先承认欧洲客户的真实工作流是德语的,再把预算砸进去。对处理德语公文、德语技术文档与德语客服的团队来说,这项收益比榜单排名实在得多。

「主权」是两个维度,不是一句口号

Aleph Alpha 对「主权」的定义值得单独拎出来,因为它把一个政治词拆成了两条可验证的工程清单:

Aleph Alpha 说的「主权」是两件事:怎么造的(研发主权)与怎么交付(部署主权)

研发主权指模型是怎么造出来的:团队在德国海德堡(2019 年成立、约 200 人),从数据采集、清洗、预训练到后训练全流程自持,训练在德国与芬兰的基础设施上完成。部署主权指模型怎么交到客户手里:权重可下载、可内网部署,不必把内部数据送进第三方推理服务;模型内置推理档位,能让用户自己调「思考深度 vs 响应速度」的平衡;在 RAG 场景下被专门训练成证据不足时拒答,而不是硬编一个看起来完整的答案。

这两条合起来才是他们说的「合规不再靠外部承诺,而是随权重一起交付」——客户拿到的是可以直接审计的东西,而不是一纸 SLA。

合规被写进训练数据治理

技术报告里公布的治理措施比宣传语更硬:全部训练数据对照一份超过 450 万条 URL 的黑名单做过筛查(来源包括欧盟委员会的盗版观察名单 Piracy Watch List);每一份第三方数据在使用前都要评估许可证条款、来源合法性以及是否尊重 opt-out 声明。官方强调这是一套留存记录、可复盘每个决策的流程,覆盖数据采集、预训练、后训练到最终评测。

对需要过审、要写 AI 治理文档的欧洲政企采购来说,这些记录本身就是交付物的一部分。对照检查一下:多数开源权重模型的发布公告里,这一栏是空的。

Kolibri 官方发布视觉

自报基准:赢在一部分,输在一部分

Aleph Alpha 用的是自家的评测台,对手选了 Alibaba 的 Qwen3.6-35B-A3B、Nvidia 的 Nemotron 3 Super 120B-A12B 和法国 Mistral Small 4 119B-A6B。在这个场里 Kolibri 的表现是:

基准Kolibri说明
AIME 2025 / 2026(数学)96.9 / 96.0领先对比组
GPQA Diamond(知识)84.3领先对比组
LiveCodeBench(代码)85.9领先对比组
τ²-bench telecom、BFCL(工具调用)—落后于 Qwen3.6-35B-A3B

也就是说:数学、知识、代码这类静态基准上 Kolibri 站得住,工具调用与部分 Agent 场景上不如更小的 Qwen3.6。官方对这套公开基准本身的态度也写在公告里——他们认为公开榜单反映不了客户的真实需求,所以另外自建了面向公共管理、汽车零部件、航空航天等行业的测试集,其中航空航天一项从前代提升明显。这类自建行业基准没有第三方复现,参考时要把口径一起看。

另一个必须说的缺口:Kolibri 还没上 Artificial Analysis,目前没有独立的智力指数排名。按对比模型的分数(Qwen3.6-35B-A3B 18 分、Nemotron 3 Super 13 分、Mistral Small 4 11 分)推算,量级大约在 15 至 20 分之间——这只是估算,不是实测。硬件门槛方面,第三方实测口径是 FP8 权重、至少两块 A100 80GB 或 H100,实际显存占用约 140GB 量级。

更大的背景:一家德国公司和一次跨大西洋合并

Kolibri 发布的时间点,和 Aleph Alpha 自身的一次大变动叠在一起:

  • 9 月 16 日与 24 日,Cohere 与 Aleph Alpha 先后宣布签署合并协议,目标是成为「第一家跨大西洋的主权 AI 公司」,交易仍需监管批准;
  • 官方同时说明,在交割完成前 Aleph Alpha 继续独立运营——Kolibri 是独立状态下放出的最后一个大动作之一;
  • 9 月 28 日,公司宣布 Reto Spörri 离任,Ilhan Scheer 继续担任 CEO。

Aleph Alpha 官方新闻页配图:柏林联邦新闻发布会现场(桌上名牌为 Weinbach 等发言人)

把这三件事放在一起看,Kolibri 的角色有两层:它既是面向客户的产品,也是合并前的一次技术验证——78B 量级的模型可以在德国与芬兰的自建基础设施上、由自己的团队从零训出来。欧洲的另一张牌是法国的 Mistral,它走的是通用能力路线;Aleph Alpha 走的则是「专门语言 + 专门行业 + 合规交付」的窄而深路线。两条路都在回答同一个问题:在美国闭源 API 与中国开源权重之间,欧洲的采购方能不能有第三个选项。

总结

  • 是什么:Aleph Alpha 的英德双语 MoE 模型 Kolibri,78B 总参 / 约 3.46B 激活 / 1M 上下文,Apache 2.0,权重已在 Hugging Face,10 月 3 日(德国统一日)发布。
  • 参数取舍:停在小规模是因为 123B 在两块 H100 上只能并发 3 个 256K 请求,78B 能并发 18 个且解码快 28%;384 个小专家替代少量宽专家。
  • 差异化:23% 德语预训练语料 + 德语优化分词器 + 用德语推理,面向公共管理、工业、航空航天等关键任务。
  • 合规即产品:450 万条 URL 黑名单、逐份第三方数据集评估许可证与 opt-out,EU AI Act / GDPR / 版权要求的处理措施写进技术报告。
  • 可信度边界:基准为自报口径,工具调用与部分 Agent 场景落后 Qwen3.6-35B-A3B,尚未进入 Artificial Analysis(估算 15–20 分);行业内基准没有第三方复现。
  • 背景:Cohere 与 Aleph Alpha 已签合并协议(待监管批准),交割前独立运营;CEO 于 9 月 28 日交接。

图片出处:封面、「主权的两个维度」示意图由 UU AI Hub 自制;Kolibri 官方发布视觉、柏林联邦新闻发布会现场照片与规格数据取自 Aleph Alpha 官方新闻稿、官方新闻页与官方博客原文。

数据来源:Aleph Alpha 官方新闻稿(海德堡,2026-10-05)与官方博客《Kolibri Has Landed: A Sovereign Open-Weight Model》(2026-10-03)、官方技术报告;Aleph Alpha 官方 X 账号发布帖(2026-10-03);Trending Topics 对官方基准的第三方梳理、tej.as 与 MindStudio 对模型卡与硬件需求的技术拆解(2026-10-03/04)。

Related

相关文章

延伸阅读

查看全部 →
Reflection AI

Reflection AI 开源 501B 的 Beam:23B 激活、1/3 推理算力,西方开源权重的正面回应

英伟达投资的 Reflection AI 于 10 月 5 日发布首个开源权重模型 Beam:稀疏 MoE,501B 总参数只激活 23B,23.8T token 预训练、1 亿次 RL rollout。官方称推理能力接近 GLM-5.2 而推理算力只要 1/3 至 1/4,但自家对比表里多数编程任务仍落后 GLM-5.3、Kimi K3 与 DeepSeek V4.1 Flash;权重按 Apache 2.0 本月晚些放出。

Claude Code

Claude Code Mods 全解:几行 TypeScript 挂钩内部事件,代价是「没有沙箱」

Anthropic 发布 Claude Code Mods:用 TypeScript 函数挂到 Claude Code 的事件系统上,就能重写提示词、拦截或重试工具调用、自行批准权限、在 Claude 读到之前抹掉密钥,甚至替换界面。多个 Mod 按加载顺序形成中间件链,内置功能(如 /diff)开始迁移成 Mod;代价是 Mod 没有沙箱,与 Claude Code 本身同权限。

Cloudflare

决策模型井喷:Cloudflare 开源 Clef、AWS 发布 Strands Decider 2B,两周内四家入场

「决策模型」在两周内从一家创业公司的概念变成一层基础设施:9/15 TypeSafe 的 Jev、9/29 OpenAI 的 Decisions API、10/1 Cloudflare 开源 Clef 与 Clef-flash、同日 AWS 发布 Strands Decider 2B。它们不写文本,只对预设选项打分并给出校准概率,把路由与审批从大模型里拆出来;本文拆解两家新玩家的架构、官方基准与开源程度。