Kolibri: Aleph Alpha gibt ein deutsches KI-Modell zum Selbstbetrieb frei

Aleph Alpha veröffentlicht Kolibri mit offenen Gewichten: 78 Mrd. Parameter, Deutsch und Englisch, keine API. Was Selbstbetrieb kostet und bringt.

Nahaufnahme von Server-Racks in einem Rechenzentrum mit grünen Statusleuchten

Aleph Alpha hat am 3. Oktober 2026 das Sprachmodell Kolibri veröffentlicht. Es ist nach Angaben des Handelsblatts das erste eigene Sprachmodell des Heidelberger Unternehmens seit August 2024. Die Gewichte stehen unter der Lizenz Apache 2.0 auf Hugging Face bereit. Eine gehostete Schnittstelle bietet Aleph Alpha bewusst nicht an: Kolibri ist für den Betrieb im eigenen Rechenzentrum gedacht, vor allem für Verwaltung, Industrie und andere regulierte Branchen.

Groß im Speicher, klein in der Rechnung

Kolibri ist ein Mixture-of-Experts-Modell. Es hat insgesamt 78,1 Milliarden Parameter, bei jedem Token sind aber nur rund 3,46 Milliarden aktiv, also etwa 4,4 Prozent. Jede der 50 Schichten enthält 384 Experten, von denen pro Token sechs ausgewählt werden, dazu kommt ein geteilter Experte. Der Rechenaufwand pro Token entspricht damit eher einem kleinen Modell, der Speicherbedarf dagegen dem eines großen, denn alle Gewichte müssen im Grafikspeicher liegen.

Das Modell beherrscht nur Deutsch und Englisch. Trainiert wurde es auf Texte mit 262.144 Token Länge, durch Extrapolation verarbeitet es laut Hersteller bis zu eine Million Token. In Aleph Alphas eigenen Langtext-Tests liegt Kolibri bis 256.000 Token hinter einigen Konkurrenten, verliert darüber aber am wenigsten an Qualität. Der Wissensstand reicht bis zum 18. Juni 2026. Die Instruct-Fassung kann Werkzeuge aufrufen und in vier Stufen von none bis high vor der Antwort nachdenken.

Trainiert in Deutschland und Finnland

Für das Vortraining liefen nach dem technischen Bericht 768 Nvidia-B200-Grafikprozessoren 21 Tage lang. Das Modell sah rund 20 Billionen Token im Vortraining und etwa 24 Billionen über alle Phasen. Der Deutschanteil liegt bei über 20 Prozent, die Angaben schwanken je nach Quelle zwischen 21,3 und 23,9 Prozent. Etwa ein Viertel der Vortrainingsdaten ist synthetisch erzeugt.

We trained it on infrastructure in Germany and Finland, under European and German law, with no foreign control.

So beschreibt Aleph Alpha in der Ankündigung die Herkunft. Welche Rechenzentren genau beteiligt waren, nennt das Unternehmen nicht. Bemerkenswert ist ein Detail aus dem Nachtraining: Als Lehrermodelle dienten unter anderem GLM-5.2, GLM-5.3 und Qwen3.8 aus China. Die Modellkarte räumt selbst ein, dass dadurch politische Verzerrungen übernommen werden können. Aleph Alpha hat nach eigenen Angaben eigene Trainingsumgebungen für ausgewogene Antworten gebaut und Daten mit Narrativen der Kommunistischen Partei herausgefiltert. Eine Woche zuvor hatte das Unternehmen eine Studie veröffentlicht, nach der chinesische Modelle wie Qwen 3.6, DeepSeek R1 und Kimi K2.5 bei heiklen Themen nur in 17 bis 37 Prozent der Fälle ausgewogen antworten. Einen solchen Wert für Kolibri selbst nennt Aleph Alpha nicht.

Ein Kolibri schwebt vor einer orangefarbenen Lilie

Was die Benchmarks zeigen

Alle bisher verfügbaren Messwerte stammen vom Hersteller, unabhängige Tests gibt es noch nicht. Im Gesamtwert des technischen Berichts erreicht Kolibri 75,5 Punkte auf Englisch und 70,8 auf Deutsch. Damit liegt es vor GPT-OSS 120B (72,3 und 70,2), Gemma 4 26B (71,9 und 66,3) und Mistral Small 4 (63,1 und 61,4). Deutlich vorn liegt allerdings Qwen3.8 27B mit 80,2 und 79,9 Punkten, gerade in der deutschen Wertung.

Stark ist Kolibri bei Mathematik und Programmieren: 96,9 Prozent bei AIME 2025, 84,3 Prozent bei GPQA Diamond und 85,9 Prozent bei LiveCodeBench v6. Schwächer fällt das Werkzeugaufrufen über mehrere Gesprächsrunden aus, im Multi-Turn-Teil von BFCL v4 kommt das Modell nur auf 47,5 Prozent. Für Agenten, die viele Schritte nacheinander erledigen, ist das ein Warnzeichen. Das Portal Trending Topics kritisiert zudem, dass die Ankündigung nur mit drei Modellen aus dem Frühjahr vergleicht und neuere offene Modelle wie MiMo-V2.6-Pro außen vor lässt.

Was man für den Selbstbetrieb braucht

Kolibri gibt es in FP8 mit rund 78 GB und in BF16 mit rund 156 GB. Als Mindestausstattung nennt die Modellkarte zwei A100 mit je 80 GB, zwei H100 oder eine einzelne H200, B200 oder B300. Betrieben wird das Modell über vLLM, das eine OpenAI-kompatible Schnittstelle bereitstellt. Bestehende Anwendungen lassen sich so oft mit einer geänderten Adresse anbinden.

Ein Punkt verdient einen genauen Blick: Die Apache-Lizenz gilt ausdrücklich nur für die Gewichte und Konfigurationsdateien. Für den Betrieb braucht man zusätzlich das Paket aleph-alpha-inference, ein Plugin für vLLM. Dessen Lizenzbedingungen sollte die Rechtsabteilung vor dem produktiven Einsatz prüfen.

Wer keine eigenen Grafikkarten hat, ist auf einen Hoster angewiesen. Ein Angebot auf STACKIT, der Cloud der Schwarz-Gruppe, ist laut WirtschaftsWoche geplant, aber noch nicht verfügbar. Gleichzeitig steht Aleph Alpha vor einem Umbruch: Am 16. September haben Aleph Alpha und Cohere eine Fusion vereinbart, die noch genehmigt werden muss. Für Anwender ist das weniger dramatisch, als es klingt. Die veröffentlichten Gewichte bleiben unter Apache 2.0 nutzbar, egal wie es mit dem Unternehmen weitergeht.

Datenschutz und AI Act

Der eigentliche Vorteil liegt beim Datenschutz. Läuft das Modell auf eigener oder in Deutschland gemieteter Hardware, verlassen Eingaben und Dokumente das eigene Netz nicht. Es gibt keine Übermittlung in die USA und keinen Anbieter, der Anfragen protokolliert oder auswertet. Für Kanzleien, Arztpraxen, Behörden oder Personalabteilungen ist das oft die Voraussetzung, um KI überhaupt mit echten Daten einzusetzen.

Die Verantwortung verschwindet damit aber nicht, sie wandert ins eigene Haus. Wer das Modell betreibt, muss den Server absichern, Updates einspielen und den Zugriff regeln. Die Pflichten aus dem AI Act als Betreiber eines KI-Systems hängen weiter vom Einsatzzweck ab. Aleph Alpha hat den Verhaltenskodex der EU für KI-Modelle mit allgemeinem Verwendungszweck unterzeichnet und verweist in der Modellkarte auf die KI-Verordnung.

Was das für Ihr Unternehmen heißt

  • Wer KI mit vertraulichen Daten nutzen will, bekommt mit Kolibri ein deutschsprachiges Modell, das komplett im eigenen Haus laufen kann, ohne Abhängigkeit von einem US-Anbieter.
  • Die Einstiegshürde ist Hardware: mindestens eine aktuelle Rechenzentrums-GPU oder zwei ältere mit je 80 GB. Das lohnt sich bei regelmäßiger Nutzung durch viele Mitarbeitende oder bei Daten, die nicht in die Cloud dürfen.
  • Statt laufender Kosten pro Token entstehen feste Kosten für Hardware oder Miete und Betrieb. Das macht das KI-Budget planbarer, aber nicht automatisch kleiner.
  • Für Agenten mit vielen Werkzeugschritten sind die Herstellerwerte noch schwach. Hier lohnt ein eigener Test mit echten Aufgaben, bevor man sich festlegt.
  • Vor dem produktiven Einsatz sollten die Lizenz des Inferenz-Plugins, die Absicherung des Servers und die Pflichten nach dem AI Act geklärt sein.
Richard von Rüden
Über den Autor Richard von Rüden Senior Entwickler & AI Engineer

Seit über 15 Jahren entwickle ich Websites und Apps und beschäftige mich intensiv mit KI-Automatisierung sowie Datenschutz. In meinen Artikeln teile ich aktuelle News, fundiertes Fachwissen und Erfahrungen aus zahlreichen Projekten.

Kostenlose Beratung
← Zurück zu den News