Aleph Alpha Kolibri: Wie der souveräne deutsche LLM arbeitet
Aleph Alpha hat am 3. Oktober 2026 das open-weight Sprachmodell Kolibri 1 veröffentlicht. Das Modell wurde vollständig in Deutschland entwickelt und auf Infrastruktur in Deutschland sowie Finnland trainiert. Damit reagiert das Unternehmen auf den wachsenden Bedarf an datenschutzkonformer KI-Infrastruktur unter Einhaltung des EU-AI-Act und nationaler Vorschriften. Kolibri steht unter der Apache-2.0-Lizenz und wird auf Hugging Face bereitgestellt. Technisch basiert Kolibri auf einer Mixture-of-Experts-Architektur mit insgesamt 78,1 Milliarden Parametern, von denen pro Token jedoch nur etwa 3,46 Milliarden aktiviert werden. Dies ermöglicht einen effizienten Inferenzbetrieb bei gleichzeitig hohem Leistungspotenzial. Das Modell ist auf Deutsch und Englisch ausgelegt, wobei die Tokenisierung durch den eigenentwickelten UniBPE-Algorithmus speziell auf deutsche Komposita optimiert ist. Im Vergleich zu etablierten Standard-Tokenizern reduziert Kolibri den Tokenbedarf für deutsche Texte um rund elf bis fünfzehn Prozent, was längere Dokumente effizienter verarbeitet. Für den Umgang mit extremen Kontextlängen nutzt Kolibri eine kombinierte Attention-Mechanik: 40 der 50 Schichten employieren ein Sliding-Window mit einer Fenstergröße von 512 Tokens, alle fünften Schichten blicken auf den vollständigen Verlauf. Dies erlaubt eine native Kontextlänge von 262.144 Tokens, die in Tests bis zu einer Million Tokens stabil skalierte. Die sprachliche Verarbeitung wird durch explizites German-Reasoning unterstützt. Aleph Alpha stellte fest, dass Modelle mit deutscher Denkdaten signifikant bessere mathematische und logische Ergebnisse in deutscher Sprache erzielen. Zudem kommt das Merlin-Arthur-Protokoll zum Einsatz, das das Modell gezielt auf Unsicherheitsmarkierungen trainiert. In Tests erkennt Kolibri Wissenslücken in 44 Prozent der Fälle und vermeidet so Halluzinationen deutlich besser als vergleichbare Open-Weight-Modelle. Der Rechenaufwand ist über den Parameter reasoning_effort stufenlos anpassbar. In internen und unabhängigen Benchmarks führt Kolibri in seiner Parameterklasse bei deutschen und englischen Gesamtscores, mathematischen Aufgaben sowie bei RAG-Szenarien über lange Unternehmensdokumente. Schwächen zeigen sich hingegen im Closed-Book-Knowledge, bei multi-turn tool calling und in Coding-Benchmarks. Für den Betrieb sind Datacenter-GPUs mit mindestens 78 GB VRAM erforderlich, typischerweise zwei NVIDIA A100 oder H100 mit 80 GB Speicher oder eine H200 oder B200. Die Inbetriebnahme erfordert ein vLLM-Plugin, das derzeit noch keine öffentlichen Hosting-Anbieter unterstützt. Die strategische Ausrichtung von Aleph Alpha liegt klar auf der souveränen Bereitstellung. Durch die volle Kontrolle über Datenfluss, Trainingsmethoden und Lizenzierung eignet sich Kolibri primär für den Einsatz in regulierten Sektoren wie Behörden, Gesundheitswesen, Automobilindustrie und Finanzen. Die bewusste Fokussierung auf zwei Sprachen und den lokalen Datenbestand unterstreicht das Ziel, qualitative Tiefe und Compliance vor quantitativer Universalität zu stellen. Mit der Veröffentlichung positioniert sich Aleph Alpha als direkte Antwort auf den europäischen Bedarf an kontrollierter, energieeffizienter und rechtssicherer Generative-AI-Infrastruktur.
