Aleph Alpha veröffentlicht ein Sprachmodell mit besonderem Deutsch-Fokus

Aleph Alpha veröffentlicht zum Tag der Deutschen Einheit Kolibri, ein Open-Weights-Modell für Deutsch und Englisch. Es richtet sich an Behörden und Industrie und verbindet deutsche Trainingsdaten mit einem eigenen Tokenizer und steuerbarem Reasoning.
Benchmarks für Fachfragen und Agenten
Im deutschen GPQA Diamond für naturwissenschaftliche Fachfragen erreicht Kolibri 81 Prozent, etwa gleichauf mit Qwen3.6. Bei Programmieraufgaben im LiveCodeBench v6 erzielt es 86 Prozent, bei Dokumentenfragen im FRAMES-Test 71 Prozent.
Besonder fällt der Tau3-Bench für mehrstufige Bankaufgaben auf. Hier liegt Kolibri mit 38 Prozent deutlich vor Qwen3.6 mit 11 Prozent.
Quelle: Aleph Alpha
Deutsche Daten und weniger Token
Mehr als ein Fünftel des Vortrainings entfällt auf Deutsch. Zum Material gehören Webtexte, Parlamentsprotokolle und Gesetzestexte. Die Entwickler passten Datenfilter an, damit lange deutsche Wörter und Verwaltungssprache erhalten bleiben.
Kolibri wurde von Grund auf in Deutschland entwickelt und auf Infrastruktur in Deutschland und Finnland trainiert.
Der Tokenizer »UniBPE« berücksichtigt deutsche Wortstrukturen. »Protokolldaten« zerlegt er beispielsweise in »Protokoll« und »daten«. Für deutsche Webtexte benötigt Kolibri rund 11 Prozent weniger Token als der GPT-5-Tokenizer.
Quelle: Aleph Alpha
Steuerbare Denktiefe und Dokumentenarbeit
Die Mixture-of-Experts-Architektur aktiviert pro Token rund 3,46 der insgesamt 78 Milliarden Parameter. Vier Reasoning-Stufen steuern den Rechenaufwand. Tool Calling ermöglicht den Zugriff auf externe Dienste.
Das »Merlin-Arthur«-Training lehrt Kolibri, bei fehlenden Belegen in Dokumenten auf eine Antwort zu verzichten. Das Kontextfenster lässt sich von den trainierten 262.144 auf rund eine Million Token erweitern. Für komplexe Aufgaben empfiehlt Aleph Alpha aber die kleinere Grenze.
Anzeige
Verfügbarkeit und Kosten
Kolibri-1 steht auf Hugging Face unter Apache 2.0 bereit, auch für kommerziellen Eigenbetrieb. Die FP8-Modellgewichte benötigen etwa 78 GB Speicher. Als Mindesthardware nennt Aleph Alpha beispielsweise zwei A100 mit jeweils 80 GB oder eine H200. Einen öffentlichen API-Tokenpreis gibt es zum Start nicht.

