Aleph Alpha представила Kolibri — немецко-английскую языковую модель с 78 миллиардами параметров в общей сложности, согласно официальной технической документации. Модель работает на архитектуре смеси экспертов, которая задействует примерно три миллиарда параметров на один токен, соблюдая расчетный баланс между эксплуатационными накладными расходами и качеством генерации для обоих поддерживаемых языков.

Немецкий язык составляет 21,3 процента обучающего корпуса, который обрабатывался через специальный пайплайн данных, собранный конкретно под этот проект. Любопытно, что этот пайплайн также задействовал синтетические обучающие данные, сгенерированные китайскими моделями. Эта деталь добавляет острой иронии к масштабному нарративу компании о чистокровной европейской технологической независимости.

Aleph Alpha позиционирует Kolibri строго для государственных ведомств, авиации и тяжелой промышленности — секторов, где соблюдение нормативов в рамках Регламента ЕС об искусственном интеллекте является обязательным условием. Модель поддерживает контекстные окна объемом до одного миллиона токенов и обучалась на 768 графических процессорах B200, физически развернутых в Германии и Финляндии. Несмотря на все разговоры о суверенных границах, весы модели находятся в открытом доступе на Hugging Face под лицензией Apache 2.0.

Они обещали герметичный, независимый европейский стек искусственного интеллекта, созданный исключительно в рамках локальных регуляторных рамок. А затем выпустили модель, частично обученную на синтетических данных от китайских систем, и наклеили на нее ярлык цифрового суверенитета. Это один из способов определить независимость.
Большие языковые моделиОпенсорс ИИРегулирование ИИAleph Alpha