# Архитектура и стабильность обучения Alice AI Foundation 80B A3B

**Максим Абрахам**, Яндекс. Секция: Другое.

Страница доклада: https://ainativeconf.ru/talks/alice-ai-foundation-80b/
Конференция: AI Native Conf 2026, 20 октября 2026, Москва, кластер «Ломоносов», и онлайн-трансляция — https://ainativeconf.ru/

## Тезисы

Расскажу, как мы с нуля обучили AliceAI-Foundation-80B-A3B-Base — MoE-модель на 80 млрд параметров, из которых около 3 млрд активируются для каждого токена. Покажу устройство её архитектуры: сочетание Kimi Delta Attention с полным attention и блочный вариант Attention Residuals, который позволяет слоям обращаться к представлениям предыдущих блоков.

Отдельно расскажу, как мы связали резкий скачок loss с ростом активаций MoE и стабилизировали обучение с помощью Z-Loss. В завершение разберу распределённую реализацию Muon, в которой пересылки данных выполняются параллельно с ортогонализацией, что примерно вдвое ускоряет шаг оптимизатора.

## Для кого доклад

ML-инженеры и исследователи, которые сами занимаются предобучением больших языковых моделей.

## О докладчике

Руководитель команды исследования архитектуры YandexGPT

## О компании

Яндекс - технологическая компания.

## Статус

Доклад принят в программу. В сетке дня: 20 октября 2026, 17:10–18:00, Зал Молекула — полное расписание: https://ainativeconf.ru/schedule/. Конференция не прошла, видеозаписи и транскрипта пока нет.
