Другое
Архитектура и стабильность обучения Alice AI Foundation 80B A3B
Максим Абрахам
Яндекс
Когда и где 20 октября, 17:10–18:00, Зал Молекула · всё расписание
Тезисы
Расскажу, как мы с нуля обучили AliceAI-Foundation-80B-A3B-Base — MoE-модель на 80 млрд параметров, из которых около 3 млрд активируются для каждого токена. Покажу устройство её архитектуры: сочетание Kimi Delta Attention с полным attention и блочный вариант Attention Residuals, который позволяет слоям обращаться к представлениям предыдущих блоков.
Отдельно расскажу, как мы связали резкий скачок loss с ростом активаций MoE и стабилизировали обучение с помощью Z-Loss. В завершение разберу распределённую реализацию Muon, в которой пересылки данных выполняются параллельно с ортогонализацией, что примерно вдвое ускоряет шаг оптимизатора.
Для кого доклад
ML-инженеры и исследователи, которые сами занимаются предобучением больших языковых моделей.
О докладчике
Руководитель команды исследования архитектуры YandexGPT
О компании
Яндекс — технологическая компания.
Кнопка ведёт на билет в зал. Если удобнее смотреть из своего города — билет на онлайн-трансляцию по той же цене: все четыре потока в прямом эфире и записи докладов после конференции. Оба формата и тарифы — в блоке билетов.
Эта же карточка для AI-агента: /talks/alice-ai-foundation-80b.md