Логотип

Новость

«Яндекс» сэкономил 9,2 млрд рублей за полугодие благодаря оптимизации вычислительной инфраструктуры

Компания «Яндекс» подвела итоги программы оптимизации вычислительной инфраструктуры за первое полугодие 2026 года. По итогам работы удалось сэкономить 9,2 млрд рублей за счет повышения эффективности использования вычислительных мощностей, при этом высвободившиеся ресурсы были направлены на масштабирование разработки технологий искусственного интеллекта. 

Одним из ключевых направлений программы стало динамическое перераспределение вычислительных ресурсов: при снижении пользовательской нагрузки свободные мощности автоматически переключаются на другие задачи. Так, в ночное время, когда активность пользователей падает и нагрузка на сервисы снижается, графические процессоры (GPU) автоматически подключаются к обучению новых моделей, что позволяет практически исключить простой дорогостоящих вычислительных ресурсов.

Дополнительный эффект дала оптимизация самих моделей. Часть из них перевели на архитектуру MoE (Mixture of Experts, «смесь экспертов»), при которой для обработки каждого запроса задействуется лишь необходимая часть нейросети. Кроме того, инженеры компании применили технологию, при которой небольшая модель обучается на основе уже обученной крупной модели, а также использовали квантизацию, позволяющую производить вычисления в более эффективном формате.

Параллельно была усовершенствована инфраструктура обучения и инференса: в компании ускорили загрузку данных для обучения моделей, распараллелили вычислительные процессы, внедрили кэширование повторяющихся операций, а также технологию Eagle, которая ускоряет генерацию ответов за счет прогнозирования сразу нескольких последующих токенов.

Программа оптимизации затронула не только ИИ-инфраструктуру, но и вычислительные мощности, обеспечивающие работу остальных сервисов компании. В частности, была улучшена работа серверов на центральных процессорах (CPU), задействованных в поиске, рекомендательных системах и других высоконагруженных продуктах. Для этого применили технологии оптимизации компиляции PGO и BOLT, которые анализируют реальную нагрузку сервисов и позволяют процессорам выполнять больше операций без увеличения задействованных ресурсов за счет более точной организации программного кода.

Отдельный блок работ был посвящен системам хранения служебных данных. Инженеры пересмотрели правила хранения информации на всех этапах ее жизненного цикла — от сроков хранения до размещения в различных типах хранилищ. В рамках этой работы были оптимизированы правила хранения, устранено избыточное дублирование данных, протестированы новые алгоритмы сжатия, а также внедрены инструменты для автоматического поиска неиспользуемых таблиц, полей и резервных копий и более рационального распределения данных между разными типами хранилищ — HDD, SSD и другими. В результате компании удалось снизить нагрузку на инфраструктуру и выстроить единый процесс постоянного поиска и устранения «потерь» вычислительных ресурсов.

В «Яндексе» подчеркивают, что оптимизация вычислительной инфраструктуры остается непрерывным процессом: компания регулярно проводит технические и бизнес-аудиты использования вычислительных мощностей, чтобы повышать эффективность существующей инфраструктуры и направлять высвобождающиеся ресурсы на развитие технологий искусственного интеллекта и новых продуктов.

Реализацией программы занимаются инженеры бизнес-группы поисковых сервисов и ИИ совместно с командой внутренней инфраструктуры «Яндекса». Многие изменения удалось внедрить одновременно во всех продуктах благодаря единой ML-платформе компании — внутреннему комплексу технологий и процессов, охватывающему весь цикл работы с моделями, от обучения до эксплуатации. Это позволяет быстрее внедрять инженерные решения и эффективнее использовать существующую инфраструктуру.