Статья
Отечественный сегмент аналитических хранилищ данных класса Data Lakehouse оставил позади этап единичных экспериментов и вошел в стадию массового промышленного применения. Согласно исследованию «Отечественные решения Data Lakehouse Круг Громова 2026», отрасль переживает сейчас глубокую перестройку: законодательные нормы стали основной движущей силой рынка, производители платформ разошлись по двум противоположным архитектурным лагерям, а информационная безопасность вышла на первое место среди критериев выбора решения. Что касается искусственного интеллекта — в российских Lakehouse-продуктах он пока используется скорее фрагментарно, чем системно.
В основе структурной перестройки рынка лежит появление двух конкурирующих философий построения платформ, и у каждой есть своя аудитория. Первый вариант — «интегрированные платформы»: конструкции на базе набора open-source инструментов (Spark, Trino, Impala, Airflow и подобных), которые вендор «сшивает» общим слоем управления, мониторинга и защиты. Плюс такого подхода — широкие возможности кастомизации, минус — заметная сложность эксплуатации и высокие требования к квалификации команды заказчика.
Второй путь — «унифицированные системы»: платформы, задуманные сразу как цельная архитектура, а не собранные постфактум из разрозненных компонентов. Внутри такой системы может работать один движок или несколько, но все они плотно интегрированы в общую среду — с единым хранилищем, моделью безопасности и панелью управления. Такие решения проще запустить и поддерживать, хотя по функциональной широте они порой уступают интегрированным аналогам.
Оба лагеря сосуществуют и развиваются параллельно — выбор конкретного пути зависит от того, что для компании важнее: максимальная гибкость или скорость и простота внедрения. Технический руководитель решений Data Ocean, Data Sapience Евгений Вилков описывает логику корпоративных клиентов так: «Не существует движка — “серебряной пули”, который может решить все задачи бизнеса. На практике вокруг такой платформы со временем появится “зоопарк” разрозненных решений. Кроме того, существует риск закрытия проекта или смены лицензии. Корпоративные клиенты выбирают платформу, максимально диверсифицированную и не зависящую от одной базовой технологии».
Директор по продуктам направления «Дата-сервисы» VK Tech Екатерина Канунникова смотрит на ситуацию со стороны ИТ-подразделений заказчиков: «На рынке сейчас более востребован подход интегрированных платформ. Это связано с тем, что основной пользователь таких решений — инженерные команды, которым привычнее работать с конкретными инструментами. У заказчиков, особенно в on-premise-сценариях (развертывание на собственной инфраструктуре), уже есть сформированные команды с экспертизой в определенных технологиях, и этот фактор напрямую влияет на выбор».
Иными словами, интегрированные платформы побеждают там, где заказчику важно опираться на уже накопленную экспертизу команды и не попадать в зависимость от одного поставщика, тогда как унифицированные системы находят спрос в проектах, где на первый план выходят скорость запуска и экономия на эксплуатации.
Отток западных вендоров и параллельное ужесточение требований к российскому софту стали мощным ускорителем для всей отрасли. Реестр отечественного ПО, сертификация ФСТЭК, а также нормативная база в области критической информационной инфраструктуры и защиты персональных данных задали понятные правила игры и одновременно сформировали устойчивый платежеспособный спрос. Для производителей регуляторика перестала быть формальностью — наличие профильных сертификатов открывает прямой доступ к государственным и крупным корпоративным контрактам.
Изменился и сам характер запросов заказчиков — от общего интереса к теме к конкретным техническим задачам. «Если два-три года назад приходилось объяснять клиентам, что такое парадигма Lakehouse, то сейчас потенциальный клиент уже хорошо осведомлен и целенаправленно ищет решение под свои задачи», — сказал Евгений Вилков. Наиболее высокий спрос по-прежнему демонстрируют финансовый сектор и ритейл — отрасли с большими массивами данных и острой конкуренцией. Подтягиваются телеком и промышленность, которым приходится параллельно решать проблему завершения жизненного цикла прежнего поколения аналитических систем.
Екатерина Канунникова подтверждает смену акцентов: «Фокус сместился на решение конкретных задач: снижении стоимости хранения, упрощении архитектуры вместо связки DWH (хранилища данных) и Data Lake, подготовке данных для ML/AI и поддержке near real-time аналитики (аналитики, близкой к реальному времени). Вступают в гонку data-driven трансформации и новые отрасли: промышленность, нефтегаз, B2G-сегмент».
Отдельно эксперты предостерегают от подмены понятий: не любое хранение «холодных» данных можно называть Lakehouse. «Перенос холодных данных в S3 (объектное хранилище, совместимое с протоколом Amazon S3) — это стратегия тиринга (многоуровневого хранения). Со своей стороны, Lakehouse — полноценная архитектурная модель, где объектное хранилище становится основным слоем, а вычисления масштабируются независимо. Это меняет не только экономику, но и принципы построения платформы», — подчеркивает Екатерина Канунникова.
Для компаний из регулируемых отраслей ключевым условием при выборе платформы стала возможность выстроить единую систему аутентификации и авторизации на основе ролевой модели RBAC (Role-Based Access Control). На практике объединение множества open-source компонентов в одну систему управления правами доступа — задача далеко не тривиальная, и готовое решение «из коробки» есть далеко не у всех вендоров.
«Требования к безопасности стали значительно детальнее и получили статус “критично”. Заказчиков интересует конкретная реализация RBAC: как роли применяются к пользователям и сервисным учетным записям, насколько гибко можно управлять доступом на уровне таблиц и столбцов», — сказала Екатерина Канунникова. Отдельная головная боль — рассинхронизация политик доступа: если правила для S3-хранилища не совпадают с правилами SQL-движков, пользователь способен обойти установленные ограничения. Поэтому именно единая сквозная модель управления доступом без «дыр» становится обязательным требованием.
Евгений Вилков добавляет, что заказчики из корпоративного сегмента рассчитывают на реальную поддержку со стороны поставщика при устранении обнаруженных уязвимостей — причем в четко оговоренные сроки. А наличие сквозного аудита и возможности проследить происхождение данных (Data Lineage) специалисты по информационной безопасности сегодня считают обязательным условием, а не опцией.
Компонент, который заказчики нередко недооценивают, — само объектное хранилище S3. На деле именно оно составляет основу всей архитектуры Lakehouse. «Если вычислительные движки — это “голова” платформы, то S3 — ее “сердце”. Производительность определяется не только SQL-движком, но и тем, насколько эффективно хранилище обслуживает операции чтения и записи», — сказала Екатерина Канунникова.
Особенно остро вопрос выбора хранилища встает в сценариях развертывания на собственной инфраструктуре (on-premise). Попытка сэкономить на S3 оборачивается падением производительности при работе с метаданными, нестабильной работой платформы под конкурентной нагрузкой и простоем дорогостоящих вычислительных мощностей в ожидании операций ввода-вывода. От надежности, масштабируемости и итоговой стоимости владения объектным хранилищем напрямую зависит эффективность всей платформы.
Несмотря на общемировой ажиотаж вокруг искусственного интеллекта, среди российских Data Lakehouse-платформ полноценные ИИ-агенты — способные самостоятельно писать SQL-запросы, строить дашборды и проверять гипотезы — реализованы пока лишь у одного из участников исследования, компании Tengri Data. Остальные поставщики ограничиваются либо copilot-функциями для помощи в составлении запросов, либо только обещают агентные возможности в будущих версиях продуктов.
«Спрос смещается в сторону готовности платформы к вызовам ИИ. Мы стараемся сделать интерфейсы доступными для людей, далеких от мира данных, за счет интеграции ИИ-агентов и чат-ботов», — сказал Евгений Вилков. При этом Екатерина Канунникова предупреждает, что без должной подготовки данных любые ИИ-агенты рискуют остаться не более чем демонстрацией технологии: «Чтобы строить корпоративных AI-агентов, необходимо сначала собрать данные в едином хранилище, обеспечить качество, права доступа и версии. Отдельную сложность представляют неструктурированные данные: их недостаточно просто хранить — необходимо индексировать и обогащать».
По оценкам экспертов, в горизонте ближайших пяти лет искусственный интеллект перестанет быть надстройкой и станет органичной частью самой платформы — от запросов на естественном языке до автоматической настройки инфраструктуры и прогнозирования нагрузки.
Основатель аналитического центра «Круги Громова» Сергей Громов подводит итог: «Рынок отечественных Data Lakehouse сформировался и перешел в стадию зрелой конкуренции. Мы видим, что регуляторная среда создала каркас для роста десятка новых продуктов. Однако технологическая зрелость решений неоднородна. Если в области вычислительных движков и хранения данных российские платформы демонстрируют высокий уровень, то вопросы сквозной безопасности, управления метаданными и семантического слоя остаются зонами активного развития. Выбор решения должен начинаться с четкой формулировки бизнес-целей и понимания собственных компетенций. Интегрированная платформа даст гибкость, но потребует сильной инженерной команды. Унифицированная система снизит порог входа, но может ограничить в будущем. При этом нельзя рассматривать Data Lakehouse как замену DWH по умолчанию — эта архитектура оправдана при реальных объемах Big Data, разнообразии источников и потребности в ML/AI-сценариях. Без этих предпосылок целесообразнее рассмотреть альтернативные архитектурные шаблоны».