
Yandex Data Processing
Управляемые кластеры Apache Spark и Hadoop в Yandex Cloud: платформа сама разворачивает и обслуживает узлы, а вы получаете root-доступ и почасовую оплату за фактически использованные ресурсы. Для дата-инженеров и ML-команд.
Основная информация
Технические характеристики
- Текущая версия
- Актуальные образы 2.1 (стабилен с 2.1.15) и 2.2 в бете; образы 1.4 и 2.0 устарели
- Технологический стек
- Образ 2.1 — Hadoop 3.3.2, Spark 3.3.2, Tez 0.10.1, Zeppelin 0.10.0, Livy 0.8.0, Python 3.8.13; образ 2.2 — Hadoop 3.3.2, Spark 3.5.0, Livy 0.8.0, Python 3.11.10
- Окружения (dev/prod)
- PRODUCTION и PRESTABLE, оба под SLA; PRESTABLE получает новые сборки раньше
- Масштабирование
- Автомасштабирование подкластеров обработки данных по очереди заданий YARN или по целевой загрузке vCPU
- Модель оплаты
- Почасовая оплата ресурсов Compute Cloud с наценкой за управляемый сервис, без абонентской платы; первые 100 ГБ исходящего трафика в месяц бесплатны, минимальная единица тарификации — 1 МБ
- Файловое хранилище
- HDFS внутри кластера и Yandex Object Storage для разделения вычислений и хранения
- Форматы данных
- Apache Iceberg и Delta Lake
- Разграничение доступа
- Root-пользователь на каждой ВМ кластера, разграничение доступа в Yandex Cloud
- Мониторинг
- Метрики в Yandex Monitoring, логи в Cloud Logging, аудит в Audit Trails
- CLI-инструменты
- Консоль управления, CLI, API и Terraform
- Модель развёртывания
- Полностью облачный управляемый сервис
- Локация данных
- Дата-центры Yandex Cloud в России; цены указаны для региона Россия
- НДС
- Цены в рублях и тенге указаны с НДС, в долларах — без НДС
- Компоненты платформы
- Apache Spark, HDFS, YARN, HBase, Oozie, Sqoop, Flume, Tez, Zeppelin; в образы входят conda и pip с библиотеками PyArrow, pandas, numpy, scikit-learn, Matplotlib и boto3
Безопасность и compliance
Поддержка и SLA
Интеграции Yandex Data Processing (10+)
- Yandex Object Storage— Хранилищеофициальная
- Apache Airflow— Оркестрацияофициальная
- Yandex Managed Service for Apache Airflow— Оркестрацияофициальная
- Yandex DataSphere— MLофициальная
- Yandex Compute Cloud— Вычисленияофициальная
- Yandex Instance Groups— Масштабированиеофициальная
- Yandex Monitoring— Наблюдаемостьофициальная
- Yandex Cloud Logging— Наблюдаемостьофициальная
- Yandex Audit Trails— Аудитофициальная
- Terraform— Инфраструктура как кодофициальная
Тарифы Yandex Data Processing
У сервиса нет тарифных пакетов: оплата почасовая и складывается из ресурсов виртуальных машин Compute Cloud с наценкой за управляемый сервис, сетевых дисков, сервиса Cloud Logging и исходящего трафика. Цены в рублях и тенге указаны с НДС, в долларах — без НДС; валюта расчётов зависит от юридического лица договора. Первые 100 ГБ исходящего трафика в месяц не тарифицируются, трафик внутри Yandex Cloud и входящий — бесплатны. Прерываемые ВМ снижают стоимость машин до 70%. Данные приведены по правилам тарификации, обновлённым 1 июля 2026 года.
Оплата по потреблению
Популярный- ✓Заявленная вендором минимальная стоимость запуска кластера
- ✓Почасовая тарификация каждой виртуальной машины
- ✓Отдельно оплачиваются диски, логи и исходящий трафик
- ✓Прерываемые ВМ дешевле обычных до 70%
- ✓Первые 100 ГБ исходящего трафика в месяц бесплатны
| Тариф | Цена |
|---|---|
| Оплата по потреблениюTOP | 18 ₽/час |
Обзор Yandex Data Processing
Что такое Yandex Data Processing?
Yandex Data Processing — сервис Yandex Cloud для обработки многотерабайтных массивов данных на инструментах экосистемы Apache: Spark, Hadoop, HBase, Zeppelin и других. Вы выбираете размер кластера, мощность узлов и набор компонентов, а платформа сама создаёт и настраивает кластер.
Сервис раньше назывался Yandex Data Proc (в каталогах встречается написание DataProc) — на сайте вендора это название больше не используется, хотя адрес страницы и имена в API остались прежними.
Ключевые возможности Yandex Data Processing
Кластеры и компоненты
- Компоненты Apache: Spark, HDFS, YARN, HBase, Oozie, Sqoop, Flume, Tez, Zeppelin
- Актуальные образы 2.1 и 2.2 (бета) с разным составом версий
- Окружения PRODUCTION и PRESTABLE — оба под действием SLA
- Работа с форматами Apache Iceberg и Delta Lake
- Zeppelin и другие веб-приложения открываются через UI Proxy
Контроль и настройка
В отличие от полностью закрытых managed-платформ, здесь остаётся root-пользователь на каждой виртуальной машине: можно ставить собственные приложения и библиотеки прямо на работающем кластере, без его перезапуска. В образы входят менеджеры окружений conda и pip с преднастроенным набором Python-библиотек.
Масштабирование и автоматизация
- Автомасштабирование подкластеров обработки данных через Instance Groups
- Метрика по умолчанию — очередь заданий YARN, альтернатива — целевая загрузка vCPU
- Прерываемые виртуальные машины экономят до 70% стоимости ВМ
- В Apache Airflow встроен готовый оператор Yandex Data Processing
- Управление через консоль, CLI, API и Terraform
Сколько это стоит
Абонентской платы нет: тарифицируется каждый час работы виртуальных машин по ценам Compute Cloud плюс наценка за управляемый сервис, к этому добавляются сетевые диски, сервис Cloud Logging и исходящий трафик. Вендор заявляет, что запустить кластер можно от 18 ₽ в час. В документации разобран пример: подкластер класса m2.micro с двумя vCPU, 16 ГБ RAM и диском 20 ГБ обходится в 9,9882 ₽ за час.
Ограничения, о которых стоит знать
Встроенного механизма обновления версии образа у сервиса нет — чтобы перейти на свежую версию, кластер пересоздают. Вендор рекомендует автоматизировать создание и удаление временных кластеров через Managed Service for Apache Airflow. Образы 1.4 и 2.0 переведены в устаревшие: работающие кластеры на них продолжают жить, но новые создать уже нельзя.
Для кого подходит
Сервис ориентирован на дата-инженеров и аналитические команды, которым нужен Spark или Hadoop без содержания собственного кластера. На сайте описаны три опорных сценария: анализ пользовательских событий на Hadoop, потоковая обработка на Spark в связке с Object Storage и ETL-пайплайны с построением витрин данных через Apache Oozie.
Плюсы и минусы Yandex Data Processing
+Преимущества
- ✓Не нужно самостоятельно устанавливать и обновлять Hadoop — вендор берёт на себя настройку сети, ОС и образов
- ✓Root-доступ и установка собственных библиотек прямо на работающем кластере
- ✓Почасовая оплата без абонентской платы: кластер под задачу можно поднять и погасить
- ✓Прерываемые виртуальные машины удешевляют пакетные расчёты до 70%
- ✓Данные и вычисления размещены в российских дата-центрах Yandex Cloud
- ✓Prestable-окружение для обкатки новых версий тоже покрыто SLA
−Недостатки
- ✗Обновить версию образа на работающем кластере нельзя — под новую версию создаётся новый кластер
- ✗Образы 1.4 и 2.0 объявлены устаревшими: новые кластеры на них не создаются
- ✗В бета-образе 2.2 нет Tez и Zeppelin, которые есть в стабильном 2.1
- ✗Итоговый счёт собирается из нескольких сервисов сразу — ВМ, дисков, логов и трафика, поэтому стоимость трудно предсказать заранее
- ✗Автомасштабирование на витрине сервиса помечено как Preview
- ✗Сервис привязан к экосистеме Yandex Cloud и не переносится к другому провайдеру как есть
Сценарии использования Yandex Data Processing
Анализ действий пользователей
Кластер Hadoop разбирает поток пользовательских событий: данные категоризируются, а инструменты аналитики помогают увидеть закономерности и тенденции.
Потоковая обработка данных
Кластер Spark обрабатывает потоки в реальном времени, считает метрики и складывает нужные срезы в Yandex Object Storage — этот сценарий вендор описывает как связку двух сервисов.
ETL и витрины данных
Потоки описываются и обрабатываются через Apache Oozie, витрины и бизнес-метрики строятся автоматически. Для расписаний удобен встроенный оператор Data Processing в Apache Airflow.
Разовые расчёты на прерываемых ВМ
Под пакетную задачу поднимается временный кластер на прерываемых машинах — до 70% дешевле обычных, — а после расчёта удаляется, поскольку почасовая тарификация не требует абонентской платы.
Подготовка данных для машинного обучения
В образы входят conda и pip с готовым набором библиотек (pandas, numpy, scikit-learn, PyArrow), а для запуска и оркестрации заданий вендор предлагает DataSphere и Managed Service for Apache Airflow.
Доверие и масштаб
- 📊Правила тарификации обновлены 1 июля 2026 года, состав образов — 16 марта 2026 года
- 📊Публичная история изменений сервиса ведётся с I квартала 2022 года; год запуска вендор на доступных страницах не называет
- 📊Продукт переименован из Yandex Data Proc в Yandex Data Processing: прежнее название на сайте вендора не встречается, но сохранилось в адресе страницы и в именах ресурсов
- 📊У Yandex Cloud есть публичная страница статуса сервисов, по которой можно сверять доступность
Отзывы о Yandex Data Processing
Обзор помог разобраться в сервисе?
Одно нажатие, без регистрации. Ответ увидят те, кто будет выбирать сервис после вас.
Ваш ответ здесь будет первым.
Поделитесь опытом использования
Помогите другим сделать правильный выбор — ваш отзыв будет полезен
Часто задаваемые вопросы о Yandex Data Processing
?Yandex Data Processing и Yandex DataProc — это один сервис?
Да, это один и тот же продукт: сервис переименован в Yandex Data Processing, и прежнее название на сайте вендора больше не используется. Старое имя сохранилось в адресе страницы сервиса и в именах ресурсов, поэтому в поиске и в чужих обзорах по-прежнему встречаются оба варианта.
?Какие сервисы Apache доступны в Yandex Data Processing?
В ответах на вопросы вендор перечисляет: Spark, HDFS, YARN, HBase, Oozie, Sqoop, Flume, Tez и Zeppelin. Конкретные версии зависят от выбранного образа: в стабильном образе 2.1 это Hadoop 3.3.2, Spark 3.3.2, Tez 0.10.1, Zeppelin 0.10.0 и Livy 0.8.0, а в бета-образе 2.2 — Hadoop 3.3.2, Spark 3.5.0 и Livy 0.8.0, но уже без Tez и Zeppelin.
?Сколько стоит Yandex Data Processing?
Тарифных пакетов нет — оплата почасовая. Счёт складывается из ресурсов виртуальных машин Compute Cloud с наценкой за управляемый сервис, сетевых дисков, сервиса Cloud Logging и исходящего трафика. Вендор заявляет запуск кластера от 18 ₽ в час, а в документации разобран пример: подкластер m2.micro с двумя vCPU, 16 ГБ RAM и диском на 20 ГБ стоит 9,9882 ₽ за час.
?Можно ли сэкономить на вычислениях?
Да, основной способ — прерываемые виртуальные машины: вендор оценивает экономию до 70% от стоимости ВМ. Такие машины могут быть остановлены платформой, поэтому подходят для пакетных расчётов, а не для постоянно работающих сервисов. Дополнительно экономит сама почасовая модель: кластер можно поднимать под задачу и удалять после неё.
?Как обновить версию Spark или Hadoop на кластере?
Обновить образ на работающем кластере нельзя — встроенного механизма для этого в сервисе нет. Чтобы перейти на новую версию, создаётся новый кластер. Если нужно постоянно работать на актуальной версии, вендор советует автоматизировать создание и удаление временных кластеров через Managed Service for Apache Airflow.
?Что даёт автомасштабирование и как оно настраивается?
Автомасштабирование доступно для подкластеров обработки данных и работает через Instance Groups: при превышении порога в подкластер добавляются хосты, при падении нагрузки лишние выводятся из работы и удаляются. По умолчанию используется метрика очереди заданий YARN, альтернативный вариант — целевой уровень загрузки vCPU. На витрине сервиса функция помечена как Preview.
?Чем Data Processing отличается от самостоятельной установки Hadoop?
Вендор берёт на себя создание и изменение кластеров, настройку сети, установку ОС и ПО, обновление образов, интерфейсы запуска заданий, автоматизацию масштабирования и интеграцию с сервисами платформы. За пользователем остаётся разграничение доступа к данным. При этом root-пользователь на каждой машине сохраняется, поэтому свои приложения и библиотеки можно ставить прямо на работающем кластере.
?Оплачивается ли трафик?
Оплачивается только исходящий трафик из Yandex Cloud в интернет, причём первые 100 ГБ каждый месяц не тарифицируются, а минимальная единица тарификации — 1 МБ. Входящий трафик и передача данных между сервисами Yandex Cloud по внутренним адресам бесплатны.
Альтернативы Yandex Data Processing
Открытый движок распределённой обработки данных: пакетные и потоковые конвейеры, SQL-аналитика и машинное обучение выполняются одним инструментом — на ноутбуке или на кластере из тысяч машин. Для дата-инженеров, аналитиков и ML-специалистов.
Российская платформа данных: MPP-СУБД Arenadata DB на Greenplum, колоночная QuickMarts на ClickHouse, гибридная Hyperwave и потоковая Streaming на Kafka. Для корпоративных хранилищ и импортозамещения зарубежных DWH.
Обновлено: 23 июля 2026 г.