Перейти к содержимому
Логотип Yandex Data Processing

Yandex Data Processing

Управляемые кластеры Apache Spark и Hadoop в Yandex Cloud: платформа сама разворачивает и обслуживает узлы, а вы получаете root-доступ и почасовую оплату за фактически использованные ресурсы. Для дата-инженеров и ML-команд.

yandex.cloud

Основная информация

Страна
Россия
Развёртывание
Облако
Интеграции
10+
Языки
Русский, Английский
Поддержка
Техподдержка Yandex Cloud, Документация +1
Стоимость
от 18 ₽
Пробный период
Нет

Технические характеристики

Текущая версия
Актуальные образы 2.1 (стабилен с 2.1.15) и 2.2 в бете; образы 1.4 и 2.0 устарели
Технологический стек
Образ 2.1 — Hadoop 3.3.2, Spark 3.3.2, Tez 0.10.1, Zeppelin 0.10.0, Livy 0.8.0, Python 3.8.13; образ 2.2 — Hadoop 3.3.2, Spark 3.5.0, Livy 0.8.0, Python 3.11.10
Окружения (dev/prod)
PRODUCTION и PRESTABLE, оба под SLA; PRESTABLE получает новые сборки раньше
Масштабирование
Автомасштабирование подкластеров обработки данных по очереди заданий YARN или по целевой загрузке vCPU
Модель оплаты
Почасовая оплата ресурсов Compute Cloud с наценкой за управляемый сервис, без абонентской платы; первые 100 ГБ исходящего трафика в месяц бесплатны, минимальная единица тарификации — 1 МБ
Файловое хранилище
HDFS внутри кластера и Yandex Object Storage для разделения вычислений и хранения
Форматы данных
Apache Iceberg и Delta Lake
Разграничение доступа
Root-пользователь на каждой ВМ кластера, разграничение доступа в Yandex Cloud
Мониторинг
Метрики в Yandex Monitoring, логи в Cloud Logging, аудит в Audit Trails
CLI-инструменты
Консоль управления, CLI, API и Terraform
Модель развёртывания
Полностью облачный управляемый сервис
Локация данных
Дата-центры Yandex Cloud в России; цены указаны для региона Россия
НДС
Цены в рублях и тенге указаны с НДС, в долларах — без НДС
Компоненты платформы
Apache Spark, HDFS, YARN, HBase, Oozie, Sqoop, Flume, Tez, Zeppelin; в образы входят conda и pip с библиотеками PyArrow, pandas, numpy, scikit-learn, Matplotlib и boto3

Безопасность и compliance

Хранение данных
Инфраструктура и данные размещаются в российских дата-центрах Yandex Cloud, оператор — ООО «Яндекс.Облако»

Поддержка и SLA

Приоритет
Доступен на платных тарифах
Каналы поддержки
Техническая поддержка Yandex CloudДокументацияПубличная страница статуса сервисов

Интеграции Yandex Data Processing (10+)

Категории интеграций
Экосистема Yandex CloudОркестрацияНаблюдаемость
Ключевые интеграции
  • Yandex Object StorageХранилищеофициальная
  • Apache AirflowОркестрацияофициальная
  • Yandex Managed Service for Apache AirflowОркестрацияофициальная
  • Yandex DataSphereMLофициальная
  • Yandex Compute CloudВычисленияофициальная
  • Yandex Instance GroupsМасштабированиеофициальная
  • Yandex MonitoringНаблюдаемостьофициальная
  • Yandex Cloud LoggingНаблюдаемостьофициальная
  • Yandex Audit TrailsАудитофициальная
  • TerraformИнфраструктура как кодофициальная

Тарифы Yandex Data Processing

У сервиса нет тарифных пакетов: оплата почасовая и складывается из ресурсов виртуальных машин Compute Cloud с наценкой за управляемый сервис, сетевых дисков, сервиса Cloud Logging и исходящего трафика. Цены в рублях и тенге указаны с НДС, в долларах — без НДС; валюта расчётов зависит от юридического лица договора. Первые 100 ГБ исходящего трафика в месяц не тарифицируются, трафик внутри Yandex Cloud и входящий — бесплатны. Прерываемые ВМ снижают стоимость машин до 70%. Данные приведены по правилам тарификации, обновлённым 1 июля 2026 года.

Оплата по потреблению

Популярный
18 ₽
/час
  • Заявленная вендором минимальная стоимость запуска кластера
  • Почасовая тарификация каждой виртуальной машины
  • Отдельно оплачиваются диски, логи и исходящий трафик
  • Прерываемые ВМ дешевле обычных до 70%
  • Первые 100 ГБ исходящего трафика в месяц бесплатны
Сравнение тарифов Yandex Data Processing
ТарифЦена
Оплата по потреблениюTOP18 ₽/час

Обзор Yandex Data Processing

Что такое Yandex Data Processing?

Yandex Data Processing — сервис Yandex Cloud для обработки многотерабайтных массивов данных на инструментах экосистемы Apache: Spark, Hadoop, HBase, Zeppelin и других. Вы выбираете размер кластера, мощность узлов и набор компонентов, а платформа сама создаёт и настраивает кластер.

Сервис раньше назывался Yandex Data Proc (в каталогах встречается написание DataProc) — на сайте вендора это название больше не используется, хотя адрес страницы и имена в API остались прежними.

Ключевые возможности Yandex Data Processing

Кластеры и компоненты

  • Компоненты Apache: Spark, HDFS, YARN, HBase, Oozie, Sqoop, Flume, Tez, Zeppelin
  • Актуальные образы 2.1 и 2.2 (бета) с разным составом версий
  • Окружения PRODUCTION и PRESTABLE — оба под действием SLA
  • Работа с форматами Apache Iceberg и Delta Lake
  • Zeppelin и другие веб-приложения открываются через UI Proxy

Контроль и настройка

В отличие от полностью закрытых managed-платформ, здесь остаётся root-пользователь на каждой виртуальной машине: можно ставить собственные приложения и библиотеки прямо на работающем кластере, без его перезапуска. В образы входят менеджеры окружений conda и pip с преднастроенным набором Python-библиотек.

Масштабирование и автоматизация

  • Автомасштабирование подкластеров обработки данных через Instance Groups
  • Метрика по умолчанию — очередь заданий YARN, альтернатива — целевая загрузка vCPU
  • Прерываемые виртуальные машины экономят до 70% стоимости ВМ
  • В Apache Airflow встроен готовый оператор Yandex Data Processing
  • Управление через консоль, CLI, API и Terraform

Сколько это стоит

Абонентской платы нет: тарифицируется каждый час работы виртуальных машин по ценам Compute Cloud плюс наценка за управляемый сервис, к этому добавляются сетевые диски, сервис Cloud Logging и исходящий трафик. Вендор заявляет, что запустить кластер можно от 18 ₽ в час. В документации разобран пример: подкластер класса m2.micro с двумя vCPU, 16 ГБ RAM и диском 20 ГБ обходится в 9,9882 ₽ за час.

Ограничения, о которых стоит знать

Встроенного механизма обновления версии образа у сервиса нет — чтобы перейти на свежую версию, кластер пересоздают. Вендор рекомендует автоматизировать создание и удаление временных кластеров через Managed Service for Apache Airflow. Образы 1.4 и 2.0 переведены в устаревшие: работающие кластеры на них продолжают жить, но новые создать уже нельзя.

Для кого подходит

Сервис ориентирован на дата-инженеров и аналитические команды, которым нужен Spark или Hadoop без содержания собственного кластера. На сайте описаны три опорных сценария: анализ пользовательских событий на Hadoop, потоковая обработка на Spark в связке с Object Storage и ETL-пайплайны с построением витрин данных через Apache Oozie.

Плюсы и минусы Yandex Data Processing

+Преимущества

  • Не нужно самостоятельно устанавливать и обновлять Hadoop — вендор берёт на себя настройку сети, ОС и образов
  • Root-доступ и установка собственных библиотек прямо на работающем кластере
  • Почасовая оплата без абонентской платы: кластер под задачу можно поднять и погасить
  • Прерываемые виртуальные машины удешевляют пакетные расчёты до 70%
  • Данные и вычисления размещены в российских дата-центрах Yandex Cloud
  • Prestable-окружение для обкатки новых версий тоже покрыто SLA

Недостатки

  • Обновить версию образа на работающем кластере нельзя — под новую версию создаётся новый кластер
  • Образы 1.4 и 2.0 объявлены устаревшими: новые кластеры на них не создаются
  • В бета-образе 2.2 нет Tez и Zeppelin, которые есть в стабильном 2.1
  • Итоговый счёт собирается из нескольких сервисов сразу — ВМ, дисков, логов и трафика, поэтому стоимость трудно предсказать заранее
  • Автомасштабирование на витрине сервиса помечено как Preview
  • Сервис привязан к экосистеме Yandex Cloud и не переносится к другому провайдеру как есть

Сценарии использования Yandex Data Processing

1

Анализ действий пользователей

Кластер Hadoop разбирает поток пользовательских событий: данные категоризируются, а инструменты аналитики помогают увидеть закономерности и тенденции.

2

Потоковая обработка данных

Кластер Spark обрабатывает потоки в реальном времени, считает метрики и складывает нужные срезы в Yandex Object Storage — этот сценарий вендор описывает как связку двух сервисов.

3

ETL и витрины данных

Потоки описываются и обрабатываются через Apache Oozie, витрины и бизнес-метрики строятся автоматически. Для расписаний удобен встроенный оператор Data Processing в Apache Airflow.

4

Разовые расчёты на прерываемых ВМ

Под пакетную задачу поднимается временный кластер на прерываемых машинах — до 70% дешевле обычных, — а после расчёта удаляется, поскольку почасовая тарификация не требует абонентской платы.

5

Подготовка данных для машинного обучения

В образы входят conda и pip с готовым набором библиотек (pandas, numpy, scikit-learn, PyArrow), а для запуска и оркестрации заданий вендор предлагает DataSphere и Managed Service for Apache Airflow.

Доверие и масштаб

Масштаб провайдера
Сервис входит в платформу Yandex Cloud, оператор — ООО «Яндекс.Облако»
Рыночный контекст
  • 📊Правила тарификации обновлены 1 июля 2026 года, состав образов — 16 марта 2026 года
  • 📊Публичная история изменений сервиса ведётся с I квартала 2022 года; год запуска вендор на доступных страницах не называет
  • 📊Продукт переименован из Yandex Data Proc в Yandex Data Processing: прежнее название на сайте вендора не встречается, но сохранилось в адресе страницы и в именах ресурсов
  • 📊У Yandex Cloud есть публичная страница статуса сервисов, по которой можно сверять доступность

Отзывы о Yandex Data Processing

Обзор помог разобраться в сервисе?

Одно нажатие, без регистрации. Ответ увидят те, кто будет выбирать сервис после вас.

Ваш ответ здесь будет первым.

Поделитесь опытом использования

Помогите другим сделать правильный выбор — ваш отзыв будет полезен

Часто задаваемые вопросы о Yandex Data Processing

?Yandex Data Processing и Yandex DataProc — это один сервис?

Да, это один и тот же продукт: сервис переименован в Yandex Data Processing, и прежнее название на сайте вендора больше не используется. Старое имя сохранилось в адресе страницы сервиса и в именах ресурсов, поэтому в поиске и в чужих обзорах по-прежнему встречаются оба варианта.

?Какие сервисы Apache доступны в Yandex Data Processing?

В ответах на вопросы вендор перечисляет: Spark, HDFS, YARN, HBase, Oozie, Sqoop, Flume, Tez и Zeppelin. Конкретные версии зависят от выбранного образа: в стабильном образе 2.1 это Hadoop 3.3.2, Spark 3.3.2, Tez 0.10.1, Zeppelin 0.10.0 и Livy 0.8.0, а в бета-образе 2.2 — Hadoop 3.3.2, Spark 3.5.0 и Livy 0.8.0, но уже без Tez и Zeppelin.

?Сколько стоит Yandex Data Processing?

Тарифных пакетов нет — оплата почасовая. Счёт складывается из ресурсов виртуальных машин Compute Cloud с наценкой за управляемый сервис, сетевых дисков, сервиса Cloud Logging и исходящего трафика. Вендор заявляет запуск кластера от 18 ₽ в час, а в документации разобран пример: подкластер m2.micro с двумя vCPU, 16 ГБ RAM и диском на 20 ГБ стоит 9,9882 ₽ за час.

?Можно ли сэкономить на вычислениях?

Да, основной способ — прерываемые виртуальные машины: вендор оценивает экономию до 70% от стоимости ВМ. Такие машины могут быть остановлены платформой, поэтому подходят для пакетных расчётов, а не для постоянно работающих сервисов. Дополнительно экономит сама почасовая модель: кластер можно поднимать под задачу и удалять после неё.

?Как обновить версию Spark или Hadoop на кластере?

Обновить образ на работающем кластере нельзя — встроенного механизма для этого в сервисе нет. Чтобы перейти на новую версию, создаётся новый кластер. Если нужно постоянно работать на актуальной версии, вендор советует автоматизировать создание и удаление временных кластеров через Managed Service for Apache Airflow.

?Что даёт автомасштабирование и как оно настраивается?

Автомасштабирование доступно для подкластеров обработки данных и работает через Instance Groups: при превышении порога в подкластер добавляются хосты, при падении нагрузки лишние выводятся из работы и удаляются. По умолчанию используется метрика очереди заданий YARN, альтернативный вариант — целевой уровень загрузки vCPU. На витрине сервиса функция помечена как Preview.

?Чем Data Processing отличается от самостоятельной установки Hadoop?

Вендор берёт на себя создание и изменение кластеров, настройку сети, установку ОС и ПО, обновление образов, интерфейсы запуска заданий, автоматизацию масштабирования и интеграцию с сервисами платформы. За пользователем остаётся разграничение доступа к данным. При этом root-пользователь на каждой машине сохраняется, поэтому свои приложения и библиотеки можно ставить прямо на работающем кластере.

?Оплачивается ли трафик?

Оплачивается только исходящий трафик из Yandex Cloud в интернет, причём первые 100 ГБ каждый месяц не тарифицируются, а минимальная единица тарификации — 1 МБ. Входящий трафик и передача данных между сервисами Yandex Cloud по внутренним адресам бесплатны.

Обновлено: 23 июля 2026 г.