Перейти к содержимому

Big Data: 4 платформы обработки больших данных

Платформы обработки больших данных: Apache Spark, Apache Hadoop, Arenadata DB, Arenadata Hadoop, Yandex DataProc, SberTech. Распределённая обработка петабайтов, MapReduce, Spark SQL, ML на big data.

Найдено сервисов: 4
Apache Spark — логотип

Apache Spark

Бесплатный

Открытый движок распределённой обработки данных: пакетные и потоковые конвейеры, SQL-аналитика и машинное обучение выполняются одним инструментом — на ноутбуке или на кластере из тысяч машин. Для дата-инженеров, аналитиков и ML-специалистов.

Бесплатно
Локально / ОблакоOpen-source
Единый движок для пакетной и потоковой обработкиAPI на Python, SQL, Scala, Java и RSpark SQL с поддержкой стандартного ANSI SQLAdaptive Query Execution — план запроса меняется на летуОптимизатор Catalyst с генерацией кода при выполнении+8
Подробнее
Arenadata — логотип

Российская платформа данных: MPP-СУБД Arenadata DB на Greenplum, колоночная QuickMarts на ClickHouse, гибридная Hyperwave и потоковая Streaming на Kafka. Для корпоративных хранилищ и импортозамещения зарубежных DWH.

По запросу
On-premiseОблакоГибридРоссия
Arenadata DB — аналитическая MPP-СУБД на базе GreenplumArenadata Hyperwave (ADH) — гибридная платформа для данных любой структурыArenadata QuickMarts — колоночная кластерная СУБД на базе ClickHouseArenadata Prosperity — коммерческий дистрибутив PostgreSQL с Enterprise-функционаломArenadata Streaming — Apache Kafka и Apache NiFi для потоковой обработки+7
Подробнее
Data Sapience — логотип

Российский вендор аналитических платформ для среднего и крупного бизнеса: целевой маркетинг, управление рисками и комплаенс, машинное обучение, Lakehouse и управление данными. Для банков, телекома, ритейла и производства, в том числе в задачах импортозамещения.

от 2 500 000 ₽/год
Россия
CM Ocean — платформа целевого маркетинга (11 модулей)TALYS Ocean — управление кредитными и комплаенс-рисками (6 модулей)Kolmogorov — продвинутая аналитика, ML и математическая оптимизация (5 модулей)Data Ocean — Lakehouse-платформа для больших данныхData Ocean Governance — управление метаданными, мастер-данными и качеством данных+7
Подробнее
Yandex Data Processing — логотип

Управляемые кластеры Apache Spark и Hadoop в Yandex Cloud: платформа сама разворачивает и обслуживает узлы, а вы получаете root-доступ и почасовую оплату за фактически использованные ресурсы. Для дата-инженеров и ML-команд.

от 18 ₽/час
ОблакоРоссия10+ интеграций
Управляемые кластеры Apache Spark и HadoopКомпоненты HDFS, YARN, HBase, Oozie, Sqoop, Flume, TezZeppelin-ноутбуки через UI ProxyRoot-доступ на каждой виртуальной машине кластераУстановка своих библиотек без перезапуска кластера+7
Подробнее

Сравнение сервисов Платформы обработки больших данных (Big Data)

Мин. цена
По запросу
Бесплатная версия
Развёртывание
On-premise / Облако / Гибрид
Мин. цена
Бесплатно
Бесплатная версия
Есть
Развёртывание
Локально / Облако
Мин. цена
от 2 500 000 ₽/год
Бесплатная версия
Мин. цена
от 18 ₽/час
Бесплатная версия
Развёртывание
Облако
Интеграции
10+

Часто задаваемые вопросы

Apache Spark или Hadoop?
Spark — современная замена Hadoop MapReduce: в 10-100 раз быстрее за счёт in-memory обработки, проще API (Python, Scala, SQL), встроенный ML (MLlib), потоковая обработка (Structured Streaming). Hadoop HDFS остаётся актуальным для хранения, но вычислительный слой MapReduce заменён на Spark. Новые проекты — сразу Spark.
Что такое Arenadata?
Российская big data платформа в реестре отечественного ПО. Включает: Arenadata DB (MPP-СУБД на базе Greenplum), Arenadata Hadoop (дистрибутив Hadoop), Arenadata Streaming (платформа на Kafka), Arenadata Catalog (data governance). Используется крупными российскими банками, ритейлом, телекомами для импортозамещения западных решений.
Yandex DataProc — что это?
Управляемый сервис Apache Spark и Hadoop от Яндекс.Облако. Развёртывает кластеры за минуты, автоматически масштабирует, оплата за часы использования. Интеграция с Yandex Object Storage, Yandex Query, Yandex DataLens. Альтернатива AWS EMR или Google Dataproc для российских компаний.
Сколько стоит big data?
Open source (Spark, Hadoop) — бесплатны, платите только за инфраструктуру. Cloud managed (Yandex DataProc, AWS EMR) — почасовая оплата за узлы кластера. Enterprise-дистрибутивы (Arenadata, Cloudera) — годовая лицензия плюс инфраструктура. Для старта — Spark + собственный VPS-кластер, для production — managed cloud. Актуальные тарифы — в карточках сервисов ниже.
Зачем нужна big data платформа?
Для анализа данных, которые не помещаются в одну машину: логи, транзакции, события IoT, научные данные, web crawling. Классические СУБД не справляются с петабайтами. Big data платформы параллелят обработку по кластеру из десятков-тысяч узлов. Используются крупными банками, ритейлом, телеком-операторами, R&D-командами.

Платформы обработки больших данных 2026

Apache Spark, Apache Hadoop, Arenadata DB, Arenadata Hadoop, Yandex DataProc, SberTech — платформы обработки больших данных. Распределённая обработка петабайт, MapReduce, Spark SQL, машинное обучение, потоковая обработка. Spark — современный стандарт. Arenadata — российская платформа в реестре отечественного ПО. Yandex DataProc — managed cloud от Яндекса.

Каталог обновлён: июль 2026