Перейти к содержимому
Логотип Scrapy

Scrapy

Бесплатный тариф

Открытый фреймворк веб-скрейпинга на Python: асинхронный движок, CSS- и XPath-селекторы, конвейеры обработки и экспорт данных прямо в ядре. Для разработчиков, которым нужен управляемый кодом сбор публичных данных в продакшене.

scrapy.org

Основная информация

Страна
Open-source
Развёртывание
Локально / Облако
Языки
Английский
Поддержка
Документация, Discord +2
Стоимость
Бесплатно
Пробный период
Бесплатный тариф

Технические характеристики

Open-source
Да, исходный код открыт на GitHub
Лицензия
BSD-3-Clause
Последняя версия
2.17.0 от 7 июля 2026 года
Требования
Python 3.10 и новее, заявлена поддержка вплоть до 3.14
Технологический стек
Python, асинхронный сетевой движок Twisted
Селекторы
CSS и XPath со смешиванием, значениями по умолчанию и регулярными выражениями
Рендеринг JavaScript
В ядре отсутствует, подключается расширением scrapy-playwright
Форматы экспорта
JSON, CSV и другие форматы, выгрузка в S3
CLI-инструменты
scrapy startproject, scrapy crawl, интерактивная оболочка scrapy shell
Архитектура
Каркас проекта: пауки, модели данных, конвейеры обработки, middleware, сигналы и расширения
Варианты развёртывания
Scrapyd на своём сервере, scrapyd-client, Docker, облако Scrapy Cloud
Репозиторий
github.com/scrapy/scrapy

Поддержка и SLA

Каналы поддержки
ДокументацияDiscordGitHub DiscussionsReddit

Интеграции Scrapy

Категории интеграций
Браузерный рендерингМониторинг и оповещенияОбход банов и проксиPage objectsРазвёртывание
Ключевые интеграции
  • scrapy-playwrightБраузерный рендерингофициальная
  • spidermonМониторинг и оповещенияофициальная
  • scrapy-zyte-apiОбход банов и проксиофициальная
  • scrapy-poetPage objectsофициальная
  • ScrapydРазвёртываниеофициальная

Тарифы Scrapy

Сам фреймворк бесплатен и распространяется по лицензии BSD-3-Clause — плата не взимается ни в каком виде, коммерческое использование разрешено. Затраты возникают только на вашей стороне: серверы под запуск пауков и работа разработчиков. Платные продукты вокруг Scrapy — облачная платформа Scrapy Cloud и Zyte API — принадлежат компании Zyte, тарифицируются отдельно и к самому проекту отношения не имеют.

Open Source (BSD-3-Clause)

Без ограничений

Бесплатно
  • Полный функционал фреймворка без ограничений
  • Селекторы CSS и XPath, конвейеры и middleware
  • Экспорт в JSON, CSV и выгрузка в S3
  • Установка из PyPI командой pip или uv
  • Исходный код на GitHub, более 500 контрибьюторов
  • Коммерческое использование разрешено лицензией
Сравнение тарифов Scrapy
ТарифЦена
Open Source (BSD-3-Clause)Бесплатно

Обзор Scrapy

Что такое Scrapy?

Scrapy — открытый фреймворк веб-скрейпинга и краулинга на Python, предназначенный для систематического сбора публичных данных с сайтов. Проект развивает компания Zyte вместе с более чем пятьюстами контрибьюторами, а исходный код распространяется по лицензии BSD-3-Clause: коммерческое использование разрешено без отдельных условий.

Ключевая идея — каркас проекта вместо одноразового скрипта. Команда scrapy startproject раскладывает по местам пауков, настройки, модели данных и конвейеры обработки, а scrapy crawl запускает сбор. Когда краулер разрастается, структура остаётся управляемой.

Что входит в ядро

  • Селекторы CSS и XPath, которые можно свободно смешивать, с значениями по умолчанию и регулярными выражениями прямо из селектора
  • Асинхронный движок с аккуратным ограничением скорости запросов
  • Конвейеры обработки: валидация, очистка и сохранение каждого элемента
  • Выгрузка результатов в JSON, CSV и другие форматы, включая отправку в S3
  • Интерактивная оболочка для проверки селекторов до написания кода
  • Точки расширения — middleware, сигналы и собственные расширения

Экосистема расширений

Ядро намеренно оставлено компактным, а недостающее добавляется отдельными пакетами — ставить их нужно только тогда, когда задача действительно возникла.

  • scrapy-playwright — рендеринг страниц реальным браузером для сайтов, отдающих пустую HTML-оболочку
  • spidermon — мониторинг, валидация и оповещения в Slack, Discord или на почту
  • scrapy-zyte-api — автоматическая ротация прокси и обход банов через сервис Zyte
  • scrapy-poet — разделение логики извлечения и логики обхода через page objects

Запуск в продакшене

Пауков разворачивают на своём сервере через открытый Scrapyd с управлением по JSON API, упаковывают в Docker-контейнер или отправляют в облако Scrapy Cloud. Последнее — платформа компании Zyte, отдельный коммерческий продукт со своими тарифами; сам фреймворк её не требует.

Разработка и поддержка

Релизы выходят регулярно: версия 2.15.0 в апреле 2026 года принесла экспериментальный режим без реактора и обработчик загрузок на httpx, 2.16.0 в мае — официальную поддержку Python 3.14, а 2.17.0 в июле — HTTP/2, SOCKS-прокси и настройки версий TLS. Вопросы разбирают в Discord, GitHub Discussions и на профильном сабреддите.

Кому подходит

Инструмент рассчитан на тех, кто пишет на Python и собирает данные постоянно: дата-инженеров, аналитиков, команды агрегаторов и агентства веб-скрейпинга. Порог входа выше, чем у визуальных парсеров, зато поведение краулера полностью управляется кодом и версионируется вместе с проектом.

Плюсы и минусы Scrapy

+Преимущества

  • Бесплатен и открыт по лицензии BSD-3-Clause, коммерческое использование разрешено без дополнительных условий
  • Раскладывает краулер в структуру проекта, а не в одноразовый скрипт: пауки, настройки, модели и конвейеры лежат по местам
  • Развивается непрерывно — только с апреля по июль 2026 года вышли версии 2.15.0, 2.16.0 и 2.17.0
  • Ядро остаётся компактным, а браузерный рендеринг, мониторинг и обход банов подключаются расширениями по необходимости
  • Разворачивается где угодно: свой сервер через Scrapyd, Docker-контейнер или облако
  • Ресурсы проекта открываются из России без VPN — проверено с российского IP 31 июля 2026 года

Недостатки

  • Требует Python: без навыков программирования запустить сбор не получится, нужен интерпретатор 3.10 или новее
  • В ядре нет рендеринга JavaScript — динамические страницы работают только через расширение scrapy-playwright
  • Нет графического интерфейса и встроенного планировщика запусков: и то и другое добавляется отдельными инструментами
  • Документация, сайт и сообщество только на английском языке
  • Гарантированной поддержки у проекта нет — договоры сопровождения предлагают сторонние компании за отдельные деньги
  • Инфраструктуру под запуск пауков и её стоимость вы берёте на себя

Сценарии использования Scrapy

1

Краулер, который растёт вместе с задачей

Фреймворк разворачивает полноценный проект, а не одноразовый скрипт: пауки, настройки, модели данных и конвейеры разложены по отдельным модулям. Когда источников становится больше, структура остаётся читаемой.

2

Сбор данных для конвейеров и аналитики

Извлечённые элементы проходят через конвейеры валидации и очистки, а затем выгружаются в JSON, CSV или в S3. Дальше их подхватывают хранилища и системы аналитики.

3

Сайты, отдающие пустую HTML-оболочку

Когда содержимое страницы рисует JavaScript, обычный запрос видит только каркас. Расширение scrapy-playwright запускает настоящий браузер и возвращает готовую разметку, сохраняя привычную схему запросов и ответов.

4

Контроль пауков в продакшене

Сломанный селектор или редизайн сайта неделями отдают пустые данные молча. Расширение spidermon добавляет мониторинг и оповещения в Slack, Discord или на почту, чтобы поломка обнаружилась сразу.

5

Работа с площадками, которые блокируют сбор

Ручная ротация прокси и логика повторов съедают время разработки. Расширение scrapy-zyte-api подключает управляемый сервис с автоматической ротацией адресов и обходом банов.

6

Генерация пауков ИИ-агентом

Набор Agent Skills от Zyte по адресу страницы и описанию задачи на обычном языке находит поля, согласовывает схему, поднимает проект и генерирует паука с тестами. Работает в Claude Code, GitHub Copilot и других агентах.

Доверие и масштаб

Точный год основания в открытых источниках проекта не зафиксирован: сайт заявляет непрерывную разработку «более 15 лет», в списке изменений первым релизом названа версия 0.7 без даты, самый ранний пакет на PyPI загружен в декабре 2009 года, а репозиторий на GitHub создан 22 февраля 2010 года. Поэтому год основания в карточке не проставлен. Договоры поддержки и заказную разработку краулеров на Scrapy официально предлагают Zyte, Arbisoft, Web Scraping Solutions и ScrapeOps — список опубликован на сайте проекта.
Аудитория
63 514 звёзд, 11 825 форков и 1 756 подписчиков репозитория на GitHub — снимок 31 июля 2026 года
Масштаб провайдера
Разработку ведёт компания Zyte, в проекте более 500 контрибьюторов

Отзывы о Scrapy

Обзор помог разобраться в сервисе?

Одно нажатие, без регистрации. Ответ увидят те, кто будет выбирать сервис после вас.

Ваш ответ здесь будет первым.

Поделитесь опытом использования

Помогите другим сделать правильный выбор — ваш отзыв будет полезен

Без почты и пароля · обычно публикуем в течение 1–2 дней

Отзывы — мнения посетителей, прошедшие проверку по правилам сайта; порядок определяется отметками «полезно».

Часто задаваемые вопросы о Scrapy

?Scrapy бесплатный?

Да, фреймворк распространяется по лицензии BSD-3-Clause и не стоит ничего: ни подписки, ни лимитов, ни ограничений на коммерческое использование. Пакет ставится из PyPI командой pip или uv, исходный код лежит на GitHub. Платить придётся только за собственные серверы, на которых будут работать пауки.

?Чем Scrapy отличается от Scrapy Cloud?

Это разные продукты. Scrapy — открытый фреймворк, который вы запускаете у себя. Scrapy Cloud — облачная платформа компании Zyte для размещения и мониторинга пауков: у неё бесплатный стартовый план с одним параллельным запуском и часом времени сбора, а платный уровень начинается от 9 долларов за юнит в месяц, где юнит равен 1 ГБ памяти и одному параллельному запуску. Фреймворк работает и без неё.

?Нужно ли знать Python и какая версия требуется?

Да, это Python-фреймворк, и без навыков программирования запустить сбор не получится. Актуальная версия 2.17.0 требует Python 3.10 или новее; в классификаторах пакета заявлена поддержка вплоть до 3.14, официально добавленная в релизе 2.16.0.

?Умеет ли Scrapy собирать данные с сайтов на JavaScript?

В ядре рендеринга нет: обычный запрос получает исходный HTML без выполнения скриптов, поэтому на динамических страницах данных не будет. Задача решается расширением scrapy-playwright — оно запускает настоящий браузер, отдаёт готовую разметку и сохраняет привычную схему запросов и ответов.

?Чем фреймворк лучше обычного скрипта для сбора данных?

Scrapy разворачивает структуру проекта, а не один файл: пауки, настройки, модели извлекаемых данных и конвейеры обработки лежат в отдельных модулях. Проект создаётся командой scrapy startproject и запускается через scrapy crawl. Когда источников становится больше, такой краулер остаётся управляемым, а логика извлечения не смешивается с логикой обхода.

?Где запускать пауков в продакшене?

Вариантов три. Scrapyd — открытое приложение для запуска пауков на своём сервере с управлением через JSON API, проекты в него отправляет утилита scrapyd-client. Docker подходит для воспроизводимых запусков где угодно, от одноплатного компьютера до кластера Kubernetes. Третий путь — облако Scrapy Cloud, где инфраструктуру берёт на себя Zyte.

?Проект живой или заброшен?

Живой. За четыре месяца 2026 года вышло три релиза: 2.15.0 в апреле с экспериментальным режимом без реактора и обработчиком загрузок на httpx, 2.16.0 в мае с поддержкой Python 3.14, 2.17.0 в июле с HTTP/2, SOCKS-прокси и настройками версий TLS. Разработку ведёт Zyte, в проекте больше 500 контрибьюторов, на GitHub около 63,5 тысяч звёзд.

?Можно ли генерировать пауков с помощью ИИ?

Да, у проекта есть набор Agent Skills от Zyte. Вы даёте адрес страницы и описываете нужные данные обычным языком, инструмент разбирает страницу, предлагает схему полей на утверждение, поднимает проект с зависимостями и генерирует page objects и паука вместе с тестами. Набор ставится в Claude Code, GitHub Copilot и другие агенты; отдельно есть расширение для VS Code.

Обновлено: 31 июля 2026 г.