
Scrapy
Открытый фреймворк веб-скрейпинга на Python: асинхронный движок, CSS- и XPath-селекторы, конвейеры обработки и экспорт данных прямо в ядре. Для разработчиков, которым нужен управляемый кодом сбор публичных данных в продакшене.
Основная информация
Технические характеристики
- Open-source
- Да, исходный код открыт на GitHub
- Лицензия
- BSD-3-Clause
- Последняя версия
- 2.17.0 от 7 июля 2026 года
- Требования
- Python 3.10 и новее, заявлена поддержка вплоть до 3.14
- Технологический стек
- Python, асинхронный сетевой движок Twisted
- Селекторы
- CSS и XPath со смешиванием, значениями по умолчанию и регулярными выражениями
- Рендеринг JavaScript
- В ядре отсутствует, подключается расширением scrapy-playwright
- Форматы экспорта
- JSON, CSV и другие форматы, выгрузка в S3
- CLI-инструменты
- scrapy startproject, scrapy crawl, интерактивная оболочка scrapy shell
- Архитектура
- Каркас проекта: пауки, модели данных, конвейеры обработки, middleware, сигналы и расширения
- Варианты развёртывания
- Scrapyd на своём сервере, scrapyd-client, Docker, облако Scrapy Cloud
- Репозиторий
- github.com/scrapy/scrapy
Поддержка и SLA
Интеграции Scrapy
- scrapy-playwright— Браузерный рендерингофициальная
- spidermon— Мониторинг и оповещенияофициальная
- scrapy-zyte-api— Обход банов и проксиофициальная
- scrapy-poet— Page objectsофициальная
- Scrapyd— Развёртываниеофициальная
Тарифы Scrapy
Сам фреймворк бесплатен и распространяется по лицензии BSD-3-Clause — плата не взимается ни в каком виде, коммерческое использование разрешено. Затраты возникают только на вашей стороне: серверы под запуск пауков и работа разработчиков. Платные продукты вокруг Scrapy — облачная платформа Scrapy Cloud и Zyte API — принадлежат компании Zyte, тарифицируются отдельно и к самому проекту отношения не имеют.
Open Source (BSD-3-Clause)
Без ограничений
- ✓Полный функционал фреймворка без ограничений
- ✓Селекторы CSS и XPath, конвейеры и middleware
- ✓Экспорт в JSON, CSV и выгрузка в S3
- ✓Установка из PyPI командой pip или uv
- ✓Исходный код на GitHub, более 500 контрибьюторов
- ✓Коммерческое использование разрешено лицензией
| Тариф | Цена |
|---|---|
| Open Source (BSD-3-Clause) | Бесплатно |
Обзор Scrapy
Что такое Scrapy?
Scrapy — открытый фреймворк веб-скрейпинга и краулинга на Python, предназначенный для систематического сбора публичных данных с сайтов. Проект развивает компания Zyte вместе с более чем пятьюстами контрибьюторами, а исходный код распространяется по лицензии BSD-3-Clause: коммерческое использование разрешено без отдельных условий.
Ключевая идея — каркас проекта вместо одноразового скрипта. Команда scrapy startproject раскладывает по местам пауков, настройки, модели данных и конвейеры обработки, а scrapy crawl запускает сбор. Когда краулер разрастается, структура остаётся управляемой.
Что входит в ядро
- Селекторы CSS и XPath, которые можно свободно смешивать, с значениями по умолчанию и регулярными выражениями прямо из селектора
- Асинхронный движок с аккуратным ограничением скорости запросов
- Конвейеры обработки: валидация, очистка и сохранение каждого элемента
- Выгрузка результатов в JSON, CSV и другие форматы, включая отправку в S3
- Интерактивная оболочка для проверки селекторов до написания кода
- Точки расширения — middleware, сигналы и собственные расширения
Экосистема расширений
Ядро намеренно оставлено компактным, а недостающее добавляется отдельными пакетами — ставить их нужно только тогда, когда задача действительно возникла.
- scrapy-playwright — рендеринг страниц реальным браузером для сайтов, отдающих пустую HTML-оболочку
- spidermon — мониторинг, валидация и оповещения в Slack, Discord или на почту
- scrapy-zyte-api — автоматическая ротация прокси и обход банов через сервис Zyte
- scrapy-poet — разделение логики извлечения и логики обхода через page objects
Запуск в продакшене
Пауков разворачивают на своём сервере через открытый Scrapyd с управлением по JSON API, упаковывают в Docker-контейнер или отправляют в облако Scrapy Cloud. Последнее — платформа компании Zyte, отдельный коммерческий продукт со своими тарифами; сам фреймворк её не требует.
Разработка и поддержка
Релизы выходят регулярно: версия 2.15.0 в апреле 2026 года принесла экспериментальный режим без реактора и обработчик загрузок на httpx, 2.16.0 в мае — официальную поддержку Python 3.14, а 2.17.0 в июле — HTTP/2, SOCKS-прокси и настройки версий TLS. Вопросы разбирают в Discord, GitHub Discussions и на профильном сабреддите.
Кому подходит
Инструмент рассчитан на тех, кто пишет на Python и собирает данные постоянно: дата-инженеров, аналитиков, команды агрегаторов и агентства веб-скрейпинга. Порог входа выше, чем у визуальных парсеров, зато поведение краулера полностью управляется кодом и версионируется вместе с проектом.
Плюсы и минусы Scrapy
+Преимущества
- ✓Бесплатен и открыт по лицензии BSD-3-Clause, коммерческое использование разрешено без дополнительных условий
- ✓Раскладывает краулер в структуру проекта, а не в одноразовый скрипт: пауки, настройки, модели и конвейеры лежат по местам
- ✓Развивается непрерывно — только с апреля по июль 2026 года вышли версии 2.15.0, 2.16.0 и 2.17.0
- ✓Ядро остаётся компактным, а браузерный рендеринг, мониторинг и обход банов подключаются расширениями по необходимости
- ✓Разворачивается где угодно: свой сервер через Scrapyd, Docker-контейнер или облако
- ✓Ресурсы проекта открываются из России без VPN — проверено с российского IP 31 июля 2026 года
−Недостатки
- ✗Требует Python: без навыков программирования запустить сбор не получится, нужен интерпретатор 3.10 или новее
- ✗В ядре нет рендеринга JavaScript — динамические страницы работают только через расширение scrapy-playwright
- ✗Нет графического интерфейса и встроенного планировщика запусков: и то и другое добавляется отдельными инструментами
- ✗Документация, сайт и сообщество только на английском языке
- ✗Гарантированной поддержки у проекта нет — договоры сопровождения предлагают сторонние компании за отдельные деньги
- ✗Инфраструктуру под запуск пауков и её стоимость вы берёте на себя
Сценарии использования Scrapy
Краулер, который растёт вместе с задачей
Фреймворк разворачивает полноценный проект, а не одноразовый скрипт: пауки, настройки, модели данных и конвейеры разложены по отдельным модулям. Когда источников становится больше, структура остаётся читаемой.
Сбор данных для конвейеров и аналитики
Извлечённые элементы проходят через конвейеры валидации и очистки, а затем выгружаются в JSON, CSV или в S3. Дальше их подхватывают хранилища и системы аналитики.
Сайты, отдающие пустую HTML-оболочку
Когда содержимое страницы рисует JavaScript, обычный запрос видит только каркас. Расширение scrapy-playwright запускает настоящий браузер и возвращает готовую разметку, сохраняя привычную схему запросов и ответов.
Контроль пауков в продакшене
Сломанный селектор или редизайн сайта неделями отдают пустые данные молча. Расширение spidermon добавляет мониторинг и оповещения в Slack, Discord или на почту, чтобы поломка обнаружилась сразу.
Работа с площадками, которые блокируют сбор
Ручная ротация прокси и логика повторов съедают время разработки. Расширение scrapy-zyte-api подключает управляемый сервис с автоматической ротацией адресов и обходом банов.
Генерация пауков ИИ-агентом
Набор Agent Skills от Zyte по адресу страницы и описанию задачи на обычном языке находит поля, согласовывает схему, поднимает проект и генерирует паука с тестами. Работает в Claude Code, GitHub Copilot и других агентах.
Доверие и масштаб
Отзывы о Scrapy
Обзор помог разобраться в сервисе?
Одно нажатие, без регистрации. Ответ увидят те, кто будет выбирать сервис после вас.
Ваш ответ здесь будет первым.
Поделитесь опытом использования
Помогите другим сделать правильный выбор — ваш отзыв будет полезен
Без почты и пароля · обычно публикуем в течение 1–2 дней
Отзывы — мнения посетителей, прошедшие проверку по правилам сайта; порядок определяется отметками «полезно».
Часто задаваемые вопросы о Scrapy
?Scrapy бесплатный?
Да, фреймворк распространяется по лицензии BSD-3-Clause и не стоит ничего: ни подписки, ни лимитов, ни ограничений на коммерческое использование. Пакет ставится из PyPI командой pip или uv, исходный код лежит на GitHub. Платить придётся только за собственные серверы, на которых будут работать пауки.
?Чем Scrapy отличается от Scrapy Cloud?
Это разные продукты. Scrapy — открытый фреймворк, который вы запускаете у себя. Scrapy Cloud — облачная платформа компании Zyte для размещения и мониторинга пауков: у неё бесплатный стартовый план с одним параллельным запуском и часом времени сбора, а платный уровень начинается от 9 долларов за юнит в месяц, где юнит равен 1 ГБ памяти и одному параллельному запуску. Фреймворк работает и без неё.
?Нужно ли знать Python и какая версия требуется?
Да, это Python-фреймворк, и без навыков программирования запустить сбор не получится. Актуальная версия 2.17.0 требует Python 3.10 или новее; в классификаторах пакета заявлена поддержка вплоть до 3.14, официально добавленная в релизе 2.16.0.
?Умеет ли Scrapy собирать данные с сайтов на JavaScript?
В ядре рендеринга нет: обычный запрос получает исходный HTML без выполнения скриптов, поэтому на динамических страницах данных не будет. Задача решается расширением scrapy-playwright — оно запускает настоящий браузер, отдаёт готовую разметку и сохраняет привычную схему запросов и ответов.
?Чем фреймворк лучше обычного скрипта для сбора данных?
Scrapy разворачивает структуру проекта, а не один файл: пауки, настройки, модели извлекаемых данных и конвейеры обработки лежат в отдельных модулях. Проект создаётся командой scrapy startproject и запускается через scrapy crawl. Когда источников становится больше, такой краулер остаётся управляемым, а логика извлечения не смешивается с логикой обхода.
?Где запускать пауков в продакшене?
Вариантов три. Scrapyd — открытое приложение для запуска пауков на своём сервере с управлением через JSON API, проекты в него отправляет утилита scrapyd-client. Docker подходит для воспроизводимых запусков где угодно, от одноплатного компьютера до кластера Kubernetes. Третий путь — облако Scrapy Cloud, где инфраструктуру берёт на себя Zyte.
?Проект живой или заброшен?
Живой. За четыре месяца 2026 года вышло три релиза: 2.15.0 в апреле с экспериментальным режимом без реактора и обработчиком загрузок на httpx, 2.16.0 в мае с поддержкой Python 3.14, 2.17.0 в июле с HTTP/2, SOCKS-прокси и настройками версий TLS. Разработку ведёт Zyte, в проекте больше 500 контрибьюторов, на GitHub около 63,5 тысяч звёзд.
?Можно ли генерировать пауков с помощью ИИ?
Да, у проекта есть набор Agent Skills от Zyte. Вы даёте адрес страницы и описываете нужные данные обычным языком, инструмент разбирает страницу, предлагает схему полей на утверждение, поднимает проект с зависимостями и генерирует page objects и паука вместе с тестами. Набор ставится в Claude Code, GitHub Copilot и другие агенты; отдельно есть расширение для VS Code.
Альтернативы Scrapy
Визуальный веб-скрейпер американской Octopus Data Inc.: задачи собираются мышкой или автоопределением на базе ИИ, а запускать их можно локально на своём компьютере либо в облаке провайдера. Есть готовые шаблоны под популярные сайты и управляемый сервис, если строить парсер самому не хочется.
Многопоточный парсер поисковой выдачи, карт, маркетплейсов и соцсетей: ставится на свой компьютер или сервер, управляется через веб-интерфейс. Свои парсеры пишутся без кода или на JavaScript. Для SEO-специалистов, маркетологов и разработчиков.
Онлайн-парсер товаров и цен: вставляете ссылку на каталог, перечисляете нужные поля через запятую — ИИ находит их на странице, результат выгружается в Excel, CSV или JSON. Для e-commerce, аналитиков и маркетологов.
Обновлено: 31 июля 2026 г.