Парсинг маркетплейсов: WB и Ozon
Чем маркетплейсы отличаются от обычных сайтов при сборе данных, что доступно через официальные интерфейсы, какие задачи решают продавцы и где проходят границы.
Все статьи гида Парсинг данных · 11
Маркетплейсы - самая частая цель сбора среди российских площадок, и у них есть особенности, из-за которых прямолинейный подход даёт неверные данные.
Чем они отличаются
Персонализация. Цена и выдача зависят от региона, истории просмотров, устройства и наличия подписки. Собранное значение верно для условий сбора и не обязано совпадать с тем, что видит конкретный покупатель.
Динамическое ценообразование. Цены меняются часто, иногда в течение дня. Ежедневный срез может не отражать реальную картину.
Позиция в выдаче не фиксирована. Один и тот же товар по одному запросу стоит на разных местах у разных пользователей. Любое измерение позиции здесь приблизительное, и относиться к нему надо как к оценке.
Серьёзная защита. Площадки такого масштаба вкладываются в защиту от автоматического сбора, и обход её - постоянная гонка, а не разовая настройка.
Правила прямо запрещают автоматический сбор. Это часть пользовательского соглашения, и последствие - блокировка доступа, а для продавца ещё и риски по его аккаунту.
Что доступно официально
Прежде чем строить парсер, стоит посмотреть, не решается ли задача штатно.
У площадок есть интерфейсы для продавцов: собственные товары, заказы, остатки, финансовые отчёты, часть аналитики. Всё, что касается ваших данных, разумнее брать оттуда:
- Данные официальные и полные.
- Не нарушаются правила.
- Не ломается при изменении вёрстки.
- Есть поддержка.
Практический вывод: парсинг для маркетплейсов оправдан там, где официальный интерфейс не даёт данных - в основном это данные конкурентов и общая картина ниши.
Что решают продавцы
Мониторинг цен конкурентов. Самая частая задача - см. парсинг конкурентов.
Отслеживание позиций. Где товар в выдаче по ключевым запросам. С поправкой на то, что величина приблизительная.
Анализ ниши перед запуском. Сколько продавцов, какой разброс цен, как оформлены карточки.
Сбор отзывов. Своих - для работы с качеством, чужих - для понимания претензий к категории.
Контроль своих карточек. Как выглядит карточка на самом деле: не подменилось ли изображение, не пропало ли описание, какая цена показывается покупателю. Это часто оказывается важнее всего остального, потому что продавец видит свою карточку в кабинете, а покупатель - в выдаче, и они различаются.
Технические особенности
Данные часто приходят структурой. Страница обращается к внутренним адресам и получает готовую структуру. Разбирать разметку не нужно - см. гид по парсингу.
Регион обязателен. Без указания региона вы соберёте данные неизвестно какого города. Регион задаётся и адресом выхода, и параметрами запроса - см. гид по прокси.
Объём большой. Категория на десятки тысяч позиций требует очереди, возобновления и разумного темпа.
Структура меняется. Площадки регулярно меняют внутренние форматы. Парсер требует обслуживания - см. стоимость.
Темп имеет значение. Агрессивный сбор приводит к ограничениям быстро.
Для регулярной работы с площадками часть задач удобно решать в Browser Automation Studio: там сбор данных совмещён с авторизацией, прокси и многопоточностью в одном инструменте.
Границы
Три вещи, которые стоит держать в голове:
Правила площадки. Автоматический сбор запрещён. Для продавца это дополнительный риск: претензии могут коснуться и рабочего аккаунта.
Персональные данные. Отзывы содержат имена. Собирать отзывы для анализа претензий - одно, формировать базу авторов - другое, и второе регулируется - см. парсинг контактов.
Содержимое карточек. Фотографии и описания конкурентов - объекты авторского права.
Разумная позиция: брать своё через официальные интерфейсы, чужое - в объёме, необходимом для анализа, и не переносить чужое содержимое к себе.
Как это выглядит на реальных проектах - в портфолио. Обзор - гид по парсингу.
Вопросы и ответы
Есть ли официальный способ получать данные с маркетплейсов?
Да, у площадок есть интерфейсы для продавцов: собственные товары, заказы, остатки, отчёты. Всё, что касается ваших данных, разумнее брать оттуда - это надёжнее и не нарушает правила. Парсинг остаётся для того, что через официальные интерфейсы недоступно.
Зачем продавцы собирают данные с маркетплейсов?
Мониторинг цен конкурентов, отслеживание позиций в выдаче, анализ ниши перед запуском товара, сбор отзывов, контроль собственных карточек. Последнее часто важнее прочего: карточка может выглядеть иначе, чем предполагает продавец.
Почему собранные данные не совпадают с тем, что видит покупатель?
Потому что выдача и цены персонализированы и зависят от региона, истории и устройства. Позиция товара в поиске - вообще не фиксированная величина: она различается у разных пользователей, и любое измерение здесь является приблизительным.
Ещё по теме
- Парсинг данных с сайта: как это устроеноГид
- Парсинг сайтов конкурентов: что можно собирать и зачемКакие данные о конкурентах имеет смысл собирать, как построить регулярный мониторинг, что делать с расхождениями и где проходит граница допустимого.
- Защита от парсинга сайта: что работает, а что нетКакие меры защиты от автоматического сбора действительно работают, какие только мешают пользователям, и как выбрать уровень защиты под свою ситуацию.
- Парсинг сайтов на Python: Playwright, ретраи, дедупликацияКакой стек выбрать под задачу, как писать селекторы, которые переживают правки вёрстки, как устроены ретраи и почему дедупликация нужна с самого начала.
Сделаю под ключ
Соберу парсер под ваш источник
С обходом защиты, прокси и выгрузкой в таблицу, базу или Telegram. Работает по расписанию без вас.
от 300 $ · 3-7 дней
«Очень быстрый парсинг, спасибо большое! Даже получилось чуть больше номеров, всем рекомендую! Делал заказ 2 раза, всё устраивает, буду обращаться ещё.»