← Назад к портфолио

03 / Case Study

Hotel Bookings

Прогнозирование отмен бронирований

ML-пайплайн для прогнозирования вероятности отмены бронирования с использованием табличных и текстовых признаков.

CatBoost XGBoost LightGBM TF-IDF SHAP Optuna
system running slowly
Bookings 30 733
Features 526
IR · TEST 214.5M ₽
01

О проекте

Модель прогнозирует вероятность отмены бронирования по характеристикам брони и текстовой информации.

Основная бизнес-цель — заранее выявлять рискованные бронирования и оценивать потенциальный revenue uplift.

02

Данные

30 733

уникальных бронирования.

526

признаков после feature engineering.

500

TF-IDF признаков из отзывов.

Около 27% бронирований содержали доступный текстовый отзыв. Текст был преобразован в TF-IDF представление с ограничением словаря до 500 признаков.

03

Feature Engineering

Booking Features

  • total_guests
  • stay_nights
  • price_per_night

Behavior Features

  • is_last_minute
  • has_special_requests

NLP

500 TF-IDF признаков из текстовых отзывов.

Признаки позволяют одновременно учитывать характеристики бронирования и содержательную информацию из отзывов клиентов.

04

Model Development

CatBoost

Выбран в качестве финального алгоритма.

LightGBM

Использовался для сравнения качества.

XGBoost

Также участвовал в сравнении моделей.

Гиперпараметры оптимизировались с помощью Optuna. Данные разделялись на train, calibration и test. После обучения вероятности модели калибровались.

05

Итоговая модель

CatBoost

Финальная модель.

Isotonic Calibration

Калибровка вероятностей модели.

Threshold

Оптимальный порог — 0.533.

depth = 4
learning_rate ≈ 0.196
iterations = 480
l2_leaf_reg ≈ 7.25
threshold = 0.533
06

Business Result

IR · CALIBRATION 215.4M ₽
IR · TEST 214.5M ₽
STABILITY HIGH

Значения Incremental Revenue на calibration и test находятся на близком уровне, что говорит о стабильности выбранного решения.

07

Model Interpretation

SHAP

Текстовые TF-IDF признаки показали значительный вклад в прогнозирование отмен.

Tabular Features

Среди наиболее заметных признаков — длительность проживания, количество гостей, стоимость и специальные запросы.

08

ML Pipeline

01 Data Подготовка данных
02 Features Feature Engineering
03 TF-IDF NLP features
04 Train Optuna
05 Evaluate Business metric
09

Production

Production-часть проекта использует batch inference. Модель и preprocessing сохраняются как ML-артефакты, данные загружаются из PostgreSQL, а результаты записываются обратно в базу.

PostgreSQL Input
Airflow Orchestration
S3 ML artifacts
Predictions PostgreSQL
10

MLOps

Airflow

Оркестрация batch inference.

S3

Хранение модели и preprocessing.

PostgreSQL

Источник данных и хранилище результатов.

11

Technology Stack

Python Pandas NumPy Scikit-learn CatBoost XGBoost LightGBM Optuna SHAP TF-IDF
12

Result

В результате построен полный ML-пайплайн прогнозирования отмен — от подготовки данных и NLP до калибровки, оптимизации порога и оценки бизнес-эффекта.

13

Project