Ипотечная просрочка — один из тех кейсов, где логистическая регрессия раскрывается во всей своей методологической строгости. Целевая переменная здесь предельно ясна: факт выхода в просрочку, бинарный исход. Это сразу переводит задачу в плоскость скоринга и раннего предупреждения, где модель не просто классифицирует, а оценивает вероятность неблагоприятного события. На российском рынке доля просроченной задолженности по ипотеке остаётся вблизи 1–2% от портфеля, однако абсолютные объёмы проблемных кредитов в последние годы заметно растут. Такой контекст делает вероятностные оценки особенно востребованными.
Почему именно логистическая регрессия
Логистическая регрессия удобна тем, что её выход — не метка класса, а непрерывная оценка вероятности события от 0 до 1. В ипотечном скоринге под событием можно понимать выход на просрочку 30+ днeй (30+ DPD), 90+ DPD или даже дефолт в горизонте 12 месцев. Важно, что модель позволяет ранжировать заёмщиков по степени риска, задавать пороги принятия решений и при этом остаётся полностью интерпретируемой. Коэффициенты регрессии легко пересчитать в отношения шансов (odds ratio), и направление влияния любого признака проверяется вручную — это не просто плюс, а практическое требование к моделям кредитного риска. В отличие от «чёрных ящиков», логистическая регрессия объясняется бизнесу, риск-менеджменту и регулятору без потери глубины.
Что считается просрочкой по ипотеке
Просрочка фиксируется с первого дня после даты обязательного платежа по договору. Банковская практика может предусматривать пени и штрафы, но для скоринговой модели отсчёт дней просрочки (Days Past Due, DPD) — это прежде всего временная разметка, от которой зависит сама постановка задачи. Заранее необходимо определить, какое именно событие мы прогнозируем. Варианты:
- 1+ DPD — слишком шумная цель, много случайных задержек, сложно отделить паттерн риска от технических сбоев;
- 30+ DPD — хороший ранний сигнал, позволяет поймать устойчивое ухудшение платёжной дисциплины;
- 90+ DPD — более серьёзное событие, часто используемое в расчёте резервов;
- 180+ DPD — практически дефолтный сценарий;
- «Вышел на взыскание» — отдельная бизнес-цель, требующая юридической фиксации.
На практике наиболее распространён выбор 30+ или 90+ DPD, потому что такой таргет лучше разделяет случайные однодневные задержки и системное падение платёжеспособности. Чем короче целевой горизонт и жёстче событие, тем меньше наблюдений — это напрямую влияет на устойчивость модели и выбор порога классификации.
Как выглядит постановка задачи
Классическая формулировка: по данным на момент принятия рещения (или на дату выдачи кредита) оценить вероятность того, что заёмщик выйдет в просрочку в течение следующих 6 или 12 месяцев. Целевая переменная — бинарная метка, и горизонт прогнозирования здесь критичен. Слишком короткий горизонт заставит модель реагировать на случайные флуктуации, слишком длинный — размоет сигнал, часть признаков перестанут быть информативными. Выбор всегда компромисс между стабильностью целевой переменной и достаточным количеством наблюдений для обучения.
Примерный спектр задач:
Серьёзный рискБолее стабильная цель, меньше шумаРеже встречaется, требует большего объёма выборкиКрайнее событиеПолезно для стрeсс-оценки и расчёта резeрвовМало наблюдений, сложнеe обучать модель
| Задача | Что прогнозируем | Плюсы | Минусы |
|---|---|---|---|
| 30+ DPD за 12 месяцев | Риск заметной просрочки | Хорошо для раннего предупреждения | Неоднородность причин (потеря работы, развод, шоки) |
| 90+ DPD за 12 месяцев | |||
| Дефолт / взыскание |
Правильный выбор горизонта — это одновременно и выбор бизнес-реакции: модель для раннего предупреждения позволяет проводить реструктуризации, а модель жёсткого дефолта ориентирована на минимизацию потерь.
Какие признаки реально работают
В ипотечном скоринге наиболее сильными оказываются признаки, отражающие платёжеспособность, текущую долговую нагрузку и устойчивость дохода. Однако важно помнить: любой признак должен быть доступен строго на момент скоринга, иначе возникает утечка информации из будущего — модель будет показывать завышенное качество, бесполезное при реальном внедрении.
Основные групы:
Доход и занятость
- уровень официального дохода (подтверждённый 2-НДФЛ или справкой по форме банка);
- стаж на текущем месте работы — непрерывность занятости;
- тип занятости (наём, ИП, самозанятость);
- отрасль работодателя — чувствительность к экономическим циклам;
- стабильность дохода, оцениваемая через дисперсию поступлений за последние месяцы.
Долговая нагрука
- отношние ежемесячах платежей по всем кредитам к регулярному доходу (PTI);
- количество действуюих кредитов на момент выдачи ипотеки;
- наличие микрозаймов — сильный сигнал финансовой напряжённости;
- сумма обязательств после выдачи ипотеки — расчётная нагрузка на будущие периоды.
Параметры ипотеки
- размер первоначального взноса — чем выше, тем сильнее собственные средства заёмщика защищают банк от убытка при дефолте;
- срок кредита — более длинные сроки увеличиваят процентный риск и неопределённость;
- сумма займа — абсолютная величина обязательства;
- процентная ставка — влияет на ежемесячный платёж;
- наличие созаёмщика — часто повышает устойчивость;
- тип объекта: новостройка, вторичное жильё, индивидуальное жилищное строительство (ИЖС) — разные риски ликвидности и завершения строительства.
Кредитная история
- число прошлых просрочек и их длительность в днях;
- максимальная задержка по любому прошлому займу;
- возраст кредитной истории — более длительная история позволяет оценить стабильность;
- количество запросов в БКИ за последние месяцы — частые обращения могут сигналить о поиске кредитных средств;
- частота досрочных закрытий — говорит о финансовой дисциплине.
Поведенческие признаки
- задержки по предыдущим платежам (даже небольшие);
- снижение среднего остатка на счёте перед датой платёжа;
- рост долговой нагрузки в динамике;
- частые частичные погашения;
- изменеие зарплатного потока — уменьшение регулярных поступлений.
Сильный на первый взгляд признак может оказаться непригодным, если он определяется постфактум. Например, количество проведённых реструктуризаций или факт звонков коллектора — это уже следствие просрочки, их использование в предсказании будущей просрочки будет чистой утечкой данных и приведёт к нефальсифицируемым результатам.
Как устроена модель на практике
Логистическая регрессия оценивает логарифмические шансы события как линейну комбинацию независимых переменных, а затем преобразует их через сигмоиду в интервал [0, 1]. Интуитивно это означает: каждый признак добавляет свой вес к итоговой вероятности, и чем больше факторов риска активировано, тем выше прогнозируемый риск.
Рабочий цикл построения модели состоит из следующих шагов:
- Собрать исторические данные по всем выданным ипотечным кредитам с отметками о просрочках.
- Задать окно наблюдения (дата, на которую фиксируются признаки) и горизонт прогнозирования (например, 12 месяцев вперёд).
- Очистить данные от дубликатов, выбросов и аномалий, проверить пропуски. При пропусках в ключевых признаках — либо импутация с осторожностью, либо исключение записи.
- Убрать признаки, содержащие информацию о будущем; это обязательная проверка на временну́ю целостность.
- Разделить выборку на обучающую (train), валидационную (validation) и тестовую (test). Тестовая выборка должна быть отделена и по времени — out-of-time (OOT), чтобы оценить устойчивость модели на новых периодах.
- Закодировать категориальные переменные: One-Hot Enoding для номинальных признаков, Weight of Evidence (WOE) или оптимальный биннинг для порядковых и непрерывных — это повышает интерпретируемость и стабильность.
- Обучить логистическую регрессию с регуляризацией (L1 или L2) для снижения переобучения и отбора признаков.
- Оценить качество на OOT-выборке: разделяющюю способность, калибровку, стабильность.
- Настроить порог отсечения (cutoff) в соответствии с бизнес-требованиями.
- Подготовить документацию и правила мониторинга.
Весь процесс итеративен: после оценки модели часто приходится вернуться к отбору признаков или переопределению целевой переменной, если разделяющая способность недостаточна.
Типовой pipeline для ипотечного скоринга
| Этап | Что делаем | Зачем |
|---|---|---|
| Определение цели | 30+ DPD, 90+ DPD или дефолт | Чтобы модель решала конкретную задачу |
| Формирование датасета | История выдач и платежей | Для обучения на реальных паттернах |
| Очистка | Пропуски, выбросы, дубликаты | Для снижения шума и повышения обобщающей способности |
| Проверка утечки | Убираем постфактум-признаки | Чтобы не завысить качество модели искуственно |
| Кодирование | OHE, WЕ, биннинг | Для стабильности, монотонности и интерпретации |
| Обучение | Логистическая регрессия | Для базовой скорекард-модели |
| Оценка | AUC, Gini, KS, калибровка | Для понимания разделяющей спосообности и надежности |
| Внедрение | Порог, cutoff, правила | Чтобы превратить вероятности в решения: «одобрить / пересмотреть / отказать» |
На что смотреть в качестве модели
В банковском скоринге AUC ROC — важная, но не единственная метрика. Модель обязана быть стабильной во времени, корректно откалиброванной (вероятность 0.2 должна соответствовать примерно 20% реальных дефолтов в этой группе) и понятной для аудита. Основные метрики:
- AUC ROC — площадь под кривой ошибок, измеряет способность модели разделять «плохих» и «хороших» заёмщиков независимо от порога. Хороший уровень для ипотечного скоринга обычно начинается от 0.75–0.80.
- Gini — нормированный индекс (2*AUC -1), удобен при сравнении моделей.
- KS — максимальное расстояние между кумулятивными распределеними дефолтных и недефолтных наблюдений. Показывает, насколько модель «раздвигает» классы; значения выше 0.30 считаются приемлимыми.
- Calibration — график и статистика Хосмера-Лемешова; важнее всего в зоне средних и высоких рисков.
- Lift — во сколько раз модель превосходит случайный отбор на верхних децилях скоринга. Позволяет оценить эффективность отсечения наиболее рискованных заявок.
Для ипотечного портфеля критична калибровка: если модель правильно ранжирует, но систематически занижает вероятности в «средней» зоне, банк рискует принять на себя незапланированный кредитный риск. Плохая калибровка также ведёт к некорректной оценке резервов.
Пример интерпретации коэффициентов
Предположим, модель показала следующий профиль:
- высокий показатель долговой нагрузки PTI > 50% увеличивает шансы просрочки по сравнению с базовой категорией в 2.3 раза (отношние шансов);
- стаж на последнем месте менее 6 месяцев — шансы вырастаят в 1.8 раза;
- первоначальный взнос более 30% — снижает шансы на 40%;
- наличие прошлых просрочек длительностью более 30 дней — увеличивает шансы в 3.5 раза.
Такие резултаты одновременно математически строги и бизнес-логичны: каждый коэффициент имеет экономическую интерпретацию, что облехчает согласование с риск-менеджментом и внутренний аудит. Сила логистической регресии — именно в этой прозрачности; она не требует жертвовать объяснимостью ради точности на этапе baseline.
Где чаще всего ошибаются
Типичные ошибки при построении модели просрочки систематичны и часто сводят на нет все усилия по обучению.
- Подмена цели. Модель пытается предсказать «плохого заёмщика вообще», а нужна конкретика: выход на 90+ DPD в течение 12 месяцев с даты выдачи. Размытая цель порождает несопоставимые классы.
- Утечка информации. В модель попадают признаки, известные только после наступления события: факт реструктуризации, звонки из отдела взыскания, даже сумма просрочки за прошлые периоды. Это искусственно завышает AUC, и на реальных данных модель проваливается.
- Неправильный временной сдвиг. Признаки собираются по состоянию на момент прогноза, а не на дату скоринга. Например, если модель должна предсказать просрочку в ближайшие 6 месяцев, нельзя использовать поведенческие признаки, измеренные через 3 месяца после начала прогнозного периода.
- Игнорирование дисбаланса классов. Доля просрочки обычно 1–5%, модель может выучить предсказывать всегда класс «хороший» и получать высокую точность (accuracy), но нулевой KS. Без правильной настройки порога и выбора метрик (AUC, precision-recall) такое решение бесполезно.
- Слишком агрессивная фильтрация. Удаление редких наблюдений (например, заёмщиков с нетипично высоким доходом или экзотическими объектами залога) лишает модель способности распознавать экстремальные, но высокорисковые паттерны.
Как выбирать порог решения
Модель выдаёт вероятность, но кредитный конвейер требует бинарного или тернарного решения. Порог отсечения (cutoff) нельзя выбирать только по максимуму F1-score или точности — он должен быть привязан к экономической стоимости ошибок первого и второго рода.
- Ложноположительное решение (false positive) — хороший заёмщик ошибочно отнесён к рискованным: потеря прибыли от невыданного кредита.
- Ложноотрицательное решение (false negative) — рискованный заёмщик одобрен: будущая просрочка и прямые убытки.
На практике задают несколько диапазонов:
- низкий риск — автоматическое одобрение;
- средний риск — ручная проверка андеррайтингом;
- высокий риск — отказ или изменение условий (увеличенный первоначальный взнос, поручитель);
- очень высокий риск — усиленная верификация доходов, дополнительный залог.
Пороговые значения подбираются на основе кривой затрат и выгод, с учётом ожидаемых потерь от дефолта и процентного дохода. Это чисто бизнес-решение, которое аналитик лишь подготавливает, предоставляя матрицу ошибок при разных порогах.
Как использовать модель в ипотечной аналитике
Логистическая регрессия не ограничивается этапом выдачи кредита. Во всём жизненном цикле ипотеки она работает как универсальный вероятностный движок:
- Мониторинг портфеля — ежемесячный расчёт вероятностей просрочки для всех действующих договоров; динамика скорингового балла позволяет заметить ухудшение качества портфеля на ранних стадиях.
- Сегментация заёмщиков — группы по уровню риска служат основой для дифференцированных стратегий взыскания или предложений по рефинансированию.
- Расчёт резервов — вероятности просрочки, сопоставленные с экспертной оценкой уровня потерь при дефолте (LGD), дают оценку ожидаемых потерь (EL) в разрезе каждого кредита.
- Стресс-тестирование — модель позволяет симулировать макроэкономические шоки путём сдвига ключевых признаков (рост безработицы, падение доходов) и пересчитывать вероятности просрочки по портфелю.
На российском рынке такой подход особенно актуален в 2025–2026 годах, когда абсолютный объём просроченной ипотечной задолженности растёт на фоне прежних высоких выдач, хотя доля просрочки всё ещё удерживается вблизи 1% от портфеля. Модель позволяет количественно оценить, как меняется риск при изменении макроусловий.
Когда логистическая регрессия лучше сложных моделей
Несмотря на конкуренцию со стороны градиентного бустинга и нейросетей, логистическая регрессия остаётся предпочтительной в ситуациях, где важны:
- быстрый запуск — минимальные требования к вычислительным ресурсам;
- прозрачный скоринг — каждый балл раскладывается по признакам;
- юридическая и методологическая понятность — модель можно защитить перед регулятором;
- стабильный baseline — с ней легко сравнивать более сложные алгоритмы;
- scorecard-подход — ручная интерпретация и корректировка весов андеррайтером.
Для первой версии ипотечного скоринга логистическая регрессия часто являетя оптимумом. В последствии её сравнивают с градиентным бустингом, но необоснованное усложнение на старте редко оправдано. Базовая модель задаёт понятный ориентир, а прирост от бустинга часто не перевешивает потерю прозрачности.
Практический чек-лист для внедрения
- Чётко определить целевое событие (например, 90+ DPD в течение 12 месяцев).
- Выбрать горизонт прогнозирования, обеспечиваюьющий баланс между достаточным количеством наблюдений и бизнес-смыслом.
- Исключить утечку данных: все признаки должны быть известны на дату скоринга и не содержать информации о будущем.
- Проверить стабильность признаков во времени (Population Stability Index).
- Оценить дисбаланс классов и при необходимости применить стратифицированую выборку или корректировку весов.
- Посмотреть калибровку вероятностей на тестовом периоде.
- Протестировать модель на out-of-time выборке, отделённой от обучающей временны́м разрывом.
- Задать бизнес-порог на основе cost-benefit анализа.
- Подготовить понятную документацию с описанием всех признаков, коэффициентов и методики расчёта скорингового балла.
- Организовать регулярный мониторинг: отслеживать Gini, KS, PSI и дрейф признаков после внедрения.
Мини-алгоритм для аналитика
Для быстрого старта можно придерживаться такой последовательности:
- Взять исторический массив выданных ипотек с отметками о просрочках.
- Сформировать бинарный флаг события: 30+ или 90+ DPD в горизонте, например, 12 месяцев.
- Собрать признаки строго на момент выдачи или на момент последней актуализации данных (для мониторинга).
- Убедиться, что ни один признак не использует информацию после даты наступления события.
- Обучить логистическую регрессию с регуляризацией, предварительно проведя отбор признаков через WOE и IV (Information Value).
- Проверить AUC, KS и калибровку на отложенной выборке.
- Сегментировать заёмщиков по вероятности риска и выбрать cutoff, руководствуясь матрицей затрат.
- Сравнить модель с действуяющими правилами (экспертная система, простые фильтры).
- Запустить пилот на небольшой части потока заявок, чтобы оценить операционные показатели.
- Настроить регулярный пересчёт модели (раз в квартал) и автоматизированный мониторинг ключевых метрик.
Вывод
Логистическая регрессия — надёжный и методологически прозрачный инструмент для оценки вероятности ипотечной просрочки. Она даёт не просто бинарную классификацию, а вероятностную оценку риска, которую можно непосредственно использовать в скоринге, раннем предупреждении и портфельном анализе. При грамотной постановке задачи, аккурном выборе горизонта и строгой фильтрации признаков от утечек такая модель становится добротной количественной основой для принятия кредитных решений — и отличным baseline для последующих экспериментов с более сложными алгоритмами.
FAQ
Что лучше прогнозировать: 30+ или 90+ дней просрочки?
Если цель — ранняя профилактика и работа с заёмщиком до наступления критических проблем, предпочтительнее 30+ DPD. Если же нужно идентифицировать действительно тяжёлые случаи с высокой вероятностью перехода в дефолт, то 90+ DPD даст более чистый сигнал. Выбор целевой переменной определяет последующую стратегию взыскания и допустимый уровень ложноположительных срабатываний.
Подходит ли логистическая регрессия для небольших банковских выборок?
Да, это одно из ключевых преимуществ. При малых объёмах данных более сложные модели скорее подвержены переобучению, тогда как логистическая регрессия сохраняет стабильность благодаря малому числу параметров и возможности регуляризации. Разумеется, минимальный размер всё же определяется количеством событий (просрочек): желательно иметь хотя бы 50–100 событий на один признак, чтобы оценки коэффициентов были надёжными.
Нужно ли использовать только финансовые признаки?
Нет. Финансовые показатели — основа, но поведенческие признаки и характеристики кредитной истории часто добавляят существенную разделяяющую силу. Например, снижение остатка на текущем счёте за несколько дней до платёжной даты или факт частых обращений в БКИ перед выдачей ипотеки могут быть сильными предикторами. Главное — соблюдать временну́ю логику: поведенческие признаки берутся за период, предшествуяющий дате скоринга.
Почему хорошая модель может всё равно ошибаться на отдельных клиентах?
Потому что просрочка — это не только функция наблюдаемых переменных, но и результат экзогенных шоков: внезапная потеря работы, болезнь, распад семьи, рост обязательных расходов. Ни одна модель не улавливает все такие события заранее. Вероятностная природа логистической регрессии как раз это и отряжает: она даёт ожидаемый риск на основе устойчивых паттернов, но не может быть детерминированной на уровне каждого заёмщика.
Можно ли использовать логистическую регрессию как основу для более сложной модели?
Безусловно. Это классический подход: логистическая регрессия служит baseline, с которым затем сравниваят градиентный бустинг, случайный лес или нейросетевые архитектуры. Её прогнозы могут также использоваться как один из признаков в ансамблевых моделях или как компонент гибридной системы, где правила и экспертная оценка дополняют статистические методы. При любом усложнении прозрачность и интерпретируемость базовой модели остаятся ценным ориентиром.