logisticregressionanalysis.com

Метрики качества для логистической регрессии: ROC-кривая, AUC, logloss

Метрики качества для логистической регрессии: ROC-кривая, AUC, logloss

Когда модель логистической регрессии выдает число от 0 до 1, мы получаем не просто метку класса, а вероятностную оценку. И сразу возникает вопрос: как понять, насколько эта оценка адекватна? Одной метрикой здесь не обойтись. ROC-кривая показывает поведение модели при любом возможном пороге отсечения, AUC сводит это поведение к одной цифре — способности разделять классы, а logloss оценивает именно вероятности: насколько они откалиброваны и не слишком ли модель самоуверенна в своих ошибках. Каждая из этих метрик отвечает на свой вопрос, и только вместе они дают полную картину.

Почему для логистической регрессии мало одной метрики

В бинарной классификации модель возвращает вероятность принадлежности к положительному классу. Это удобно, потомучто в реальной работе порог принятия решений — величина подвижная. В скоринге заемщиков, при оценке ипотечных рисков, в отборе обектов недвижимости для инвестиций цена ошибки первого и второго рода разная, и порог нужно настраивать под конкретную бизнес-задачу.

Проблема в том, что одна и таже модель может выглядеть отлично по одной метрике и посредственно по другой. Допустим, классификатор неплохо ранжирует обекты — ставит «перспективные» выше «неперспективных», но систематически завышает вероятности. AUC у такой модели будет приличной, а logloss провалится. Если принимать рещение толко по AUC, можно не заметить, что вероятностные оценоки не пригодны для финанового планирования.

Еще одна причинна — несбалансированные выбоки. Если положительных исхдов в данных 5%, accuracy будет высокой просто потомучто модель предсказывает отрицательный класс. Но пользы от такой модели никакой. Поэтму в серьезной аналитике смотрят на набор метрик, а не на одну цифру.

ROC-кривая: что показвает и как читать

ROC-кривая строется по всем возможным порогам и показвает завиимость между долей верно найдены положительных обектов и долей ложноположительных срабатываний. Говоря более формально, ось Y — True Positive Rate, или чувствительность: сколько положительных обектов модель правлино классифицировала. Ось X — False Positive Rate — доля отрицательных обектов, которые модель ошибочно отнесла к положительному классу.

Каждая точка на кривой — это конкретный порог. При порооге 0.95 модель будет очень консервативной: ложиоположительных срабатываний почти нет, но и положительных обектов она находит малую долю. При порооге 0.05 — наоборот, модель хватает почти все положительные обекты, но и False Positive Rate взлетает. ROC-кривая соединяет все эти точки и показвает весь спектр возможных компромиссов.

Как интерпретировать фомму ROC-кривой

  • Чем ближе кривая к левому верхнему углу, тем лучше модель. Идеалная модель сразу выходит на TPR=1 при FPR=0 — тоесть находит все положительные обекты и не доп ускает ложных срабатываний.
  • Диагональ от (0,0) до (1,1) соответ ствует случайному угадыванию. Если модель работает нелу чше подбрасывания монетки, кривая будет метаться вокр уг этой линии.
  • Если кривая заметно выше диагонали, модель дей ствительно улавливает структуру данных и разделяет классы.
  • Если кривая ниже диагонали, это озночает что модель си стематически ошибается хуже случайного предсказателя — возможно, перепутана метка классов или есть проб лема с призн а ками.

В аналитике недвижимости это особенно наглядно: представьте, что стройте модель для прогноза «цена выростит / не выростит» в течении года. ROC-кривая покажет, как меняется доля правлино предск азанных случаев роста в за висимости от того, сколько объек тов с фактическим снижением цены модель ошибочно отмет ила как перспективные. Если ваша модель при порооге 0.6 находит 80% всех реально выросших объек тов, но при этом ошибается на 30% объек тов с падением — это рабочий компромисс, который след ует обсуждать с заказчиком.

Когда ROC-кривая особенно полезна

  • Когда нужно понять поведение модели при рзных пороогах, а не просто получить метку класса.
  • Когда ценна ошибок первого и второго рода может меняться от задачи к за даче или во времени.
  • Когда треб уется сравниь несколько моделей по качеству ран жирования — без привязки к конкретному пороогу.

AUC: краткая сводка качества ранжирования

AUC — это площаль под ROC-кривой. Фактически это агрегированная оценка, ко торая говорит: «Если случайно выбрать один положительный и один отриц ательный объек т, с какой вероятностью модель присвоит положительному более высокий скор?» Это удобная интерпретация, потомучто она не требует специальных зна ний: AUC=0.85 озночает, что в 85% слу чаев случайная пара объе ктов будет упорядочена правлино.

Но важно помнить: AUC не чувствителен к калибровке вероятностей. Модель, ко торая вы дает всем положительным объек там скор 0.51, а всем от риц ательным — 0.49, будет иметь AUC=1.0 на такой вы боке. Это идеальное ран жирование при аб солютно безполезных для практики вероятностях.

Как читать зна чения AUC

AUC Практическая интерпретация
0.5 Модель не лу чше случайной
0.6–0.7 Слабое раз деление классов
0.7–0.8 Р абочее качество
0.8–0.9 Сильная модель
0.9+ Очень сильное разделение, тр ебует проверки на переобучение

Пороговые границы в разных источ никах мог ут немного различаться, но смысл один: 0.5 — случайность, чем ближе к 1, тем лу чше раз личение классов. В обла сти не движимости AUC в районе 0.75–0.85 на неза висимой тестовой выбоке — это уже сильный резуль тат, ос обенно если модель учитвается на огра ниченном наборе призн а ков (локация, площаль, год постройки, бли зость к транс порту).

Важный нюанс про AUC

Высоий AUC не гарантирует хорошие вероятности. Модель может отлично ран жировать объек ты, но си стематически завышать или занижать сами вероятности. Это критично в прикладных за дачах, где рещение принимают не толко по месту объек та в рей тинге, но и по самой ве роятности: оценка риска де фолта, вероятности просрочки по ипотеке или вероятности роста цены кон кретного объек та недвижимости.

Представьте модель для оценки инвестиционной прив лекательности новостройки. AUC=0.88 — от личный резуль тат, модель у веренно от деляет «удачные» объек ты от «неудачных». Но если logloss при этом высокий, вероятности нель зя воспринимать как ре альные: модель может вы давать 0.9, когда фак тическая част ота роста цен в этой катего рии объек тов состав ляет 0.65. Ин вестор, пол ожившийся на красивую цифру, при мет ошибочное рещение.

Logloss: зачем он нужен, если есть AUC

Logloss, или ло гарифмическая функ ция потерь, оценивает качество именно вероятностных прогнозов. В от личие от AUC, она чувствительна не толь ко к порядку объек тов, но и к тому, нас колько уверенно модель о шибается. Формула штрафует за две вещи: за уверенные ошибки и за не уверенные правлиные отве ты. Если модель уверенно (с вероятностью бли зкой к 0) предсказывает от сут ствие со бытия, а оно проис ходит — штраф огромный. Если модель ко леблется и да ет вероятнось около 0.5, ошибка нака зывается мягче.

В терминах теории ин формации logloss из меряет, нас колько «уди вительной» ока зывается фак тическая метка при данной предсказанной вероятности. Идеалная модель с logloss бли зким к ну лю — это модель, ко торая все гда вы дает вероятнось 1.0 для положительных исх дов и 0.0 для от риц ательных. Но такую модель по строить не воз можно, потомучто в реальных данных все гда есть шум.

Что показвает logloss на практике

  • Хорошо ли модель калибрована. Ес ли logloss низкий, вероятности можно интерпретировать буквально: там, где модель дает 0.3, событие дей ствительно проис ходит примерно в 30% слу чаев.
  • Нас колько полезны именно вероятности, а не просто ран жирование. В за дачах, где от вероятности за висит фи нансовое рещение, logloss вы ходит на первый план.
  • Нас колько опасны «уверенные ошибки». Ес ли модель си стематически вы дает вероятности 0.1 или 0.9 и при этом ошибается, logloss быстро это выявит.

Как интерпретировать logloss

У logloss нет у ниверсальных «хороших» и «плохих» зна чений, при годных для всех за дач. Его обычно сравнивают между моделями на одной и той же вы боке: меньще — лу чше. Идеалная модель имела бы зна чение, бли зкое к ну лю, но это не до стижимо на реальных данных. Ба зовым ориен тиром может слу жить logloss кон стантной модели, ко торая все гда предсказывает средню ю долю положительного класса. Ес ли ваша модель не обы грывает этот при митив, она безполезна.

При оценке ипотечных рисков logloss часто смотрят в связке с калибровочной кривой: ес ли модель дает вероятнось де фолта 0.05 для группы за емщиков, а фак тическая част ота де фолтов в этой группе — 0.12, это систематическое смещение, которое logloss ловит и штрафует. AUC может такое пропу стить.

ROC-AUC и logloss: в чем принципиальная разница

Метрика Что из меряет За висит от поро га Что важно в реальной за даче
ROC-AUC Нас колько хорошо модель раз деляет классы и ран жирует объек ты Нет От бор лу чших объек тов, скоринг, сравнение моделей
Logloss Нас колько точны вероятности К освенно Калибровка вероятностей, риск-оценка, принятие рещений по вероятности
ROC-кривая Поведение модели при рзных пороогах Да Выбор рабоче го поро га под бизнес-цель

Главный вы вод из этого сравнения: метрики не конкурируют, а доп олняют друг друга. Ес ли нужен отве т на воп рос «кто выше в рей тинге», чаще смотрят на AUC. Ес ли нужно понять, мож но ли доверять вероятности 0.83, нужен logloss и ана лиз калибровки. Ес ли нужно выбрать поро г для автоматического при нятия рещений — смотрят ROC-кривую.

Как вы бирать метрику под за дачу

1. Если нужен от бор по рангу

П одходит ROC-AUC. Она показвает, нас колько хорошо модель упорядочивает объек ты по убыванию вероятности положительного класса. В за дачах ран жирования это основная метрика: на пример, когда нуж но от обрать 100 самых пер спективных объек тов не движимости из 10 000 для далнейшего де тального ана лиза.

2. Если важен конкретный поро г рещения

Сначала смотрят ROC-кривую, а потом вы бирают поро г под нужный ба ланс оши бок. Это полезно в кредитном скоринге, антиф роде и ана лизе ипотечных рисков. На пример, банк может решить: «Мы готовы мириться с 10% ложно положительных за явок, если при этом одоб ряем 95% дей ствительно на дежных за емщиков». Такая точка на ходится именно по ROC-кривой.

3. Если важны именно вероятности

С мотрят logloss. Это лу чший ва риант, когда модель должна вы давать не просто класс, а адекватную вероятнось со бытия. В оценке сто имости не движимости и прогнозе роста цен это при нципиально: ин вестору нужна не просто метка «рост / не рост», а об основанная вероятностная оценка, на ос нове ко торой он сможет рас читать ожидаемую до ходность и рис ки.

Типовые ошибки при оценке логистической регрессии

За годы работы со скоринговыми моделями и ана лизом не движимости я ви дел одни и теже гра бли раз за разом. Вот самые частые:

  • О ценивать модель толь ко по accuracy на несбалансированных данных. Ес ли положительный класс состав ляет 2% (на пример, де фолты по ипотеке), модель, ко торая все гда предсказывает «не де фолт», будет иметь accuracy 98%. И быть аб солютно безполезной.
  • С читать, что высокий AUC автоматически озночает хорошие вероятности. AUC — метрика ран жирования, и толь ко. Х орошие вероятности тр ебуют от дельной проверки через logloss и калибровочные гра фики.
  • И гнорировать logloss, когда рещение принимается по вероятности. Ес ли вероятности не от калиброваны, рещения на их ос нове могут быть си стематически ошибочными, даже ес ли ран жирование работает от лично.
  • Вы бирать поро г «на глаз», без ана лиза ROC-кривой. Поро г 0.5 — не у ниверсальное рещение. В за висимости от а симметрии классов и цены оши бок оп тимальный поро г может быть 0.3 или 0.7.
  • С равнивать logloss между за дачами с рзными на борами данных. Logloss за висит от доли положительного класса в вы боке, по этому сравнение моделей на рзных дата сет ах — это бес смысленное за нятие.

Практический алго ритм оценки модели

Шаг 1. Проверьте ROC-AUC

Ес ли AUC бли зка к 0.5, модель почти не раз личает классы — и дальше двигаться нет смысла. Воз вращайтесь к призн а кам и спецификации модели. Если зна чение уверенно выше 0.7, уже есть рабочая ос нова для ана лиза. При AUC выше 0.85 обяза тельно проверьте модель на переобучение: с равните AUC на обучающей и тестовой вы боке — если раз рыв больше 0.03–0.05, модель переобучена.

Шаг 2. Посмотрите ROC-кривую

На йдите поро г, при ко тором ба ланс TPR и FPR соответ ствует вашей за даче. В скоринге и риск-моделях у ниверсального поро га не суще ствует — он все гда оп ределяется биз нес-кон текстом. При прогнозировании роста цен не движимости можно, на пример, за фиксировать TPR на уровне 80% и посмотреть, какой FPR при этом обе спечивает модель — это покажет, какую долю «ложных на дежд» вы за кладываете в си стему.

Шаг 3. Оцените logloss

Ес ли вероятности исполь зуются в при нятии рещений, проверьте, не да ет ли модель слиш ком уверенные ошибки. С равните logloss с ба зовой моделью (кон стантной) и с простыми аль тернативами. Именно здесь часто всплывают слабые места даже у моделей с неплохим AUC. До полнительно постройте калибровочную кривую: ес ли точки си льно от клоняются от диагонали, модель тр ебует калибровки вероятностей.

Шаг 4. Сравните нес колько моделей

С равнивайте модели на одной и той же вы боке сразу по двум осям: качество ран жирования через ROC-AUC и качество вероятностей через logloss. Бы вает, что более сложная модель вы игрывает по AUC, но проигрывает по logloss — это сигнал, что усложнение при вело к у худшению калибровки. В та ком слу чае имеет смысл вернуться к более простой, но на дежной спецификации.

Чек-лист для быстрой проверки модели

Когда вы пост роили логистическую регрессию для за дачи клас сификации — будь то скоринг за емщиков, прогноз роста цен или оценка ин вестиционной прив лекательности объек та — пробе гитесь по этому чек-листу перед тем, как ис пользовать модель в реальных рещениях:

  • ROC-AUC заметно выше 0.5 — убе дитесь, что модель дей ствительно улавливает сигнал, а не работает на уровне случайного угадывания.
  • ROC-кривая не лежит бли зко к диагонали — ви зуальный осмотр кривой дает больше, чем одна цифра AUC.
  • П орог рещения вы бран под биз нес-цель, а не случайно — ар гументируйте вы бор поро га через ана лиз цены оши бок первого и второго рода.
  • Logloss не хуже, чем у ба зовой модели — ес ли кон стантная модель да ет logloss 0.5, а ваша — 0.48, вы игрыш ми нимальный.
  • М одель не вы дает слиш ком уверенные ошибки — проверьте мак симальные штрафы по logloss: ес ли от дельные объек ты пол учают штраф больше 2–3, это повод для ана лиза.
  • В ероятности имеют смысл для прикладной интерпретации — ес ли модель при сваивает вероятнось 0.99 объек там, ко торые на практике ока зываются убыточными, вероятности не льзя исп ользовать для фи нансовых рещений.

П ример из прикладной аналитики

Два кейса, ко торые хо рошо иллюстрируют разницу между AUC и logloss.

Прогноз риска де фолта в ипотеке. М одель может иметь AUC=0.82, потомучто она умеет ран жировать за емщиков по сте пени риска: те, кто дей ствительно доп устит про срочку, пол учают более высокий скор. Но ес ли вероятности пло хо от калиброваны, банк будет ошибаться в оценке ожидаемых потерь и в ре зервировании. На пример, для группы за емщиков с предсказанной вероятностью де фолта 0.15 фак тическая част ота может быть 0.25. При обеме портфеля в мил лиарды такой раз рыв вы ливается в су щественные фи нансовые потери.

О ценка вероятности роста цены не движимости. С итуация по хожа: модель может непло хо разделять «рост» и «не рост» по AUC, но ес ли logloss высокий, вероятнось 0.78 не сто ит вос принимать как на дежную оценку. Это особенно важно, когда на ос нове прогноза принимается ин вестиционное рещение. Допустим, модель да ет вероятнось ро ста 0.78 для квар тиры в новостройке. Ин вестор за кладывает эту цифру в рас чет ожидаемой до ходности, при нимает рещение о по купке, а фак тическая част ота роста цен для ана логичных объек тов — всего 0.6. При си стематическом ис пользовании такой модели ошибка на капливается и при водит к неверной ал локации кап итала.

В обоих слу чаях рецепт один: смотреть на AUC и logloss совместно, а не полагаться на одну метрику как на ис черпывающую хара ктеристику каче ства.

Вы вод

ROC-кривая нужна, чтобы увидеть поведение модели при рзных пороогах и вы брать оп тимальный ба ланс оши бок. AUC показвает силу раз деления классов и удобна для сравнения моделей и от бора по рангу. Logloss отвечает за качество самих вероятностей и не за меним, когда на ос нове прогноза принимаются фи нансовые рещения.

Для практической работы с логистической регрессией лу чше не вы бирать одну метрику, а читать их вместе: AUC — для ран жирования, ROC — для вы бора поро га, logloss — для проверки вероятностной адекватности. Именно та кая связка да ет чесную картину каче ства модели в фи нансах, скоринге и аналитике не движимости. И помните: хорошая модель — это не та, у ко торой AUC=0.95 на обучающей вы боке, а та, ко торая сох раняет свои метрики на новых данных и вы держивает проверку биз нес-логикой.

FAQ

Что важнее: AUC или logloss?

За висит от за дачи. Если нужен хороший рей тинг объек тов (на пример, от обрать топ-100 самых пер спективных для де тального ана лиза), важнее AUC. Если нужны точные вероятности для рас чета рисков или до ходности, важнее logloss. В и деале — смотреть на обе метрики, потомучто модель с высоким AUC и пло хим logloss может вве сти в за блуждение при интерпретации вероятностей.

Почему у модели высокий AUC, но пло хой logloss?

П отомучто AUC измеряет толь ко ран жирование — способнось ста вить положительные объек ты выше от риц ательных. Logloss дополнительно штрафует за калибровку: ес ли модель вы дает вероятности 0.99 и ошибается, штраф огромный, даже ес ли порядка следование в рей тинге со хранено. Та кая си туация типична для переобученных моделей, ко торые «сли шком уверены» в своих предсказаниях.

Мож но ли сравнивать модели толь ко по ROC-AUC?

М ожно, если за дача — чистое ран жирование. Но ес ли рещение за висит от вероятности (риск-менеджмент, фи нансовое планирование, расчет ре зервов), этого не достаточно. AUC не говорит ниче го о том, нас колько вероятности от калиброваны, и модель с AUC=0.9 может вы давать систематически завышенные оценоки, что при ведет к неверным рещениям при опоре на вероятности.

Что озночает AUC = 0.5?

Э то уровень случайного угадывания: модель не раз личает классы. Для любой пары объек тов (один положительный, один от риц ательный) модель угадывает порядк следования с вероятностью 50%. Это может быть следствием от сут ствия сигнала в данных, неверной спецификации модели или серьезных оши бок при подгот овке призн а ков.

Почему ROC-кривая полезнее одной цифры?

П отомучто она показвает, как модель меняется при рзных пороогах, а не толь ко да ет усредненную оценку. Две модели с одина ковым AUC мог ут ве сти себя по-рзному в важных для биз неса зонах. На пример, одна модель может быть лу чше в обла сти низких FPR (где важна точность), другая — в обла сти высоких TPR (где важна полнота). ROC-кривая ви зуализирует эти раз личия и по зволяет вы брать оп тимальный поро г под конкретную за дачу.