Обмеження традиційного кредитування
Традиційний кредитний скоринг в основному покладається на історію бюрократичних даних та невелику кількість демографічних та фінансових показників, які оновлюються рідко — часто переглядаються лише раз на рік і базуються на відносно простих статистичних моделях. Як наслідок, практично, існує вузький канал схвалення: кредитор, який використовує консервативну традиційну модель, може схвалити лише близько чверті заявників, і навіть серед тих, хто був схвалений, значна частина все ще йде за простроченням платежів, оскільки обмежений набір функцій моделі не може надійно розрізняти дійсно ризикованих позичальників та кредитоспроможних позичальників, які просто не мають великої офіційної кредитної історії — так званих «тонкошарових» позичальників.
Це не незначна неефективність. Відхилення значної кількості заявників, які насправді б надійно повернули кошти, представляє втрату прибутків для кредитора та реальну прогалину у доступі до кредитів для позичальника, і це непропорційно впливає на саме населення — молодих позичальників, нещодавніх іммігрантів, працівників гіга-сектору, людей, які щойно відкрили рахунок — тих, хто має найменшу офіційну кредитної історії для посилань.
Які альтернативні дані додають
Альтернаційна кредитна оцінка поповнює або, для клієнтів із тонкими даними, замінює історія кредитних бюро сигналами, які корелюють із фінансовою надійністю, але традиційно ніколи не використовувалися в underwriting. Дані про телекомунікації — як довго активний номер телефону, стабільність витрат — є показниками стійкості. Історія оплати комунальних послуг та орендної плати, коли доступна, є прямим сигналом поведінки щодо того, чи сплачуються рахунки вчасно, що, ймовірно, більш релевантно для погашення кредитів, ніж загальна кредитна оцінка, обчислена з несхожих боргів. Патерни банківських транзакцій (середній баланс, регулярність витрат) відображають здоров’я грошового потоку, яке не вловити статичною витримкою кредитних бюро. Навіть дані про пристрої — модель смартфона, яку використовує заявник — мають вимірний, хоч і слабкий, прогнозний потенціал як показник доходу на деяких ринках. Жоден із цих сигналів не є вирішальним сам по собі; цінність полягає в об’єднанні десятків слабких сигналів у єдину модель замість того, щоб покладатися на будь-який з них окремо, що є саме тієї проблемою, яку добре підходять для вирішення ансамблі дерев з градієнтом (наприклад, LightGBM і XGBoost є поширеними варіантами).
Розробка ознак та навчання моделі
Практичний набір ознак поєднує традиційні дані (вік, дохід, тривалість трудоубуду, бали кредитної історії за бюро де вестування, якщо доступно) з альтернативними сигналами (тривалість володіння телефоном, середній розрахунковий платіж за телекомунікації, відсоток своєчасних платежів за комунальні послуги, середній банківський баланс, проксі-значення пристрою) та співвідношеннями за кредитом (борг до доходу, кредит до доходу, скориговане терміном). Змінною цільового значення зазвичай є серйозний прострочений борг – наприклад, більше ніж 90 днів прострочених платежів, обчислений на основі історичних результатів кредитування на два роки або більше серед схвалених, неякісних та погашених кредитів. Градієнт-підсилювач класифікатора, навчений за допомогою цього набору ознак, з урахуванням ваги класів для врахування того, що прострочені платежі є меншштою категорією результату навіть серед історично схвалених кредитів, генерує оцінку ймовірності дефолту для кожного заявника, яка зазвичай масштабується до більш звичного тризначного рейтингу кредитної історії для внутрішнього використання.
Від ймовірності до рішення щодо кредитування
Результат моделі подається в двигун прийняття рішень, який відображає діапазони оцінок на сходинках результатів: високий рівень оцінки схвалюється за вигідну процентну ставку та більший максимальний розмір кредиту; середній рівень оцінки схвалюється за вищу ставку, що відображає підвищений ризик; нижчий, але все ще життєздатний рівень отримує умовне схвалення, часто потребуючи поручителя; і найнижчий рівень відхиляється. Критично, жорсткі правила політики знаходяться поза межами та повністю замінюють статистичну модель – мінімальні вимоги щодо віку, виключення банкрутства тощо, як абсолютні перепона, застосовуються незалежно від того, що говорить статистичний бал, оскільки модель, навчена лише для мінімізації ризику дефолту, не має в собі усвідомлення юридичних вимог щодо відповідності.
Виміряний економічний вплив розширення каналу схвалення
Економічне обґрунтування альтернативного оцінювання даних полягає в тому, що більш точна модель не лише схвалює більше людей – вона схвалює кращий склад людей. Банк, який переходить від вузької, традиційно-опосередкованої моделі до моделі на основі альтернативних даних, зазвичай бачить подвоєння показника схвалення, а точність розширеного пулу схвалень насправді покращується, а не погіршується, оскільки модель правильно ідентифікує кредитоспроможних осіб з мінімальним кредитним рейтингом, які раніше були відхилені лише через відсутність історії в бюро, замість просто зниження планки безрозмірним чином. Загальний ефект на прибутковість портфеля часто є драматичним: банк, який був незначно нерентабельним або ледь досягав точки безубутства за консервативною традиційною моделлю, може перейти до стабільної прибутковості, коли канал схвалення правильно захоплює раніше непомітних хороших позичальників, навіть якщо втрати серед новосхваленої популяції уважно контролюються та зазвичай стабілізуються на рівні, який комфортно покриває розширений дохід.
Дотримання вимог не є необов’язковим: пояснюваність та моніторинг упереджень
Рішення щодо кредитування є одним з найбільш регульованих застосунків машинного навчання, і це зрозуміло. Згідно з режимами GDPR та подібними нормами захисту прав споживачів, заявник, якому відмовлено в кредиті, зазвичай має право на пояснення, що означає, що модель не може бути чистою «чорною скринькою» — необхідно обчислювати значення SHAP або еквівалентний метод атрибуції ознак для кожного рішення, щоб можна було генерувати конкретне, зрозуміле людині обґрунтування («відношення боргу до доходу було найбільшим негативним фактором») за запитом, а не просто неясний бал. Кожне автоматизоване рішення повинно бути записане з повним журналом аудиту — час, версія моделі, використані ознаки вхідних даних, отриманий бал і остаточне рішення — як для перевірки регуляторними органами, так і для внутрішнього моніторингу ризиків моделі з часом. Випадки високого ризику, визначені сумою кредиту або близьким до небезпечного рейтингом, повинні направлятися на розгляд людиною замість повної автоматизації. І результати моделі повинні активно відстежуватися щодо різних наслідків впливу на захищені характеристики, такі як стать, вік чи етнічна приналежність, оскільки модель, навчена лише для мінімізації ризику непогашення, може ненавмисно вивчати кореляції з цими характеристиками через проміжні змінні, навіть якщо захищена характеристика явно не включена до набору ознак — моніторинг упереджень повинен перевіряти результати, а не лише вхідні дані.
Часті запитання
Що робить людину "тонким файлом" (thin file), і чому це важливо для кредитного рейтингу?
«Тонкий файл» – це людина з мінімальним або відсутнім традиційним кредитним аналогом бюро, часто молоді позичальники, нещодавні іммігранти або люди, які вперше використовують формальні банківські послуги. Традиційні моделі оцінювання, які сильно покладаються на історію бюро, зазвичай відхиляють таких заявників за замовчуванням не тому, що вони насправді є високою ризиковою групою, а тому що недостатньо традиційних даних для впевненого їх оцінювання. Альтернативні дані надають моделі інші надійні сигнали для роботи замість цього.
Чи менш точний альтернативний метод кредитного рейтингу, ніж традиційний метод на основі бюро?
Докази свідчать про зворотне: моделі, які поєднують альтернативні дані з традиційними полями, зазвичай схвалюють більшу частку заявників, зберігаючи або покращуючи точність схваленої групи, оскільки додаткові характеристики дозволяють моделі розрізняти кредитоспроможних позичених «тонких файлів» від справді ризикованих, замість безпідставного відхилення обох груп через брак інформації.
Чому банкам потрібно надати пояснення для кожного відхиленого запиту?
Споживательське регулювання у багатьох юрисдикціях надає заявникам право знати, чому їх було відхилено, і використання незрозумілої моделі робить це неможливим. Методи атрибуції ознак, такі як SHAP-значення, дозволяють кредитору перекласти оцінку моделі на конкретні, ранжовані причини — наприклад, співвідношення боргу до доходу або низький відсоток своєчасних платежів за комунальні послуги — які можна повідомити як заявнику, так і регулятору.
Як працює моніторинг упереджень, якщо захищені атрибути, такі як стать чи етнічність, виключені з моделі?
Виключення захищеного атрибуту з вхідних ознак не гарантує, що модель буде без упередження щодо цієї групи, оскільки інші характеристики можуть діяти як ненавмисні прокси. Моніторинг упереджень замість цього перевіряє фактичне розподіл вихідних даних моделі для цих груп — наприклад, порівнюючи відсотки схвалення — щоб виявити дискримінаційний вплив навіть тоді, коли захищений атрибут ніколи не використовувався безпосередньо як вхідний параметр.
Які характеристики кредиту зазвичай запускають обов’язковий ручний огляд замість повної автоматизації?
Типові тригери — це оцінка ризику, що знаходиться близько до межі схвалення/відхилення, та сума кредиту, яка перевищує визнаний поріг, оскільки обидва ці випадки представляють ситуації, коли неправильне автоматичне рішення має значні наслідки. Направлення цих випадків на людину-перевізника об’єднує ефективність автоматизації для звичайних, низькоризикових рішень із людським судженням, де ставки або невизначеність є найвищими.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте the simulation і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію the simulation