Has construido un nuevo modelo de credit scoring. Las métricas de validación son mejores que las del modelo actual; el Gini ha subido de 0,58 a 0,64, el KS ha mejorado, la calibración es mejor. Todo apunta a que el nuevo modelo es superior. ¿Lo despliegas en producción y sustituyes al anterior?
La respuesta en cualquier entidad financiera seria es: no todavía. Antes de sustituir un modelo en producción hay que validarlo en condiciones reales, con clientes reales, decisiones reales y consecuencias reales. Y eso es exactamente lo que hace el proceso Champion vs Challenger.
El Champion es el modelo actual en producción, el que lleva tiempo funcionando, del que conocemos el comportamiento, que ha demostrado ser válido. El Challenger es el modelo nuevo, el candidato a sustituir al Champion, con métricas prometedoras pero sin historial real en producción.
El proceso Champion vs Challenger consiste en aplicar ambos modelos simultáneamente a los mismos clientes y comparar sus predicciones, y eventualmente sus resultados reales, para decidir con evidencia empírica si el Challenger es realmente mejor que el Champion.
En esta entrada explicamos en qué consiste el proceso, cómo se interpreta la comparativa y por qué es el estándar en la industria bancaria para la validación de modelos. La aplicación Champion vs Challenger del laboratorio de Analytics Lane permite realizar este análisis completamente en el navegador, sin backend y sin que los datos salgan de tu dispositivo.
La pregunta natural es: si el Gini, y el resto de métricas, del nuevo modelo es mejor en el conjunto de test, ¿no es suficiente evidencia de que es superior?
No siempre. Hay varias razones por las que las métricas de validación estándar pueden ser engañosas:
El proceso en el que se comparar el modelo Champion frente al Challenger se puede hacer en dos fases.
El primer paso (el que implementa directamente la aplicación del laboratorio) es la comparativa offline: aplicar ambos modelos al mismo conjunto de datos y comparar sus predicciones sin necesidad de esperar resultados reales.
Esta comparativa responde a las siguientes preguntas fundamentales:
La comparativa offline no requiere esperar meses para conocer los defaults reales, se puede hacer en minutos con los datos disponibles. Es la primera evidencia de si el Challenger merece ser desplegado en un test en producción o no.
En entidades financieras con suficiente volumen y capacidad operacional el proceso Champion vs Challenger puede extenderse a producción: un porcentaje de los clientes recibe la decisión del Challenger (típicamente el 10-20%) y el resto la del Champion. Después de un período de observación (6-12 meses) se comparan los resultados reales.
Este test en producción va más allá de lo que implementa la aplicación del laboratorio, requiere infraestructura, procesos de negocio y un período de tiempo que una herramienta web no puede simular. Pero la comparativa offline que ofrece el laboratorio es el paso previo imprescindible: ninguna entidad sensata realiza en lanzamiento de un Challenger en producción sin antes haber analizado exhaustivamente su comportamiento con datos históricos.
La aplicación Champion vs Challenger del laboratorio de Analytics Lane ofrece múltiples métricas para analizar el rendimiento de ambos modelos y poder compararlos.
Las métricas estándar de validación aplicadas a ambos modelos sobre el mismo dataset:
| Métrica | Champion | Challenger | Diferencia |
|---|---|---|---|
| Gini | 0,581 | 0,643 | +0,062 |
| KS | 0,389 | 0,421 | +0,032 |
| AUC | 0,791 | 0,822 | +0,031 |
| Brier Score | 0,087 | 0,079 | −0,008 |
| ECE | 0,031 | 0,019 | −0,012 |
En este ejemplo el Challenger mejora en todas las métricas. Pero el análisis no termina aquí, las métricas agregadas pueden ocultar diferencias importantes en segmentos específicos.
La concordancia mide en qué porcentaje de casos los dos modelos asignan el mismo rango de riesgo a un cliente. Es la métrica más directa de cuánto cambiaría realmente la cartera si se sustituyera el Champion por el Challenger.
| Concordancia | Descripción |
|---|---|
| > 90% | Los modelos son muy similares — la sustitución tiene poco impacto operacional |
| 80% – 90% | Concordancia alta — diferencias en una minoría de casos |
| 70% – 80% | Concordancia moderada — diferencias significativas que merecen análisis detallado |
| < 70% | Baja concordancia — los modelos son sustancialmente distintos |
Una concordancia baja no es necesariamente mala, puede ser que el Challenger esté corrigiendo errores sistemáticos del Champion. Pero requiere un análisis cuidadoso de en qué casos difieren y cuál de los dos tiene razón.
La matriz de migración muestra cómo se redistribuyen los clientes entre los rangos de riesgo del Champion y del Challenger. Es la herramienta más informativa para entender las diferencias entre ambos modelos.
| Challenger: Alto riesgo | Challenger: Medio riesgo | Challenger: Bajo riesgo | Total Champion | |
|---|---|---|---|---|
| Champion: Alto riesgo | 1.850 | 320 | 30 | 2.200 |
| Champion: Medio riesgo | 280 | 3.940 | 480 | 4.700 |
| Champion: Bajo riesgo | 15 | 410 | 2.675 | 3.100 |
| Total Challenger | 2.145 | 4.670 | 3.185 | 10.000 |
La diagonal principal (en negrita) son los clientes que ambos modelos clasifican en el mismo rango, la concordancia. Las celdas fuera de la diagonal son los clientes donde los modelos discrepan.
En este ejemplo hay 320 clientes que el Champion clasifica como alto riesgo pero el Challenger como medio riesgo. Si el Challenger tiene razón, el Champion está siendo innecesariamente restrictivo con esos clientes, oportunidad de negocio perdida. Si el Champion tiene razón, el Challenger está siendo demasiado permisivo, riesgo no capturado.
Sin conocer los defaults reales de esos clientes no podemos saber cuál tiene razón. Pero podemos analizar el perfil de esos clientes para entender cuál de los dos parece más razonable, y eso es exactamente lo que permite la comparativa offline.
La curva de Lorenz (o curva de Gini) representada para ambos modelos en el mismo gráfico permite ver visualmente en qué parte de la distribución el Challenger mejora al Champion.
Si la curva del Challenger está sistemáticamente por encima de la del Champion en toda la distribución, la mejora es consistente. Si se cruzan, el Challenger es mejor en algunos tramos y peor en otros, la situación es más compleja y merece análisis segmentado.
Además de las métricas globales, la comparativa debe hacerse por segmentos relevantes de negocio:
Un Challenger que mejora globalmente pero empeora en el segmento de hipotecas de alto importe, el más sensible para la entidad, puede no ser una buena sustitución a pesar de las métricas agregadas.
Más allá de las métricas estadísticas, la comparativa Champion vs Challenger debe traducirse a términos financieros. ¿Cuánto vale en euros la mejora del Challenger?
Con los parámetros financieros del negocio, beneficio por operación buena, pérdida por impago (LGD), se puede estimar el impacto financiero del cambio de modelo:
Un Challenger con mejores métricas globales no siempre debe sustituir al Champion. Hay situaciones en las que mantener el Champion es la decisión correcta:
La aplicación Champion vs Challenger de Analytics Lane implementa la comparativa offline completa. El usuario carga dos archivos JSON, el modelo Champion y el modelo Challenger, ambos exportados desde el constructor de scorecards, y un dataset de clientes sobre el que aplicar ambos modelos.
La aplicación calcula automáticamente:
Todo funciona completamente en el navegador, los datos no salen del dispositivo del usuario, lo que es especialmente importante cuando los datos son clientes reales de una entidad financiera.
En entidades sujetas a supervisión bancaria (Banco de España, BCE, EBA) el proceso de sustitución de modelos de riesgo está regulado. Las guías de validación interna de modelos exigen que cualquier cambio de modelo esté documentado y justificado, incluyendo la comparativa con el modelo anterior.
El informe Champion vs Challenger es parte de la documentación estándar que el área de validación independiente revisa antes de aprobar la sustitución de un modelo. Los elementos que suelen exigirse son:
La aplicación del laboratorio genera automáticamente el informe PDF con todos estos elementos, listo para incluir en el expediente de validación.
El proceso Champion vs Challenger es la respuesta a una pregunta que las métricas de validación estándar no pueden responder por sí solas: ¿este nuevo modelo es realmente mejor que el actual en las condiciones en que operará?
Las métricas de validación dicen cuánto ha mejorado el Gini. El Champion vs Challenger dice cuántos clientes clasifican de forma distinta, en qué dirección, en qué segmentos, con qué impacto financiero estimado y con qué nivel de concordancia con el modelo que ha demostrado funcionar en producción.
Es la diferencia entre saber que un modelo es estadísticamente mejor y saber que es operacionalmente mejor, que mejorará las decisiones reales de crédito en la práctica, no solo las métricas en un conjunto de test.
En la industria bancaria ningún modelo se sustituye sin este análisis. Y con buena razón: los errores en la gestión del riesgo de crédito tienen consecuencias directas sobre las pérdidas del portfolio, el capital regulatorio y, en última instancia, la solvencia de la entidad.
La aplicación Champion vs Challenger del laboratorio de Analytics Lane pone este proceso al alcance de cualquier analista de riesgo, completamente en el navegador y sin que los datos salgan del dispositivo.
Nota: Las imágenes de este artículo fueron generadas utilizando un modelo de inteligencia artificial.
Comparar dos hipotecas parece sencillo: la que tenga el TIN más bajo es la mejor…
En un artículo anterior vimos la fórmula clásica del CLV junto a sus limitaciones. Una…
Y llegamos al final de una serie que había programado para ser de tres entradas.…
Un modelo de credit scoring no es un artefacto estático. Se construye en un momento…
En las seis entregas anteriores hemos paseado por casi todos los géneros del disparate económico:…
El Customer Lifetime Value (CLV) es, probablemente, la métrica más importante que puede calcular una…
This website uses cookies.