• Saltar al contenido principal
  • Skip to secondary menu
  • Saltar a la barra lateral principal
  • Saltar al pie de página
  • Inicio
  • Secciones
    • Ciencia de datos
    • Criptografía
    • Herramientas
    • Machine Learning
    • Noticias
    • Opinión
    • Productividad
    • Programación
      • JavaScript
      • Julia
      • Matlab
      • Python
      • R
  • Programación
    • JavaScript
    • Julia
    • Matlab
    • Python
    • R
  • Laboratorio
    • Estadística
      • Calculadora del Tamaño Muestral en Encuestas
      • Calculadora de estadísticos descriptivos
      • Test de normalidad
      • Calculadora de contrastes de hipotesis
      • Calculadora de tamano del efecto
      • Simulador de Regresión Lineal con Ruido
      • Visualizador de PCA
      • Visualizador de Series Temporales
      • Simulador de Regresión Logística
      • Simulador de K-Means
      • Simulador de DBSCAN
      • Detector de la Ley de Benford
      • Ajuste de Curvas
      • Calculadora de Matrices
    • Probabilidad
      • Calculadora de Probabilidad de Distribuciones
      • Calculadora de Probabilidades de Lotería
      • Simulador del Problema de Monty Hall
      • Simulador de la Estrategia Martingala
    • Finanzas
      • Calculadora de Préstamos e Hipotecas
      • Conversor TIN ↔ TAE
      • Calculadora DCA con ajuste por inflación
      • Calculadora XIRR con Flujos Irregulares
      • Simulador FIRE (Financial Independence, Retire Early)
    • Negocios
      • CLV
      • Scoring
    • Herramientas
      • Formateador / Minificador de JSON
      • Conversor CSV ↔ JSON
      • Comparador y Formateador de Texto y JSON
      • Formateador y Tester de Expresiones Regulares
      • Inspector de JWT
      • Generador y verificador de hashes
      • Codificador / Decodificador Base64 y URL
      • Conversor de bases numericas
      • Conversor de Timestamp Unix
      • Conversor de colores
      • Generador de UUIDs
    • Juegos
      • Tres en Raya
      • Nim con Q-Learning
    • Más
      • Método D’Hondt
      • Generador de Contraseñas Seguras
  • Noticias
  • Boletín
  • Contacto
  • Tienda
    • Libros
    • Equipamiento de oficina
    • Equipamiento en movilidad

Analytics Lane

Ciencia e ingeniería de datos aplicada

  • Ciencia de datos
  • Machine Learning
  • IA Generativa
  • Python
  • Pandas
  • NumPy
  • R
  • Excel

Dashboard CLV: cuatro modelos, un mismo dataset, conclusiones muy distintas

CLV, Laboratorio

septiembre 8, 2026 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 7 minutos

Los artículos anteriores de esta serie cubrieron cuatro formas de mirar el valor del cliente: la fórmula clásica de retención, la segmentación RFM, y los modelos probabilísticos BG/NBD y BG/BB. Cada uno responde a una pregunta distinta y descansa en supuestos distintos. El Dashboard del laboratorio los ejecuta todos sobre el mismo conjunto de datos, lo que permite algo que ningún aplicación individual puede mostrar: ver cómo discrepan entre sí cuando se les pide responder la misma pregunta.

Spoiler: discrepan mucho. Y entender por qué discrepan es más instructivo que cualquiera de los modelos por separado.

Puedes reproducir esta comparativa en la herramienta Dashboard del laboratorio, cargando cualquier CSV de transacciones o usando el dataset CDNOW de ejemplo.

Tabla de contenidos

  • 1. Qué hace el Dashboard
  • 2. La diferencia entre BG/NBD y Pareto/NBD
  • 3. La tabla comparativa: lo que realmente dicen los números
  • 4. Por qué CLV Simple da el número más alto
  • 5. Por qué BG/NBD y Pareto/NBD difieren tanto entre sí
  • 6. El CLV mediano cuenta una historia distinta al CLV medio
  • 7. RFM en esta comparación: la pieza que no calcula CLV
  • 8. Qué modelo “creer”
  • 9. El tiempo de cómputo también es información
  • 10. Cómo usar la herramienta
  • 11. Pareto/NBD: una incorporación futura al laboratorio

Qué hace el Dashboard

Sobre el mismo dataset, en el ejemplo, 6.919 filas de transacciones correspondientes a 2.357 clientes únicos, el Dashboard ejecuta hasta cuatro modelos:

  • CLV Simple: la fórmula clásica de retención y descuento, instantánea
  • RFM: segmentación descriptiva en menos de un segundo
  • BG/NBD + Gamma/Gamma: el modelo probabilístico para compras en tiempo continuo, 15-20 segundos
  • Pareto/NBD + Gamma/Gamma: una variante de BG/NBD que relaja uno de sus supuestos más fuertes, 40-60 segundos

Si tus datos son de campañas periódicas en lugar de compras continuas, el propio Dashboard te redirige a la herramienta BG/BB dedicada, porque ese modelo no encaja en esta comparación: opera sobre una estructura de tiempo fundamentalmente distinta, como vimos en el artículo anterior.

Desbalanceo de Clases en Credit Scoring: Por Qué Usamos Ponderación en lugar de Undersampling
En Analytics Lane
Desbalanceo de Clases en Credit Scoring: Por Qué Usamos Ponderación en lugar de Undersampling

La diferencia entre BG/NBD y Pareto/NBD

Antes de mirar los resultados conviene entender qué cambia entre estos dos modelos, porque son los más sofisticados de los cuatro y el Dashboard es la primera vez en la serie que aparecen lado a lado.

BG/NBD asume que el cliente puede abandonar únicamente justo después de una compra. Es un supuesto conveniente para las matemáticas del modelo, pero no siempre realista: un cliente puede simplemente dejar de comprar sin que haya una “compra de despedida” que dispare el abandono.

Pareto/NBD relaja ese supuesto: el abandono puede ocurrir en cualquier momento, no solo tras una compra. Esto lo hace más realista pero también computacionalmente más caro, de ahí que tarde 40-60 segundos frente a los 15-20 de BG/NBD en un entrenamiento típico, y la estimación de parámetros es más compleja.

En la práctica, ambos modelos suelen dar resultados similares cuando los clientes compran con cierta frecuencia. Las diferencias se acentúan cuando hay muchos clientes de compra única o muy esporádica, que es exactamente lo que vamos a ver en esta comparativa.

Publicidad


La tabla comparativa: lo que realmente dicen los números

Con fecha de corte 30/06/1998, horizonte de 52 semanas, margen bruto 100% y descuento anual 10%, el dataset CDNOW produce esta comparativa:

MétricaCLV SimpleRFMBG/NBD + GGPareto/NBD + GG
CLV medio55 €—29 €15 €
CLV total cartera128.699 €—68.682 €35.714 €
CLV mediano55 €—6 €8 €
CLV p90——68 €30 €
% clientes activos100,0%41,5%81,7%81,1%
Log-verosimilitud——-17.138,234-17.135,836
Tiempo de cómputo1 ms8 ms1,1 s902 ms

Lo primero que salta a la vista: el CLV medio varía por un factor de casi 4x entre el modelo más optimista (CLV Simple, 55 €) y el más conservador (Pareto/NBD, 15 €). Esto no es ruido ni un error de cálculo. Cada número es la respuesta correcta… a una pregunta distinta.

Por qué CLV Simple da el número más alto

CLV Simple usa una tasa de retención del 49% derivada del dataset, con una advertencia explícita de la herramienta: “Período corto. Usando tasa de repetición como proxy de retención anual.”. Es decir, el modelo está aproximando la retención anual a partir de un período de observación corto, lo cual tiende a sobrestimar la persistencia real del comportamiento de compra.

Además, CLV Simple asume implícitamente que el 100% de los clientes están “activos”, no tiene ningún concepto de probabilidad de abandono individual. Por eso muestra “% clientes activos: 100,0%” con asterisco: no es que el modelo haya verificado que todos están activos, es que el modelo no contempla la posibilidad de que no lo estén.

Esta es la limitación que ya señalamos en el primer artículo de la serie: CLV Simple trata a toda la cartera con una única tasa de retención homogénea. El resultado es un número alto porque no descuenta por la heterogeneidad real de comportamiento dentro de la cartera.

Por qué BG/NBD y Pareto/NBD difieren tanto entre sí

El % de clientes activos es casi idéntico entre ambos modelos probabilísticos (81,7% vs 81,1%), y el ajuste estadístico también es muy similar (log-verosimilitud -17.138,234 vs -17.135,836, una diferencia mínima). Sin embargo, el CLV medio de Pareto/NBD es prácticamente la mitad del de BG/NBD (15 € vs 29 €), y las transacciones esperadas también: 1.031 vs 1.967 transacciones totales para el horizonte completo.

¿Cómo pueden tener ajuste similar pero proyecciones tan distintas? La respuesta está en el supuesto que relajamos antes. Pareto/NBD, al permitir el abandono en cualquier momento (no solo tras una compra), tiende a asignar mayor probabilidad de abandono temprano a los clientes de baja frecuencia, que en CDNOW son la mayoría: recuerda del artículo de BG/NBD que el 52% de la cartera tiene x=0, una sola compra observada. Para ese segmento mayoritario, el supuesto más flexible de Pareto/NBD penaliza más la proyección de transacciones futuras, lo que arrastra el CLV medio hacia abajo aunque el ajuste global del modelo sea comparable.

Esto tiene una implicación práctica importante: en carteras con mucha proporción de compradores únicos o esporádicos, la elección entre BG/NBD y Pareto/NBD puede cambiar sustancialmente la valoración de la cartera, incluso cuando ambos modelos “ajustan igual de bien” según la verosimilitud.

Publicidad


El CLV mediano cuenta una historia distinta al CLV medio

Fíjate en la fila del CLV mediano: 6 € para BG/NBD, 8 € para Pareto/NBD, invirtiendo el orden que vimos en el CLV medio (29 € vs 15 €).

Esto es la huella de una distribución de CLV muy asimétrica, como ya anticipamos en el artículo de BG/NBD cuando vimos que el cliente de mayor CLV alcanzaba 32 veces el promedio de cartera. Cuando la distribución tiene esa cola larga, la media se infla por unos pocos clientes de muy alto valor mientras que la mediana, el cliente “típico”, puede moverse en dirección distinta entre modelos, porque la cola larga afecta de forma diferente a cada modelo según cómo trate la heterogeneidad de frecuencia.

El CLV p90 (68 € para BG/NBD, 30 € para Pareto/NBD) confirma el patrón: ambos modelos concentran fuertemente el valor en el percentil superior, pero en proporciones distintas. Para decisiones de negocio, mirar solo el CLV medio sin la mediana y el p90 puede llevar a conclusiones equivocadas sobre cuántos clientes realmente sostienen el valor de la cartera.

RFM en esta comparación: la pieza que no calcula CLV

El RFM aparece en la tabla con guiones en casi todas las filas de CLV, y eso es exactamente lo esperado: como vimos en su artículo dedicado, RFM no estima valor futuro, clasifica comportamiento pasado. El único número que aporta aquí es el 41,5% de “clientes activos”, en este contexto, probablemente la proporción de clientes en segmentos de comportamiento reciente positivo (Campeones, Leales, Potencialmente leales), una cifra bien distinta del 81,7% de BG/NBD porque mide algo conceptualmente diferente: actividad observada en el pasado reciente, no probabilidad de actividad futura.

Es un recordatorio útil de que no todos los enfoques de esta suite responden la misma pregunta, aunque todos aparezcan juntos en este dashboard.

Qué modelo “creer”

La pregunta natural después de ver esta tabla es: ¿cuál de los cuatro números es el correcto?

La respuesta honesta es que depende de qué decisión vas a tomar con él:

  • Para presupuesto de marketing agregado a nivel cartera, los modelos probabilísticos (BG/NBD o Pareto/NBD) son más defendibles que CLV Simple, porque incorporan heterogeneidad real de comportamiento en lugar de una tasa de retención única.
  • Para decidir entre BG/NBD y Pareto/NBD específicamente, la guía es la proporción de compradores únicos o esporádicos en tu cartera. Con alta proporción de compra única (como CDNOW), la diferencia entre ambos modelos es material y vale la pena ejecutar los dos, como hace este Dashboard, en lugar de asumir que uno es automáticamente mejor.
  • Para decisiones a nivel de cliente individual, a quién dirigir una campaña de retención, por ejemplo, ninguno de los agregados de esta tabla importa tanto como la tabla de clientes individuales de BG/NBD o Pareto/NBD, con su P(alive) y CLV específico por cliente.
  • Para entender la estructura de la cartera antes de aplicar cualquier modelo cuantitativo, RFM sigue siendo el punto de partida correcto.

Publicidad


El tiempo de cómputo también es información

La fila de tiempo de cómputo no es un detalle técnico menor: CLV Simple y RFM corren en milisegundos porque son cálculos cerrados; BG/NBD y Pareto/NBD requieren optimización numérica de la verosimilitud, de ahí el salto a más de un segundo. Si vas a ejecutar estos modelos repetidamente, por ejemplo, recalculando CLV cada semana sobre una cartera grande, esta diferencia de coste computacional es un factor real a la hora de decidir qué modelo automatizar en producción frente a cuál ejecutar puntualmente para un análisis profundo.

Captura de pantalla con la comparativa de los resultados en el Dashboard CLV del laboratorio de Analytics para los datos CDNow
Comparativa de los resultados en el Dashboard CLV del laboratorio de Analytics para los datos CDNow

Cómo usar la herramienta

El Dashboard del laboratorio permite cargar cualquier CSV de transacciones y ejecutar los cuatro modelos con un solo conjunto de parámetros de configuración: fecha de corte, unidad de tiempo, horizonte, margen bruto y tasa de descuento. La tabla comparativa y la distribución de CLV por modelo se generan automáticamente.

Un ejercicio útil: ejecuta el Dashboard primero con tu fecha de corte natural, y después recórtala varios meses antes para usar el período restante como validación. Comparar cómo cambian las proyecciones de cada modelo según el período de entrenamiento es la forma más rigurosa de decidir en cuál confiar para tu negocio específico.

Pareto/NBD: una incorporación futura al laboratorio

Este Dashboard ha presentado Pareto/NBD por primera vez en la serie, comparándolo de forma agregada con BG/NBD. De momento aparece aquí solo como una pieza más de la comparativa; su lógica interna, qué significa exactamente relajar el supuesto de “abandono solo tras compra” y cómo se interpretan sus parámetros, quedará para un artículo dedicado cuando la herramienta correspondiente esté incorporada al laboratorio.

Imagen de Pexels en Pixabay

¿Te ha parecido de utilidad el contenido?

¡Puntúalo entre una y cinco estrellas!

Puntuación promedio 0 / 5. Votos emitidos: 0

Ya que has encontrado útil este contenido...

¡Síguenos en redes sociales!

¡Siento que este contenido no te haya sido útil!

¡Déjame mejorar este contenido!

Dime, ¿cómo puedo mejorar este contenido?

Publicidad


Publicaciones relacionadas

  • Desbalanceo de Clases en Credit Scoring: Por Qué Usamos Ponderación en lugar de Undersampling
  • Por Qué las Contraseñas Largas son más Seguras que las Complejas
  • Gini, KS y AUC: Cómo Medir la Calidad de un Modelo de Credit Scoring
  • BG/NBD + Gamma/Gamma: el modelo probabilístico para CLV en compras continuas
  • Curiosidad: De dónde vienen foo, bar y foobar
  • Curiosidad: El “bug”, la polilla y la leyenda de Grace Hopper
  • Curiosidad: Por qué la criptografía habla siempre de Alice y Bob
  • BG/BB: el modelo de CLV para compras en períodos discretos

Publicado en: Ciencia de datos Etiquetado como: CLV, Laboratorio

Interacciones con los lectores

Deja una respuesta Cancelar la respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

I accept the Terms and Conditions and the Privacy Policy

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

Barra lateral principal

Suscríbete a nuestro boletín

Suscríbete al boletín semanal para estar al día de todas las publicaciones.

Política de Privacidad

Analytics Lane en redes sociales

  • Amazon
  • Bluesky
  • Facebook
  • GitHub
  • Instagram
  • Mastodon
  • Pinterest
  • RSS
  • Telegram
  • Tumblr
  • Twitter
  • YouTube

Publicidad

Entradas recientes

Dashboard CLV: cuatro modelos, un mismo dataset, conclusiones muy distintas

septiembre 8, 2026 Por Daniel Rodríguez

Curiosidad: Por qué la criptografía habla siempre de Alice y Bob

septiembre 3, 2026 Por Daniel Rodríguez

Desbalanceo de Clases en Credit Scoring: Por Qué Usamos Ponderación en lugar de Undersampling

septiembre 1, 2026 Por Daniel Rodríguez

Publicidad

Es tendencia

  • Los valores numéricos en los ordenadores: Entendiendo enteros, flotantes y más publicado el mayo 9, 2025 | en Ciencia de datos
  • pandas Pandas: Convertir una columna en el índice publicado el julio 29, 2021 | en Python
  • Ver el código de cualquier función en Python publicado el noviembre 27, 2023 | en Python
  • Test de causalidad de Wiener-Granger publicado el noviembre 18, 2019 | en Ciencia de datos
  • NumPy NumPy: Crear matrices vacías en NumPy y adjuntar filas o columnas publicado el enero 11, 2021 | en Python

Publicidad

Lo mejor valorado

4.9 (24)

Seleccionar filas y columnas en Pandas con iloc y loc

4.6 (16)

Archivos JSON con Python: lectura y escritura

4.4 (14)

Ordenación de diccionarios en Python mediante clave o valor

4.7 (13)

Operaciones de filtrado de DataFrame con Pandas en base a los valores de las columnas

4.1 (11)

Aplicar el método D’Hondt en Excel

Comentarios recientes

  • Daniel Rodríguez en Los récords con asterisco, o la épica del titular sin contexto – El bestiario de los indicadores económicos absurdos (parte 8 y final)
  • Juan en Los récords con asterisco, o la épica del titular sin contexto – El bestiario de los indicadores económicos absurdos (parte 8 y final)
  • bif en JSON en bases de datos: cuándo es buena idea y cuándo no
  • bif en Cómo desinstalar Oracle Database 19c en Windows
  • M. Pilar en Cómo eliminar las noticias en Windows 11 y recuperar tu concentración

Publicidad


Footer

Analytics Lane

  • Acerca de Analytics Lane
  • Boletín de noticias
  • Contacto
  • Libros
  • Lo más popular
  • Noticias
  • Tienda
  • Tiendas afiliadas

Secciones

  • Ciencia de datos
  • Criptografía
  • Herramientas
  • Machine Learning
  • Opinión
  • Productividad
  • Programación
  • Reseñas

Sobre de Analytics Lane

En Analytics Lane tratamos de explicar los principales conceptos de la ciencia e ingeniería de datos con un enfoque práctico. Los principales temas tratados son ciencia de datos, ingeniería de datos, inteligencia artificial, machine learning, deep learning y criptografía. Además, también se habla de los principales lenguajes de programación y herramientas utilizadas por los científicos e ingenieros de datos.

Copyright © 2018-2026 Analytics Lane ·Términos y condiciones ·Política de Cookies ·Política de Privacidad ·Herramientas de privacidad ·Contacto