• Saltar al contenido principal
  • Skip to secondary menu
  • Saltar a la barra lateral principal
  • Saltar al pie de página
  • Inicio
  • Secciones
    • Ciencia de datos
    • Criptografía
    • Herramientas
    • Machine Learning
    • Noticias
    • Opinión
    • Productividad
    • Programación
      • JavaScript
      • Julia
      • Matlab
      • Python
      • R
  • Programación
    • JavaScript
    • Julia
    • Matlab
    • Python
    • R
  • Laboratorio
    • Estadística
      • Calculadora del Tamaño Muestral en Encuestas
      • Calculadora de estadísticos descriptivos
      • Test de normalidad
      • Calculadora de contrastes de hipotesis
      • Calculadora de tamano del efecto
      • Simulador de Regresión Lineal con Ruido
      • Visualizador de PCA
      • Visualizador de Series Temporales
      • Simulador de Regresión Logística
      • Simulador de K-Means
      • Simulador de DBSCAN
      • Detector de la Ley de Benford
      • Ajuste de Curvas
      • Calculadora de Matrices
    • Probabilidad
      • Calculadora de Probabilidad de Distribuciones
      • Calculadora de Probabilidades de Lotería
      • Simulador del Problema de Monty Hall
      • Simulador de la Estrategia Martingala
    • Finanzas
      • Calculadora de Préstamos e Hipotecas
      • Conversor TIN ↔ TAE
      • Calculadora DCA con ajuste por inflación
      • Calculadora XIRR con Flujos Irregulares
      • Simulador FIRE (Financial Independence, Retire Early)
    • Negocios
      • CLV
      • Scoring
    • Herramientas
      • Formateador / Minificador de JSON
      • Conversor CSV ↔ JSON
      • Comparador y Formateador de Texto y JSON
      • Formateador y Tester de Expresiones Regulares
      • Inspector de JWT
      • Generador y verificador de hashes
      • Codificador / Decodificador Base64 y URL
      • Conversor de bases numericas
      • Conversor de Timestamp Unix
      • Conversor de colores
      • Generador de UUIDs
    • Juegos
      • Tres en Raya
      • Nim con Q-Learning
    • Más
      • Método D’Hondt
      • Generador de Contraseñas Seguras
  • Noticias
  • Boletín
  • Contacto
  • Tienda
    • Libros
    • Equipamiento de oficina
    • Equipamiento en movilidad

Analytics Lane

Ciencia e ingeniería de datos aplicada

  • Ciencia de datos
  • Machine Learning
  • IA Generativa
  • Python
  • Pandas
  • NumPy
  • R
  • Excel

Solucionar la multicolinealidad con VIF

Machine learning, Scikit-Learn

abril 22, 2020 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 4 minutos

La multicolinealidad es un problema que afecta negativamente a los modelos de regresión. Cuando existe una relación entre algunas de las variables independientes tanto el proceso de entrenamiento como la interpretación de los modelos se hace más complicado. Por un lado, en el entrenamiento existe más de un parámetro que mejorar las predicciones en el mismo sentido, ya que sus variables asociadas están relacionadas. Por otro lado, no en el conjunto de datos no existen ejemplos en los que esas variables se mueven independientemente. Lo que nos lleva a unos parámetros con menor p-valor. En esta entrada vamos a ver cómo solucionar la multicolinealidad con VIF (Factor de Inflación de Varianza, del inglés “Variance Inflation Factor”).

Factor de Inflación de Varianza

El Factor de Inflación de Varianza (VIF, del inglés “Variance Inflation Factor”) de una variable independiente es en un valor que indica el grado de indecencia de esa variable. Para obtener el VIF en primer lugar ha de calcular la regresión lineal de una variable independiente frente a resto de variables independientes. Posteriormente se usa el R^2 de esta regresión para obtener el VIF de esta variable

VIF = \frac{1}{1-R^2}

Al fijarnos en la definición de VIF podemos ver que una variable independiente es realmente independiente del resto si el valor de VIF es igual a la unidad. Esto es el valor de R^2 es cero. Por otro lado, si el valor tiende a infinito la variable no es independiente, sino que se puede calcular a partir del resto de variables independientes.

Por qué migrar tus proyectos TypeScript a ES Modules en 2026
En Analytics Lane
Por qué migrar tus proyectos TypeScript a ES Modules en 2026

Utilizar VIF para solucionar la multicolinealidad

Una vez obtenido el valor de VIF para cada una de las variables independientes de un conjunto de datos es posible identificar las variables más dependientes y eliminarlas. El proceso que se debería seguir para solucionar la multicolinealidad con VIF es:

  1. Obtener el VIF para todas las variables independientes
  2. Identificar la que tiene el valor máximo de VIF, solamente una, aunque existan dos o más con el mismo valor
  3. Si esta variable supera un valor umbral, por ejemplo 5, eliminarla y volver al punto 1. En caso contrario se termina el proceso.

Es importante eliminar únicamente una variable en cada paso, ya que en caso contrario se podría eliminar todas las variables relacionadas. Por ejemplo, si tenemos una variable que es dos veces otra, en tal caso ambas tendrán un valor de VIF que tiende a infinito, ya que el R^2 es igual a uno. Si eliminamos ambas se eliminan todas las ocurrencias de esa variable, que no es lo que se desea.

Los valore umbrales típicos que se suelen utilizara son entre 5 y 10, siendo más exigentes los valore más bajos.

Publicidad


Implementación en Python

La eliminación de características se puede implementar fácilmente en Python, solamente hay que importar LinearRegression de Scikit Learn. En primer lugar, se tiene que hacer un método para calcular el VIF al que se le debe de pasar las variables independientes y las columnas a probar. Una función que puede devolver un vector con los valores de VIF.

Una vez se crea esta función simplemente se tiene que implementar un bucle while que elimine las características con mayor valor de VIF siempre que esta supere el límite marcado. Esto es lo que se muestra en el siguiente ejemplo.

from sklearn.datasets import load_boston
from sklearn.linear_model import LinearRegression

def calculate_vif(X, used_cols):
    VIF = []

    for col in used_cols:
        cols = used_cols.copy()
        cols.remove(col)

        model = LinearRegression().fit(X[:, cols], X[:, col])
        VIF.append(1 / (1 - model.score(X[:, cols], X[:, col])))
    
    return VIF


X, y = load_boston(return_X_y=True)
max_vif = 5
used_cols = list(range(X.shape[1]))

VIF = calculate_vif(X, used_cols)

while max(VIF) > max_vif:
    col = VIF.index(max(VIF))
    
    print('Elimina columna:', used_cols[col], 'con VIF', max(VIF));
    used_cols.pop(col)

    VIF = calculate_vif(X, used_cols)

En este caso se ha importado los datos de Boston que existe en Scikit Learn. Una vez aplicado el método se puede ver que se ha eliminado la columna 9 que tiene un valor de VIF cercano a 9. Una vez elimina esta columna ya no es necesario eliminar más.

En este ejemplo se ha de notar que en la primera iteración hay dos columnas con VIF que supera el límite de 5. La columna 8, con un valor de 7 y la 9 con un valor de 9. Al eliminar la columna 9 la columna 8 ya es independiente. Lo que refuerza lo que se ha comentado, solamente se tiene que eliminar una variable en cada iteración.

Conclusiones

En esta entrada se ha visto un método para solucionar la multicolinealidad con VIF. Siendo la multicolinealidad un problema que afecta negativamente al rendimiento de los modelos de regresión. Por lo que si sabemos como identificar y eliminar la variables en las que existe multicolinealidad podremos evitar los efectos no deseados.

Imagen de wei zhu en Pixabay

¿Te ha parecido de utilidad el contenido?

¡Puntúalo entre una y cinco estrellas!

Puntuación promedio 5 / 5. Votos emitidos: 1

Ya que has encontrado útil este contenido...

¡Síguenos en redes sociales!

¡Siento que este contenido no te haya sido útil!

¡Déjame mejorar este contenido!

Dime, ¿cómo puedo mejorar este contenido?

Publicaciones relacionadas

  • Por qué migrar tus proyectos TypeScript a ES Modules en 2026
  • Actualizar expresslanets a ES Modules con tsx y Vitest
  • Migrar tslane a un paquete dual CommonJS y ESM con tsup y Vitest
  • Errores comunes al interpretar resultados estadísticos
  • Método del codo: interpretación correcta y limitaciones
  • Dashboard CLV: cuatro modelos, un mismo dataset, conclusiones muy distintas
  • Pareto/NBD: cuando el abandono silencioso cambia el CLV
  • Cómo construir tu primer scorecard paso a paso
  • Docker Compose: el día a día. Cómo ver qué funciona y qué no

Publicado en: Ciencia de datos, Python Etiquetado como: Machine learning, Scikit-Learn

Interacciones con los lectores

Deja una respuesta Cancelar la respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

I accept the Terms and Conditions and the Privacy Policy

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

Barra lateral principal

Suscríbete a nuestro boletín

Suscríbete al boletín semanal para estar al día de todas las publicaciones.

Política de Privacidad

Analytics Lane en redes sociales

  • Amazon
  • Bluesky
  • Facebook
  • GitHub
  • Instagram
  • Mastodon
  • Pinterest
  • RSS
  • Telegram
  • Tumblr
  • Twitter
  • YouTube

Publicidad

Entradas recientes

Docker Compose: el día a día. Cómo ver qué funciona y qué no

octubre 6, 2026 Por Daniel Rodríguez

Migrar tslane a un paquete dual CommonJS y ESM con tsup y Vitest

octubre 1, 2026 Por Daniel Rodríguez

Cómo construir tu primer scorecard paso a paso

septiembre 29, 2026 Por Daniel Rodríguez

Publicidad

Es tendencia

  • Gráficos de barras en Matplotlib publicado el julio 5, 2022 | en Python
  • Cómo comparar datos con barras en Matplotlib: agrupadas, apiladas y porcentuales publicado el mayo 12, 2026 | en Python
  • El método de Muller e implementación en Python publicado el marzo 24, 2023 | en Ciencia de datos
  • Visualización de árboles de decisión en Python con PyDotPlus publicado el noviembre 9, 2018 | en Python
  • Método del codo (Elbow method) para seleccionar el número óptimo de clústeres en K-means publicado el junio 9, 2023 | en Ciencia de datos

Publicidad

Lo mejor valorado

4.9 (24)

Seleccionar filas y columnas en Pandas con iloc y loc

4.6 (16)

Archivos JSON con Python: lectura y escritura

4.4 (14)

Ordenación de diccionarios en Python mediante clave o valor

4.7 (13)

Operaciones de filtrado de DataFrame con Pandas en base a los valores de las columnas

4.1 (11)

Aplicar el método D’Hondt en Excel

Comentarios recientes

  • Daniel Rodríguez en Curiosidad: La Paradoja de Simpson, o por qué no siempre debes fiarte de los promedios
  • Hatepi en Curiosidad: La Paradoja de Simpson, o por qué no siempre debes fiarte de los promedios
  • Daniel Rodríguez en Los récords con asterisco, o la épica del titular sin contexto – El bestiario de los indicadores económicos absurdos (parte 8 y final)
  • Juan en Los récords con asterisco, o la épica del titular sin contexto – El bestiario de los indicadores económicos absurdos (parte 8 y final)
  • bif en JSON en bases de datos: cuándo es buena idea y cuándo no

Publicidad


Footer

Analytics Lane

  • Acerca de Analytics Lane
  • Boletín de noticias
  • Contacto
  • Libros
  • Lo más popular
  • Noticias
  • Tienda
  • Tiendas afiliadas

Secciones

  • Ciencia de datos
  • Criptografía
  • Herramientas
  • Machine Learning
  • Opinión
  • Productividad
  • Programación
  • Reseñas

Sobre de Analytics Lane

En Analytics Lane tratamos de explicar los principales conceptos de la ciencia e ingeniería de datos con un enfoque práctico. Los principales temas tratados son ciencia de datos, ingeniería de datos, inteligencia artificial, machine learning, deep learning y criptografía. Además, también se habla de los principales lenguajes de programación y herramientas utilizadas por los científicos e ingenieros de datos.

Copyright © 2018-2026 Analytics Lane ·Términos y condiciones ·Política de Cookies ·Política de Privacidad ·Herramientas de privacidad ·Contacto