Ciencia de datos

¿Qué es el sesgo en aprendizaje automático?

En los procesos de toma de decisiones el término sesgo tiene generalmente connotaciones negativas. No es deseable que un proceso automático lo tenga de ningún tipo. La palabra sesgo procede de sesgar, un verbo que hace referencia a torcer o atravesar algo hacia uno de sus lados. Por lo que una decisión sesgada, que se tuerce en algún sentido, no es deseable. Los modelos de aprendizaje automático (“machine learnig”) no están exentos de este problema, ya que son desarrollados por personas. Así es importante conocer qué es el sesgo en aprendizaje automático y cómo se puede minimizar su aparición.

El sesgo en aprendizaje automático

El sesgo en aprendizaje automático, también conocido como sesgo de modelo, aparece cuando un modelo produce resultados erróneos de forma sistemática. La aparición de estos es debida a que los modelos son desarrollados por personas. Las cuales tiene tienen preferencias que transfieren a los modelos. Tanto sean conscientes como inconscientes. Muchas veces estas pueden pasar desapercibidos hasta que se los modelos se ponen en producción.

Origen de los sesgos

Una de las principales fuentes de sesgos de los modelos de aprendizaje automático son los procesos de capturar de datos. Estos datos que posteriormente se emplearán para el entrenamiento de los modelos. Un proceso cuyo resultado depende de la calidad, la objetividad y el tamaño de los conjuntos de datos empleados. Así, si los datos utilizados no son representan de forma objetiva la realidad, los modelos resultantes del proceso tendrán necesariamente sesgo.

Esto puede estar causado por una mala planificación del proceso por los responsables. O una falta de análisis crítico. Por lo que es importante saber cómo preguntar para evitar la aparición de sesgos.

Importancia de eliminar los sesgos

Los modelos de aprendizaje automático se utilizan diariamente para la toma de decisiones. Desde tareas triviales como qué anuncio se le presenta al visitante de una página web, hasta otras que pueden afectar a la vida de las personas como a quien se le concede un préstamo y a quien no. O, incluso, con implicaciones que pueden ser de vida y muerte como un diagnóstico médico.

Conclusiones

Es importante tomar consciencia del hecho que los modelos de aprendizaje automático pueden ser entrenados con sesgo. Por lo que es necesario poner en marcha todas las medidas posibles para evitarlo. La primera es garantizar que los datos utilizados son representativos de la realidad, no obtenidos únicamente en un subconjunto de la población en la que se van a aplicar. Una vez hecho esto los científicos de datos podrán desarrollar modelos que presenten el menor sesgo posible.

Es necesario recordar que los modelos de aprendizaje automático no piensan ni tienen sentimientos. Por lo que es una tarea de los científicos de datos pensar por ellos para evitar la existencia de sesgos.

Imágenes: Pixabay

¿Te ha parecido de utilidad el contenido?

Daniel Rodríguez

Share
Published by
Daniel Rodríguez

Recent Posts

BG/BB: el modelo de CLV para compras en períodos discretos

Los dos artículos anteriores de la serie cubrieron BG/NBD, el modelo para negocios donde el…

18 horas ago

Por Qué las Contraseñas Largas son más Seguras que las Complejas

"Tu contraseña debe tener al menos 8 caracteres, una mayúscula, un número y un símbolo…

6 días ago

Gini, KS y AUC: Cómo Medir la Calidad de un Modelo de Credit Scoring

Cuando un analista de riesgo presenta un nuevo scorecard ante el comité de dirección, la…

1 semana ago

Curiosidad: De dónde vienen foo, bar y foobar

Si revisáis código o documentación de otros programadores, tarde o temprano os toparéis con dos…

2 semanas ago

BG/NBD + Gamma/Gamma: el modelo probabilístico para CLV en compras continuas

Los dos artículos anteriores cubrieron el CLV clásico —una fórmula útil pero que trata a…

2 semanas ago

Errores habituales al trabajar con DataFrames grandes en Pandas (y cómo evitarlos)

Hay un momento muy concreto en la vida de casi todo análisis: el código que…

3 semanas ago

This website uses cookies.