Ciencia de datos

La ciencia de datos es un área de conocimiento interdisciplinar en el cual se utilizan procesos para recopilar, preparar, analizar, visualizar y modelar datos para extraer todo su valor. Pudiéndose emplear tanto con conjuntos de datos estructurados como no estructurados. Los científicos de datos, los profesionales de esta área deben poseer grandes conocimientos de estadística e informática. Además de conocimiento de los procesos que están modelando.

Con la ciencia de datos es posible revelar tendencias y obtener información para que tanto las empresas como las instituciones puedan tomar mejores decisiones. Basando estas así en conocimiento validado no en intuiciones.

Las publicaciones de esta sección abarca diferentes temas de áreas como la estadística, la minería de datos, el aprendizaje automático y la analítica predictiva.

Detectando anomalías con Angle-Based Outlier Detection (ABOD)

junio 21, 2024 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 6 minutos

La detección de anomalías (también conocidos por su nombre en inglés outliers) son métodos de aprendizaje automático claves en múltiples sectores. Facilitando la identificación de eventos como fraudes, errores en los datos o eventos raros. Entre los métodos existentes para ello, Angle-Based Outlier Detection (ABOD) destaca con un enfoque único al usar los ángulos entre los … [Leer más...] acerca de Detectando anomalías con Angle-Based Outlier Detection (ABOD)

Eliminación de la multicolinealidad con PCA en modelos de regresión

junio 14, 2024 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 7 minutos

En aprendizaje automático, la multicolinealidad es un problema habitual que suele afectar a la precisión y la interpretabilidad de los modelos de regresión. Lo que reduce la utilidad de estos. La multicolinealidad aparece cuando dos o más variables independientes están altamente correlacionadas, dificultando determinar el impacto individual de cada una de estas variables en la … [Leer más...] acerca de Eliminación de la multicolinealidad con PCA en modelos de regresión

Entendiendo las Cópulas en estadística

junio 7, 2024 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 5 minutos

Para muchas aplicaciones puede ser necesario explicar cómo se relacionan entre sí diferentes variables aleatorias de cara a comprender en detalle fenómenos complejos. Algo que es clave para la toma de decisiones informadas. Para lo que la estadística ofrece herramientas como las Cópulas. Las cópulas son unas herramientas matemáticas con las que es posible modelar la estructura … [Leer más...] acerca de Entendiendo las Cópulas en estadística

Explorando Clustering-Based Local Outlier Factor (CBLOF) para la detección de anomalías

mayo 31, 2024 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 7 minutos

La detección de anomalías es una parte del aprendizaje automático resulta clave en múltiples aplicaciones. Poder saber qué registros son atípicos de un conjunto de datos resulta fundamental en sectores como la seguridad informática, el mantenimiento predictivo o la detección de fraudes. Uno de los algoritmos que se pueden emplear en estos casos es Clustering-Based Local Outlier … [Leer más...] acerca de Explorando Clustering-Based Local Outlier Factor (CBLOF) para la detección de anomalías

Análisis de correlación para modelos de regresión: Cómo eliminar la multicolinealidad y mejorar la robustez

mayo 24, 2024 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 7 minutos

Los modelos de regresión son una de las técnicas estadísticas más utilizadas para comprender y predecir las relaciones entre las variables. Siendo ampliamente utilizadas en análisis de datos y aprendizaje automático. Sin embargo, cuando las variables que se desean utilizar para la construcción del modelo están altamente correlacionadas, aparece el problema de la … [Leer más...] acerca de Análisis de correlación para modelos de regresión: Cómo eliminar la multicolinealidad y mejorar la robustez

La correlación de Pearson

mayo 17, 2024 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 4 minutos

La correlación de Pearson es una medida estadística que evalúa la relación lineal entre dos variables continuas. Su valor puede variar entre -1 y 1, donde -1 indica una correlación negativa perfecta, 0 ninguna correlación, y 1 una correlación positiva perfecta. Siendo una herramienta fundamental en el campo de la estadística para determinar la fuerza y la dirección de la … [Leer más...] acerca de La correlación de Pearson

Descubriendo anomalías con HBOS (Histogram-Based Outlier Score)

mayo 10, 2024 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 6 minutos

Las anomalías, también conocidas como ”outliers”, son puntos que se desvían significativamente de la mayoría de los otros puntos en un conjunto de datos. Por lo que saber detectarlas es una tarea clave en múltiples aplicaciones. Empezando por la seguridad informática, donde los ataques tienen un patrón diferente al uso legítimo de los recursos, hasta en mantenimiento … [Leer más...] acerca de Descubriendo anomalías con HBOS (Histogram-Based Outlier Score)

Introducción al Análisis de Componentes Principales (PCA)

mayo 3, 2024 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 6 minutos

El Análisis de Componentes Principales (PCA) es una técnica ampliamente utilizado en aprendizaje automático. Se utiliza para reducir la dimensionalidad (el número de variables o columnas) de los conjuntos de datos manteniendo al mismo tiempo la mayor cantidad de información posible. PCA transforma las variables originales en otras nuevas, llamadas componentes principales, … [Leer más...] acerca de Introducción al Análisis de Componentes Principales (PCA)

Desmitificando Elliptic Envelope: Una exploración de la detección de anomalías con estimación de covarianza elíptica

abril 26, 2024 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 6 minutos

Entre los algoritmos de Machine Learning para la detección de anomalías Elliptic Envelope destaca por su capacidad para modelar la distribución de los datos utilizando una elipse en el espacio de características. Un enfoque efectivo para identificar anomalías en conjuntos de datos multivariados donde la mayoría de los datos se distribuyen de manera normal. Lo que lo convierte … [Leer más...] acerca de Desmitificando Elliptic Envelope: Una exploración de la detección de anomalías con estimación de covarianza elíptica

La distancia de Mahalanobis

abril 19, 2024 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 4 minutos

Dentro del aprendizaje automático, es habitual tener que trabajar con conjuntos de datos multidimensionales donde las variables están interrelacionadas. En estos casos, para cuantificar la similitud entre puntos, es aconsejable tener en cuenta la estructura de los propios datos. Algo que no sucede en las distancias usadas habitualmente como la Euclídea. Una métrica que si tiene … [Leer más...] acerca de La distancia de Mahalanobis

Explorando Local Outlier Factor (LOF): Un enfoque eficaz para la detección de anomalías

abril 12, 2024 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 5 minutos

Los modelos de detección de anomalías es una parte del aprendizaje automático en la que cada vez existe un mayor interés. Siendo una tarea crítica en diferentes áreas como la seguridad informática, el mantenimiento predictivo o el monitoreo de la salud. Uno de los algoritmos más populares para esta tarea es Local Outlier Factor (LOF). Este algoritmo identifica las anomalías de … [Leer más...] acerca de Explorando Local Outlier Factor (LOF): Un enfoque eficaz para la detección de anomalías

Introducción a XGBoost: Instalación y primeros pasos

abril 5, 2024 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 4 minutos

XGBoost (Extreme Gradient Boosting) es un algoritmo que ha ganado popularidad entre los científicos de datos debido a su potencia y eficiencia. En esta entrada se explicará qué es XGBoost, cómo instalarlo en Python y un cómo se puede usar en un caso práctico.¿Qué es XGBoost?XGBoost es un algoritmo de aprendizaje supervisado basado en árboles de decisión, diseñado para … [Leer más...] acerca de Introducción a XGBoost: Instalación y primeros pasos