Una de las áreas más atractivas para los criminales es el sector bancario, debido a que gestiona grandes cantidades de dinero y datos privados de los clientes. La disponibilidad de datos permite que el aprendizaje automático sea una herramienta clave para la detección del fraude en banca. Ayudando a evitar pérdidas financieras y de reputación tanto para las entidades … [Leer más...] acerca de Aprendizaje automático para la detección del fraude en banca
Ciencia de datos
La ciencia de datos es un área de conocimiento interdisciplinar en el cual se utilizan procesos para recopilar, preparar, analizar, visualizar y modelar datos para extraer todo su valor. Pudiéndose emplear tanto con conjuntos de datos estructurados como no estructurados. Los científicos de datos, los profesionales de esta área deben poseer grandes conocimientos de estadística e informática. Además de conocimiento de los procesos que están modelando.
Con la ciencia de datos es posible revelar tendencias y obtener información para que tanto las empresas como las instituciones puedan tomar mejores decisiones. Basando estas así en conocimiento validado no en intuiciones.
Las publicaciones de esta sección abarca diferentes temas de áreas como la estadística, la minería de datos, el aprendizaje automático y la analítica predictiva.
Prueba exacta de Fisher
La semana pasada hemos vistos la prueba de independencia de Chi-cuadrado, con la que se puede comprobar la independencia de dos variables cuantitativas. En dicha entrada se comentó que cuando la frecuencia de alguna de las categorías de las variables es pequeña no es aconsejable emplear esta prueba, sino que se debería usar la prueba exacta de Fisher. La cual vamos a explicar … [Leer más...] acerca de Prueba exacta de Fisher
Prueba de independencia de Chi-cuadrado
En unas entradas anteriores hemos visto los efectos de la multicolinealidad en las variables cuantitativas y como identificar la relación mediante el uso de VIF. Para las variables categóricas también existen pruebas para comprobar si existe relación entre dos, es decir, si los valores de una variable cualitativa dependen de otra. Uno de la prueba más populares es la prueba de … [Leer más...] acerca de Prueba de independencia de Chi-cuadrado
Cursos on-line para comenzar en ciencia de datos
Ahora que medio mundo se encuentra confinado por el coronavirus puede ser el momento para realizar cursos con el que aprender nuevas habilidades o reforzar otras. En la situación actual una de las posibles soluciones es realizar un MOOC ya que no requiere asistir a clase y, en una gran cantidad de los casos, se pueden realizar de forma completamente gratuita. Aunque acceder a … [Leer más...] acerca de Cursos on-line para comenzar en ciencia de datos
Solucionar la multicolinealidad con VIF
La multicolinealidad es un problema que afecta negativamente a los modelos de regresión. Cuando existe una relación entre algunas de las variables independientes tanto el proceso de entrenamiento como la interpretación de los modelos se hace más complicado. Por un lado, en el entrenamiento existe más de un parámetro que mejorar las predicciones en el mismo sentido, ya que sus … [Leer más...] acerca de Solucionar la multicolinealidad con VIF
Entrenamiento, validación y test con Scikit-learn
Entre las herramientas para la selección de modelos de Scikit-learn nos podemos encontrar con la función train_test_split. Una función que nos permite dividir un conjunto de datos en uno de entrenamiento y otro de test. En la bibliografía es habitual encontrar que se tiene que dividir los conjuntos de datos para el entrenamiento de los modelos en tres: entrenamiento, validación … [Leer más...] acerca de Entrenamiento, validación y test con Scikit-learn
Multicolinealidad
La multicolinealidad es un problema que puede afectar negativamente al rendimiento de los modelos de regresión. Afectando tanto a modelos de regresión lineal como logísticos. El problema aparece cuando existe relación entre las variables independientes empleadas en los modelos. Siendo esta correlación un problema porque las variables independientes deberían de ser … [Leer más...] acerca de Multicolinealidad
Medir la similitud de archivos con Python
Una de las grandes ventajas de los sistemas informáticos es la facilidad con la que se puede copiar y modificar los archivos. Cuando tenemos que repetir un análisis que ya hemos realizado previamente, sea este en una hoja de cálculo, un Jupyter Notebook o con cualquier otra herramienta, podemos partir de este y modificar adecuadamente los datos. Esto que nos no reinventar los … [Leer más...] acerca de Medir la similitud de archivos con Python
SequenceMatcher
Comparar dos documentos es una tarea relativamente compleja, especialmente si buscamos coincidencias parciales entre los mismos. Para esta tarea en el módulo difflib de Python podemos encontrar la clase SequenceMatcher con la que realizar esta tarea. Una clase con la que localizar las coincidencias existentes en las subsecuencia, al mismo tiempo que se puede obtener un grado de … [Leer más...] acerca de SequenceMatcher
¿Cuál es la diferencia entre parámetro e hiperparámetro?
En aprendizaje automático hay dos conceptos que parecen similares, aunque son completamente diferentes: parámetro e hiperparámetro. Ambos con unos conjuntos de valores que se tienen que afinar a la hora de crear un modelo para un problema dado. Tanto si este es de aprendizaje supervisado como no supervisado. A continuación, se explicará las diferencias entre los parámetros e … [Leer más...] acerca de ¿Cuál es la diferencia entre parámetro e hiperparámetro?
Test de causalidad de Wiener-Granger
El test de causalidad de Wiener-Granger, o causalidad de Granger, es una prueba estadística empleada para determinar si una serie temporal puede predecir a otra. Para ello se basa en la idea de que si una serie temporal X causa otra Y, los modelos de Y en los que se emplean datos retrasados de X e Y deben funcionar mejor los basados únicamente en datos retrasados de Y. … [Leer más...] acerca de Test de causalidad de Wiener-Granger
CatBoost
CatBoost es un algoritmo de aprendizaje automático basado en potenciación del gradiente (“Gradient boosting”) desarrollado por los investigadores de Yandex que es adecuado en múltiples aplicaciones. Actualmente se pueden encontrar paquetes para Python y R, siendo posible integrarlo fácilmente en los frameworks más populares de aprendizaje automático como … [Leer más...] acerca de CatBoost











