La minería de datos hace referencia a los análisis utilizados para la identificación de patrones desconocidos en grandes conjuntos de datos. Pudiendo ser los análisis tanto automáticos como semiautomáticos. Para poder implementar los análisis de la minería de datos es necesario conocer diferentes técnicas procedentes de áreas tales como la gestión de bases de datos, la estadística, la inteligencia artificial y el aprendizaje automático.
La minería de datos es el proceso mediante el cual se busca identificar patrones en grandes conjuntos de datos. Siendo la palabra clave para hablar de minería de datos la identificación de patrones. El tipo de patrones que se pueden estudiar son múltiples, entre los que se pueden enumerar la identificación de:
Al ser un termino que esta de moda, el termino minería de datos se utiliza en muchas ocasiones incorrectamente para hacer referencia al manejo de datos. Especialmente cuando se habla de grandes volúmenes. Esto es, se emplea para situaciones en las que simplemente gestionan bases de datos, sin realizar un descubrimiento de patrones en el mismo. Por ejemplo, en la entrada de la Wikipedia sobre la minería de datos se hace referencia a esto:
La minería de datos o exploración de datos (es la etapa de análisis de “Knowledge Discovery in Databases” o KDD) es un campo de la estadística y las ciencias de la computación referido al proceso que intenta descubrir patrones en grandes volúmenes de conjuntos de datos.
Minería de datos, En Wikipedia. Recuperado el 1 de julio 2018 .
El proceso de minería de datos se enmarca en el proceso que se conocen como KDD (“Knowlege Discovery in Databases”, o Descubrimiento de Conocimiento en Bases de Datos). En la siguiente sección se hace un repaso de los seis fases en las que se divide el KDD.
A grandes rasgos, se puede dividir en los siguientes pasos:
Algunas referencias pueden indicar que el KDD incluye también otros pasos como la limpieza e integración de los datos al comienzo del proceso y la visualización y representación final de los resultados.
Los modelos utilizados en minería de datos tienen un ciclo de vida. Inicialmente estos han de ser creados, validados y puestos en producción. Una vez puestos en producción su capacidad suele decaer con el tiempo debido a cambios en el entorno. Por ejemplo, en una tienda on-line los hábitos de los clientes, o la tecnología, pueden cambiar haciendo necesario que los modelos se actualicen para recoger estos cambios.
Generalmente el proceso de creación de los modelos suele ser costoso en recursos. Siendo necesario disponer de perfiles especializados y altamente cualificados para su generación. Por otro lado, la ejecución de los modelos en producción una vez creados no suele ser costosa. En la mayoría de los casos se ha de calcular una fórmula que suele ejecutarse rápidamente en los ordenadores actuales.
En esta entrada se ha presentado en concepto de minería de datos y el papel que juega esta en KDD.
La estadística no suele fallar en los cálculos: falla en la interpretación. El test está…
Los artículos anteriores de esta serie cubrieron cuatro formas de mirar el valor del cliente:…
Quien se acerca a la criptografía descubre enseguida a dos personajes que aparecen en casi…
En credit scoring el desbalanceo de clases es la norma, no la excepción. En una…
Cualquiera que programe usa la palabra bug a diario para referirse a un fallo en…
Los dos artículos anteriores de la serie cubrieron BG/NBD, el modelo para negocios donde el…
This website uses cookies.