La librería Pandas-Profiling permite automatizar el análisis de datos en Python. Generando automáticamente informes de los conjuntos de datos contenidos en objetos DataFrame.IntroducciónUna de las primeras tareas a realizar cuando recibimos un nuevo conjunto de datos es un análisis exploratorio del mismo. En el que se incluyen tareas como determinar el rango de cada … [Leer más...] acerca de Automatizar el análisis de datos con Pandas-Profiling
Pandas
Pandas es una librería para Python la cual extiende las funcionalidades que ofrece NumPy para el tratamiento y análisis de conjuntos de datos. Poniendo a disposición de los usuarios dos nuevas estructuras de datos (Series y DataFrame) que facilitan la manipulación de series temporales y tablas.
La estructura de datos básica de Pandas es el objeto Series. Un vector etiquetado capaz de contener cualquier tipo de dato (enteros, reales, cadenas de texto, fechas, objetos de Python, …) con etiquetas que se denominan índices.
La otra estructura de datos, el DataFrame, es una colección ordenada de columnas con nombres y tipos, similar a las tablas de las bases de datos, donde las filas son un registro y las columnas son los atributos. Siendo cada una de las columnas de este tipo de datos un objeto Series.
Procesado de archivos CSV enormes en Python
La librearía pandas de Python ofrece una colección de fantásticas herramientas para la manipulación y análisis de datos. Siendo una de las piezas clave de la enorme popularidad de Python entre los científicos de datos. Pero los objetos de pandas se manejan en memoria y, por lo tanto, cuando el tamaño de los datos crece es complicado poder trabajar con ellos. Por ejemplo, cuando … [Leer más...] acerca de Procesado de archivos CSV enormes en Python
Operaciones de filtrado de DataFrame con Pandas en base a los valores de las columnas
Los objetos DataFrame de Pandas son una herramienta fantástica para trabajar con datos. Permitiendo realizar múltiples tareas de una forma rápida y sencilla. Una de las más habituales es filtrar, poder seleccionar un subconjunto de los datos en base a los valores de uno o varias columnas. En esta entrada se explicarán diferentes formas de realizar el filtrado de DataFrame con … [Leer más...] acerca de Operaciones de filtrado de DataFrame con Pandas en base a los valores de las columnas
Obtención de valores únicos de una columna con Pandas
En muchas ocasiones al trabajar con un DataFrame de Pandas puede que una de las columnas contenta los valores de una etiqueta. La que posiblemente tendrá muchos registros repetidos. Por lo que puede ser interesante obtener el listado de valores únicos de la columna. Afortunadamente los objetos DataFrame de la librería Pandas cuentan con un método para obtener estos. A … [Leer más...] acerca de Obtención de valores únicos de una columna con Pandas
¿Cómo cambiar el nombre de las columnas en Pandas?
En los DataFrame de Pandas los nombres de las columnas permiten identificar rápidamente el contenido de estas. Por eso saber como cambiar el nombre de las columnas en Pandas puede ser importante ya que en muchas ocasiones puede que se incluyan en el archivo de datos. O simplemente sean nombres crípticos que se desea cambiar. Además de las columnas también se puede asignar un … [Leer más...] acerca de ¿Cómo cambiar el nombre de las columnas en Pandas?
Diferentes formas de ordenar dataframes en pandas
Una vez importado un conjunto de datos en pandas puede ser interesante ordenar el contenido de estos. Lo más habitual es ordenarlo en base a los valores de una o varias columnas. Para ordenar dataframes en pandas se pueden utilizar los métodos nativos de estos objetos. Lo que permite hacer esta tarea de un forma sencilla y eficiente.En esta entrada se va a utilizar el … [Leer más...] acerca de Diferentes formas de ordenar dataframes en pandas
Mejora del rendimiento de pandas con Modin
Una de las bibliotecas más utilizada para la manipulación y análisis de datos en Python es pandas. Con ella es posible manipular tablas y series temporales. Además, ofrece la posibilidad de importar datos desde archivos CSV o Excel para su posterior manipulación. Al trabajar con grandes conjuntos de datos el tiempo de procesado puede ser un problema. Por lo que cualquier mejora … [Leer más...] acerca de Mejora del rendimiento de pandas con Modin
¿Cómo eliminar columnas y filas en un dataframe pandas?
Al trabajar con grandes conjuntos de datos es habitual tener que eliminar registros para eliminar su tamaño. Por ejemplo, al importar los datos se un archivo CSV puede ser que los registros de algunas columnas no sean necesarios. En esta entrada vamos a explicar cómo eliminar columnas y filas en un dataframe pandas.Para poder eliminar datos de un dataframe es necesario … [Leer más...] acerca de ¿Cómo eliminar columnas y filas en un dataframe pandas?
Comparar los registros de dos dataframes con pandas
Al tener dos conjuntos de datos en muchas ocasiones es necesario comparar su contenido. Para saber los registros comunes, los que se han eliminado o los que se han añadido a uno de los conjuntos de datos. En una base de datos esto es una tarea sencilla. En Python los objetos DataFrame dispone del método mergue con el que se puede operar de forma similar a una consulta SQL. … [Leer más...] acerca de Comparar los registros de dos dataframes con pandas
Mapas de calor y diagramas de araña en Python
En una entrada anterior se ha visto algunos de los gráficos más importantes disponibles en la librería de Python Seaborn. En esta ocasión se va a ver cómo construir en Python dos tipos de gráficos que pueden ser muy útiles: los mapas de calor y los diagramas de araña. Para construir el primero de ellos se utilizará Seaborn, mientras que para el segundo se utilizará matplotlib. … [Leer más...] acerca de Mapas de calor y diagramas de araña en Python
Selección de una submuestra en Python con pandas
La generación de muestras aleatorias a partir de conjunto de datos es una tarea bastante habitual. Al realizar el entrenamiento de un modelo supervisado es habitual dejar un conjunto de datos para una validación posterior. También en algunos estudios estadísticos pueden realizarse únicamente con un conjunto de los datos originales. Por este motivo los objetos DataFrame de … [Leer más...] acerca de Selección de una submuestra en Python con pandas
Utilizar el portapapeles en Python con pandas
El portapapeles es una forma rápida de mover datos entre las aplicaciones abiertas en una sesión. Por ejemplo, es posible copiar el código publicado e insertarlo en un editor de texto. Otra aplicación es copiar una parte de los datos de una hoja de cálculo e insertarlos en otra o en una sesión de Python. Para esto último se puede utilizar la función read_clipboard() disponible … [Leer más...] acerca de Utilizar el portapapeles en Python con pandas











