Sidetable es un complemento para Pandas con el que es posible crear fácilmente tablas resumen en Python de los conjuntos de datos. Lo que consigue mediante la combinación de funciones de tabulación cruzada y recuento de datos, simplificando muchos análisis habituales.Instalación y conjunto de datos de ejemploEl método más sencillo para instalar Sidetable en Python es … [Leer más...] acerca de Creación de tablas resumen en Python con Sidetable
Pandas
Pandas es una librería para Python la cual extiende las funcionalidades que ofrece NumPy para el tratamiento y análisis de conjuntos de datos. Poniendo a disposición de los usuarios dos nuevas estructuras de datos (Series y DataFrame) que facilitan la manipulación de series temporales y tablas.
La estructura de datos básica de Pandas es el objeto Series. Un vector etiquetado capaz de contener cualquier tipo de dato (enteros, reales, cadenas de texto, fechas, objetos de Python, …) con etiquetas que se denominan índices.
La otra estructura de datos, el DataFrame, es una colección ordenada de columnas con nombres y tipos, similar a las tablas de las bases de datos, donde las filas son un registro y las columnas son los atributos. Siendo cada una de las columnas de este tipo de datos un objeto Series.
Análisis de datos en Python al estilo Excel con Mito
Mito es una interfaz para el análisis de datos basaos en JupyterLab con un funcionamiento similar al de las hojas de cálculo. Permitiendo llevar a cabo complejos análisis en pocos segundos, creando además de forma automática código Python con el que repetir las operaciones en cualquier conjunto de datos similar. Lo que permite crear análisis de datos en Python al estilo de … [Leer más...] acerca de Análisis de datos en Python al estilo Excel con Mito
Pandas: Renombrar columnas en Pandas
Los DataFrame de Pandas ofrecen la posibilidad de almacenar datos con indexación, tanto para filas como para columnas. Índices que puede ser necesario cambiar. Para ello se puede usar el método set_axis(), aunque puede ser poco productivo cuando solamente se quiere cambiar unos pocos índices. En estos caso se puede usar el método rename(). Veamos a continuación la forma de … [Leer más...] acerca de Pandas: Renombrar columnas en Pandas
Pandas: Cambiar el tipo de columnas en un DataFrame
Al crear un nuevo DataFrame en Pandas, si no se indica de forma explícita, el constructor le asignará a cada una de las series el tipo de dato que considere más adecuado. Pudiendo ser diferente al que necesitamos. Especialmente cuando en los datos originales se combinan valores numéricos con cadenas de texto. Para solucionar estos problema y cambiar el tipo de columnas en un … [Leer más...] acerca de Pandas: Cambiar el tipo de columnas en un DataFrame
Almacenar los datos de forma eficiente con Feather en Python
El formato de archivo CSV es uno de los más populares para el intercambio de datos. Lo que es debido a estar basado en un archivo de texto plano, por lo que puede ser interpretado prácticamente en cualquier sistema por cualquier programa. Aunque esto también es un problema, ya que un archivo CSV ocupa demasiado espacio y los procesos de lectura y escritura son lentos. Para … [Leer más...] acerca de Almacenar los datos de forma eficiente con Feather en Python
¿Cómo eliminar columnas o filas multi-índice en un dataframe de Pandas?
Los dataframes de Pandas ofrecen la posibilidad de emplear múltiples índices para etiquetar los datos almacenados. Algo que se puede usar tanto para las columnas como para las filas, permitiendo organizar así ciertos tipos de datos de una forma mucho más eficiente. Ya que es posible seleccionar los diferentes valores en base a los diferentes niveles de los índices. Para … [Leer más...] acerca de ¿Cómo eliminar columnas o filas multi-índice en un dataframe de Pandas?
Pandas: Cómo iterar sobre las filas de un DataFrame en Pandas
Iterar sobre las filas de un DataFrame es una operación que se suele realizar de forma bastante habitual. Existiendo por ello diferentes formas de hacerlo. En esta ocasión vamos a ver tres de los métodos más utilizados para comparar posteriormente el rendimiento de estas.Conjunto de datos de ejemploPara trabajar en esta ocasión vamos a emplear un conjunto de datos … [Leer más...] acerca de Pandas: Cómo iterar sobre las filas de un DataFrame en Pandas
Pandas: Cómo crear un DataFrame aleatorio
En algunos casos son necesarios los conjuntos de datos aleatorios, por ejemplo, para la evaluación del rendimiento de algoritmos. Al trabajar con Pandas muchas veces necesitamos en forma de DataFrame. Algo que directamente no se puede hacer, pero sí usando los generadores de números aleatorios de NumPy, para crear a partir de estos unos DataFrame. Veamos cómo se puede crear un … [Leer más...] acerca de Pandas: Cómo crear un DataFrame aleatorio
Pandas: Iterar sobre las columnas de un DataFrame
Normalmente al trabajar con objetos DataFrame de Pandas se itera sobre las filas, ya que lo habitual es que estas representen los registros. Aun así, en ciertas ocasiones es posible que sea necesario iterar sobre las columnas de un DataFrame, por lo que en esta entrada se mostrarán algunas de las formas que existen para realizar esta tarea.Conjunto de datos de … [Leer más...] acerca de Pandas: Iterar sobre las columnas de un DataFrame
Pandas: Mostrar todos los elementos de un DataFrame
En Pandas, al sacar por pantalla los elementos de grandes conjuntos de datos por defecto solamente se mostrará una parte de estos. Lo que generalmente es una buena solución. Al trabajar de este modo, es fácil hacerse una idea de la forma de los datos sin llenar pantallas y pantallas con información que no es relevante. Aunque, cuando exista la necesidad de ver todos los … [Leer más...] acerca de Pandas: Mostrar todos los elementos de un DataFrame
Pandas: Contabilizar los registros que cumplen una condición en un DataFrame
La semana pasada hemos visto cómo se pueden contabilizar las veces que aparecen los valores nulos (NaN) en un DataFrame de Pandas. En esta ocasión vamos a generalizar el proceso para poder contabilizar los registros que cumplen una condición, sea esta sencilla o toda la compleja que necesitemos usar.Conjunto de datos de ejemploPara trabajar se puede usar el mismo … [Leer más...] acerca de Pandas: Contabilizar los registros que cumplen una condición en un DataFrame
Pandas: Contar los valores nulos en DataFrame
Es posible que al importar un conjunto de datos en un DataFrame de Pandas este tenga algunos valores nulos, generalmente representados por NaN. La existencia de este tipo de valores en los datos es un problema. Cualquier operación en la que se usen estos valores da como resultado NaN, salvo cuando es posible indicar que se ignoren. Por eso es aconsejable saber cómo contar los … [Leer más...] acerca de Pandas: Contar los valores nulos en DataFrame




