• Ir al contenido principal
  • Skip to secondary menu
  • Ir a la barra lateral primaria
  • Ir al pie de página
  • Inicio
  • Secciones
    • Ciencia de datos
    • Criptografía
    • Herramientas
    • Noticias
    • Opinión
  • Programación
    • JavaScript
    • Julia
    • Matlab
    • Python
    • R
  • Boletín
  • Contacto
  • Acerca de Analytics Lane
  • Tienda
    • Libros
    • Equipamiento de oficina
    • Equipamiento en movilidad
    • Tiendas afiliadas
      • AliExpress
      • Amazon
      • GearBest
      • GeekBuying
      • JoyBuy

Analytics Lane

Ciencia e ingeniería de datos aplicada

  • Ciencia de datos
  • Criptografía
  • Python
  • Matlab
  • R
  • Julia
  • JavaScript
  • Herramientas
  • Opinión
  • Noticias

Pandas: Omitir filas de un archivo CSV

febrero 1, 2021 Por Daniel Rodríguez Dejar un comentario
Tiempo de lectura: 4 minutos

pandas

Las funciones de Pandas para trabajar con archivos CSV nos ofrecen múltiples posibilidades que nos pueden facilitar las tareas con estos documentos. Una de estas funciones es la que permite eliminar algunas filas de un archivo CSV en Pandas.

Propiedades para omitir filas de un archivo CSV en Pandas

Básicamente existen dos propiedades con las que se pueden indicar a la función read_csv() omitir la carga de algunas filas de un archivo CSV en Pandas: skiprows y skipfooter.

La propiedad skiprows

Una propiedad interesante de la función read_csv() de Pandas es skiprows. Propiedad con la que es posible omitir algunas filas a la hora de importar un archivo CSV. En función del tipo de dato que reciba la propiedad tendremos un comportamiento diferente

  • entero: en el caso de que se asigne un valor entero a la propiedad se eliminará todas las filas hasta la indicada.
  • lista: al indicar una lista se eliminará las número de filas en las lista.
  • función: también se puede asignar una función, con las que se pueden crear reglas más complejas a la hora de omitir filas.

La propiedad skipfooter

Otra propiedad interes es skipfooter, con las que se puede omitir la carga de las últimas filas de un archivo CSV. A diferencia de skiprows está solo admite un valor entero, no es posible usar funciones ni listas. Además, es necesario indicar que el motor se Python, ya que no funciona con C.

Ejemplo de uso de skiprows y skipfooter

Para comprobar el funcionamiento de estos parámetros vamos a crear el mismo archivo que usamos cuando explicamos el fundamento de los archivos CSV en Python con Pandas. En concreto vamos a crear un archivo con el siguiente código:

import pandas as pd

data = {'first_name': ['Sigrid', 'Joe', 'Theodoric','Kennedy', 'Beatrix', 'Olimpia', 'Grange', 'Sallee'],
        'last_name': ['Mannock', 'Hinners', 'Rivers', 'Donnell', 'Parlett', 'Guenther', 'Douce', 'Johnstone'],
        'age': [27, 31, 36, 53, 48, 36, 40, 34],
        'amount_1': [7.17, 1.90, 1.11, 1.41, 6.69, 4.62, 1.01, 4.88],
        'amount_2': [8.06,  "?", 5.90,  "?",  "?", 7.48, 4.37,  "?"]}

df = pd.DataFrame(data, columns = ['first_name', 'last_name', 'age', 'amount_1', 'amount_2'])
df.to_csv('example.csv', index=False)

Archivo que podemos importar con read_csv().

pd.read_csv('example.csv')
  first_name  last_name  age  amount_1 amount_2
0     Sigrid    Mannock   27      7.17     8.06
1        Joe    Hinners   31      1.90        ?
2  Theodoric     Rivers   36      1.11      5.9
3    Kennedy    Donnell   53      1.41        ?
4    Beatrix    Parlett   48      6.69        ?
5    Olimpia   Guenther   36      4.62     7.48
6     Grange      Douce   40      1.01     4.37
7     Sallee  Johnstone   34      4.88        ?

Omitir la carga de las primeras filas

En primer lugar, podemos ver los datos que se importaban si le indicamos mediante skiprows que se omitan las cinco primeras filas.

pd.read_csv('example.csv', header=None, skiprows=5)
         0          1   2     3     4
0  Beatrix    Parlett  48  6.69     ?
1  Olimpia   Guenther  36  4.62  7.48
2   Grange      Douce  40  1.01  4.37
3   Sallee  Johnstone  34  4.88     ?

En este caso podemos ver que son las cinco primeras líneas incluyendo la cabecera. Por lo que, en el archivo que tenemos, tenemos que omitir la carga de esta ya que en caso contrario los nombres de las columnas del DataFrame serian el contenido de primera columna en importar.

Omitir la carga de una serie de filas

La segunda opción para el método skiprows es usar una lista. En cuyo caso se eliminarán solamente las líneas indicadas. Teniendo en cuenta que la cabecera, en caso de que el archivo la contenga, es línea cero. Por eso en nuestro ejemplo, la primera fila de datos es la 1.

pd.read_csv('example.csv', skiprows=(1, 3, 6))
  first_name last_name  age  amount_1 amount_2
0     Sigrid   Mannock   27      7.17     8.06
1        Joe   Hinners   31      1.90        ?
2  Theodoric    Rivers   36      1.11      5.9
3    Kennedy   Donnell   53      1.41        ?
4    Beatrix   Parlett   48      6.69        ?

Creación de una regla compleja

Finalmente la última opción para skiprows es usar una función. Una función a la cual le llega un único parámetro que es el número de fila y tiene que devolver un valor verdadero o falso para indicar si la línea se importa o no. Pudiéndose construir así reglas tan complejas como sea necesario. Por ejemplo, para importar la cabecera y las líneas pares se puede usar.

def age(row):
    if row == 0:
        return False
    else:
        return row % 2 == 0

pd.read_csv('example.csv', header=None, skiprows=age)
  first_name last_name  age  amount_1 amount_2
0     Sigrid   Mannock   27      7.17     8.06
1  Theodoric    Rivers   36      1.11      5.9
2    Beatrix   Parlett   48      6.69        ?
3     Grange     Douce   40      1.01     4.37

Eliminar las últimas filas

En el caso de que deseemos eliminar las últimas filas se puede usar skipfooter teniendo en cuenta que no se le puede pasar una lista o una función. Además de ser necesario inidcar que se use el motor de Python, ya que no funciona con C. Así para eliminar las últimas cinco filas se puede hacer.

pd.read_csv('example.csv', skipfooter=5, engine='python')
  first_name last_name  age  amount_1 amount_2
0     Sigrid   Mannock   27      7.17     8.06
1        Joe   Hinners   31      1.90        ?
2  Theodoric    Rivers   36      1.11      5.9
3    Kennedy   Donnell   53      1.41        ?
4    Beatrix   Parlett   48      6.69        ?

Conclusiones

En esta ocasión hemos visto cómo se puede usar las propiedades skiprows y skipfooter para omitir la carga de algunas filas de un archivo CSV en Pandas. Algo que en ciertas ocasiones puede ser de gran utilidad, evitando la carga de datos que no son necesarios, pero se encuentran en el archivo.

¿Te ha parecido de utilidad el contenido?

¡Puntúalo entre una y cinco estrellas!

Puntuación promedio 0 / 5. Votos emitidos: 0

Ya que has encontrado útil este contenido...

¡Síguenos en redes sociales!

¡Siento que este contenido no te haya sido útil!

¡Déjame mejorar este contenido!

Dime, ¿cómo puedo mejorar este contenido?

Contenido relacionado

Archivado en:Python Etiquetado con:pandas

Interacciones con los lectores

Deja una respuesta Cancelar la respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

I accept the Terms and Conditions and the Privacy Policy

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

Publicidad


Barra lateral primaria

Suscríbete a nuestro boletín

Suscríbete al boletín semanal para estar al día de todas las publicaciones.

Política de Privacidad

¡Síguenos en redes sociales!

  • facebook
  • instagram
  • pinterest
  • tumblr
  • twitter
  • youtube
  • github
  • telegram
  • rss

Publicidad

Tiendas afiliadas

Ayúdanos realizando tus compras sin coste adicional con los enlaces de la tienda. ¡Gracias!

Entradas recientes

Epsilon-Greedy con decaimiento para un problema Bandido Multibrazo (Multi-Armed Bandit)

marzo 5, 2021 Por Daniel Rodríguez Dejar un comentario

Diferencias entre library() y require() en R

marzo 3, 2021 Por Daniel Rodríguez Dejar un comentario

Noticias

Disponible la versión 1.20.0 de NumPy

marzo 2, 2021 Por Daniel Rodríguez Dejar un comentario

Publicidad

Es tendencia

  • Seleccionar filas y columnas en Pandas con iloc y loc bajo Python
  • ¿Cómo eliminar columnas y filas en un dataframe pandas? bajo Python
  • Numpy básico: eliminar elementos en arrays de Numpy bajo Python
  • ¿Cómo cambiar el nombre de las columnas en Pandas? bajo Python
  • pandas Pandas: Cómo crear un DataFrame vacío y agregar datos bajo Python

Publicidad

Lo mejor valorado

5 (5)

Diferencias entre var y let en JavaScript

5 (6)

Operaciones de filtrado de DataFrame con Pandas en base a los valores de las columnas

5 (5)

Archivos JSON con Python: lectura y escritura

4.8 (6)

Seleccionar filas y columnas en Pandas con iloc y loc

4.2 (5)

Guardar y leer archivos Excel en Python

Publicidad

Comentarios recientes

  • egilda en Visualización de datos en Python con Seaborn
  • Sergio en ¿Cómo eliminar columnas y filas en un dataframe pandas?
  • javier en Uso de las f-string de Python para mejorar el formato de textos
  • Daniel Rodríguez en Guardar y leer archivos Excel en Python
  • franklin Chiluisa en Guardar y leer archivos Excel en Python

Publicidad

Footer

Secciones

  • Ciencia de datos
  • Criptografía
  • Herramientas
  • Noticias
  • Opinión

Analytics Lane

  • Acerca de Analytics Lane
  • Boletín de noticias
  • Contacto
  • Lo más popular
  • Tienda

Programación

  • JavaScript
  • Julia
  • Matlab
  • Python
  • R

Tiendas Afiliadas

  • AliExpress
  • Amazon
  • BangGood
  • GearBest
  • Geekbuying
  • JoyBuy

Sobre de Analytics Lane

En Analytics Lane tratamos de explicar los principales conceptos de la ciencia e ingeniería de datos con un enfoque práctico. Los principales temas tratados son ciencia de datos, ingeniería de datos, inteligencia artificial, machine learning, deep learning y criptografía. Además, también se habla de los principales lenguajes de programación y herramientas utilizadas por los científicos e ingenieros de datos.

2018-2021 Analytics Lane · Términos y condiciones · Política de Cookies · Política de Privacidad · Herramientas de privacidad · Contacto