• Saltar al contenido principal
  • Skip to secondary menu
  • Saltar a la barra lateral principal
  • Saltar al pie de página
  • Inicio
  • Secciones
    • Ciencia de datos
    • Criptografía
    • Herramientas
    • Machine Learning
    • Noticias
    • Opinión
    • Productividad
    • Programación
      • JavaScript
      • Julia
      • Matlab
      • Python
      • R
  • Programación
    • JavaScript
    • Julia
    • Matlab
    • Python
    • R
  • Laboratorio
    • Encuestas: Tamaño de Muestra
    • Lotería: Probabilidad de Ganar
    • Reparto de Escaños (D’Hondt)
    • Tres en Raya con IA
  • Noticias
  • Boletín
  • Contacto
  • Tienda
    • Libros
    • Equipamiento de oficina
    • Equipamiento en movilidad
    • Tiendas afiliadas
      • AliExpress
      • Amazon
      • Banggood
      • GeekBuying
      • Lenovo

Analytics Lane

Ciencia e ingeniería de datos aplicada

  • Ciencia de datos
  • Machine Learning
  • Python
  • Pandas
  • NumPy
  • Matlab
  • Julia
  • Excel
  • IA Generativa

Importar tablas desde webs con Pandas

mayo 18, 2020 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 4 minutos

En muchas páginas web es habitual encontrase con datos en formato de tablas. Datos que pueden ser de interés en nuestros estudios, por lo que disponer de una función que permita importarlos de forma fácil y sencilla es algo que nos puede ahorrar mucho tiempo. Por eso en Pandas existe el método read_html() con el que se pueden importar tablas desde webs.

Tablas en páginas web

Las páginas web están pobladas de datos en formato de tablas, ya que es uno de los mejores métodos para presentar información estructurada. La etiqueta HTML con la que se identifica estos datos es <table>, de modo que la posición de los datos es fácil de identificar. Por ejemplo, en la siguiente página de datosmacro.com podemos encontrar los datos actualizados de casos de coronavirus.

Datos de la crisis del coronavirus en datosmacro.com
Datos de la crisis del coronavirus en datosmacro.com

Ahora, si deseamos importar este conjunto de datos en Python solo tenemos que usar el método read_html() de Pandas indicando la URL de la página web, además de unas opciones con el formato.

import pandas as pd

data = pd.read_html('https://datosmacro.expansion.com/otros/coronavirus',
                    decimal=',', thousands='.')
data[0].head()
            Países  Activos  Recuperados  Incremento Muertos  Muertos  \
0       España [+]    57941     144783.0               102.0  27563.0   
1     Alemania [+]    15739     151597.0                13.0   7897.0   
2  Reino Unido [+]   202879       1047.0               385.0  34078.0   
3      Francia [+]    91536      60562.0               104.0  27532.0   
4       Italia [+]    72070     120205.0               242.0  31610.0   

   Muertos / millón  Incremento Confirmados  Confirmados  \
0            585.20                     539       230698   
1             95.12                     755       175233   
2            511.32                    3564       238004   
3            410.85                     636       179630   
4            523.70                     789       223885   

   Confirmados / 100.000  
0                 489.80  
1                 211.08  
2                 357.11  
3                 268.05  
4                 370.92  

Con lo que se obtiene una lista, en la que el primer registro en un DataFrame con los datos.

¡Nuevo video! Aprende a seleccionar datos en Pandas con .iloc y .loc
En Analytics Lane
¡Nuevo video! Aprende a seleccionar datos en Pandas con .iloc y .loc

Publicidad


Opciones de formato

En el ejemplo anterior se ha utilizado dos opciones (decimal y thousands) que son especialmente importantes si las webs con las que trabajamos no están en inglés. En español el separador de decimales es la coma y el de miles es el punto, al contrario de lo que sucede en inglés. Pandas por defecto espera que el formato de las tablas sea el inglés, por lo que es necesario cambiar los valores por defecto de estas dos opciones para garantizar que los datos se importan correctamente. Ya que, en caso contrario, el primer valor de la tabla de ejemplo se importaría como 54,941 en lugar de 54.914. Algo que no es correcto. En el caso de trabajar con páginas en inglés, o simplemente usen la cultura inglesa para representar los datos, no es necesario indicar ninguna de estas dos opciones.

Múltiples tablas en una página web

Una duda que puede surgir es qué pasaría si existiesen más de una tabla en alguna página web. Por ejemplo, en el mismo sitio se puede ver los datos de IPC en el que se puede ver tablas de IPC por países, IPC Armonizado por países e IPC por comunidad autónoma.

Datos del IPC en datosmacro.com
Datos del IPC en datosmacro.com

En esta situación se obtendrá una lista con tres DataFrames, uno para cada uno de los elementos. Este es el motivo por el que en el caso anterior fue necesario extraer la única tabla de una lista. La función read_html devuelve una lista no un DataFrame para que en caso de existir más de una tabla se puedan extraer todas. Algo que se puede comprobar simplemente viendo la longitud de este otra página.

Publicidad


Conclusiones

Hoy hemos visto cómo con la función read_html se puede importar tablas desde webs de una forma rápida y sencilla. Permitiendo utilizar los datos disponibles en nuestros análisis, sin que sea necesario el mínimo procesado por nuestra parte.

En algunas webs puede que esta función no identifique correctamente las tablas debido a cómo son creadas. En estos caso una solución es copiar las tablas en el portapapeles y utilizar el método read_clipboard() para importar los datos. Un proceso que requiere más pasos, pero puede ser de utilidad en estos casos.

Imagen de Photo Mix en Pixabay

¿Te ha parecido de utilidad el contenido?

¡Puntúalo entre una y cinco estrellas!

Puntuación promedio 5 / 5. Votos emitidos: 1

Ya que has encontrado útil este contenido...

¡Síguenos en redes sociales!

¡Siento que este contenido no te haya sido útil!

¡Déjame mejorar este contenido!

Dime, ¿cómo puedo mejorar este contenido?

Publicaciones relacionadas

  • ¡Nuevo video! Aprende a seleccionar datos en Pandas con .iloc y .loc
  • ¡Nuevo video! Aprende a eliminar filas y columnas en Pandas sin errores
  • Nuevo video en el canal: Cómo eliminar duplicados de una lista en Python
  • Nuevo video en YouTube: Trabajando con archivos JSON en Python
  • Nuevo video: Leer y guardar archivos Excel y CSV en Python
  • Nuevo video: cómo activar copiar y pegar en VirtualBox fácilmente
  • Cómo extender el tamaño de un disco en Rocky Linux 9 usando growpart y LVM
  • Curiosidad: El origen del análisis exploratorio de datos y el papel de John Tukey
  • Cómo calcular el tamaño de la muestra para encuestas

Publicado en: Python Etiquetado como: Pandas

Interacciones con los lectores

Deja una respuesta Cancelar la respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

I accept the Terms and Conditions and the Privacy Policy

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

Barra lateral principal

Suscríbete a nuestro boletín

Suscríbete al boletín semanal para estar al día de todas las publicaciones.

Política de Privacidad

Analytics Lane en redes sociales

  • Amazon
  • Bluesky
  • Facebook
  • GitHub
  • Instagram
  • Mastodon
  • Pinterest
  • RSS
  • Telegram
  • Tumblr
  • Twitter
  • YouTube

Publicidad

Entradas recientes

Cómo calcular el tamaño de la muestra para encuestas

septiembre 9, 2025 Por Daniel Rodríguez

Curiosidad: El origen del análisis exploratorio de datos y el papel de John Tukey

septiembre 4, 2025 Por Daniel Rodríguez

Cómo extender el tamaño de un disco en Rocky Linux 9 usando growpart y LVM

septiembre 2, 2025 Por Daniel Rodríguez

Publicidad

Es tendencia

  • Cómo desinstalar Oracle Database 19c en Windows publicado el noviembre 25, 2022 | en Herramientas
  • NumPy NumPy: Concatenar matrices en NumPy con np.concatenate() publicado el agosto 17, 2021 | en Python
  • pandas Pandas: Contar los valores nulos en DataFrame publicado el agosto 12, 2021 | en Python
  • Creación de documentos Word con Python publicado el septiembre 7, 2020 | en Python
  • Correlación y causalidad: no es lo mismo publicado el junio 13, 2025 | en Ciencia de datos

Publicidad

Lo mejor valorado

4.9 (24)

Seleccionar filas y columnas en Pandas con iloc y loc

4.6 (16)

Archivos JSON con Python: lectura y escritura

4.4 (14)

Ordenación de diccionarios en Python mediante clave o valor

4.7 (13)

Operaciones de filtrado de DataFrame con Pandas en base a los valores de las columnas

4.5 (10)

Diferencias entre var y let en JavaScript

Publicidad

Comentarios recientes

  • Pepe en Probabilidad básica: cómo entender el azar en nuestra vida diaria
  • CARLOS ARETURO BELLO CACERES en Justicio: La herramienta gratuita de IA para consultas legales
  • Piera en Ecuaciones multilínea en Markdown
  • Daniel Rodríguez en Tutorial de Mypy para Principiantes
  • Javier en Tutorial de Mypy para Principiantes

Publicidad


Footer

Analytics Lane

  • Acerca de Analytics Lane
  • Boletín de noticias
  • Contacto
  • Libros
  • Lo más popular
  • Noticias
  • Tienda
  • Tiendas afiliadas

Secciones

  • Ciencia de datos
  • Criptografía
  • Herramientas
  • Machine Learning
  • Opinión
  • Productividad
  • Programación
  • Reseñas

Sobre de Analytics Lane

En Analytics Lane tratamos de explicar los principales conceptos de la ciencia e ingeniería de datos con un enfoque práctico. Los principales temas tratados son ciencia de datos, ingeniería de datos, inteligencia artificial, machine learning, deep learning y criptografía. Además, también se habla de los principales lenguajes de programación y herramientas utilizadas por los científicos e ingenieros de datos.

Copyright © 2018-2025 Analytics Lane ·Términos y condiciones ·Política de Cookies ·Política de Privacidad ·Herramientas de privacidad ·Contacto