• Saltar al contenido principal
  • Skip to secondary menu
  • Saltar a la barra lateral principal
  • Saltar al pie de página
  • Inicio
  • Secciones
    • Ciencia de datos
    • Criptografía
    • Herramientas
    • Machine Learning
    • Noticias
    • Opinión
    • Productividad
    • Programación
      • JavaScript
      • Julia
      • Matlab
      • Python
      • R
  • Programación
    • JavaScript
    • Julia
    • Matlab
    • Python
    • R
  • Laboratorio
    • Estadística
      • Calculadora del Tamaño Muestral en Encuestas
      • Calculadora de estadísticos descriptivos
      • Test de normalidad
      • Calculadora de contrastes de hipotesis
      • Calculadora de tamano del efecto
      • Simulador de Regresión Lineal con Ruido
      • Visualizador de PCA
      • Visualizador de Series Temporales
      • Simulador de Regresión Logística
      • Simulador de K-Means
      • Simulador de DBSCAN
      • Detector de la Ley de Benford
      • Ajuste de Curvas
      • Calculadora de Matrices
    • Probabilidad
      • Calculadora de Probabilidad de Distribuciones
      • Calculadora de Probabilidades de Lotería
      • Simulador del Problema de Monty Hall
      • Simulador de la Estrategia Martingala
    • Finanzas
      • Calculadora de Préstamos e Hipotecas
      • Conversor TIN ↔ TAE
      • Calculadora DCA con ajuste por inflación
      • Calculadora XIRR con Flujos Irregulares
      • Simulador FIRE (Financial Independence, Retire Early)
    • Negocios
      • CLV
      • Scoring
    • Herramientas
      • Formateador / Minificador de JSON
      • Conversor CSV ↔ JSON
      • Comparador y Formateador de Texto y JSON
      • Formateador y Tester de Expresiones Regulares
      • Inspector de JWT
      • Generador y verificador de hashes
      • Codificador / Decodificador Base64 y URL
      • Conversor de bases numericas
      • Conversor de Timestamp Unix
      • Conversor de colores
      • Generador de UUIDs
    • Juegos
      • Tres en Raya
      • Nim con Q-Learning
    • Más
      • Método D’Hondt
      • Generador de Contraseñas Seguras
  • Noticias
  • Boletín
  • Contacto
  • Tienda
    • Libros
    • Equipamiento de oficina
    • Equipamiento en movilidad

Analytics Lane

Ciencia e ingeniería de datos aplicada

  • Ciencia de datos
  • Machine Learning
  • IA Generativa
  • Python
  • Pandas
  • NumPy
  • R
  • Excel

Los mejores conjuntos de datos para Machine Learning

Machine learning

septiembre 11, 2024 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 5 minutos

Disponer de conjuntos de datos de calidad es crucial para poder construir modelos de aprendizaje automático (Machine Learning) robustos, precisos y funcionales. Como se suele decir “Basura entra, basura sale” (Garbage In-Garbage Out). Esto es algo que se nota especialmente cuando se está aprendiendo a crear modelos de aprendizaje automático, cuando no se dispone de datos reales para un problema real. Afortunadamente, existen varias plataformas en las que se pueden descargar conjuntos de datos variados, de calidad y bien documentados. En esta entrada, se presentan cinco sitios con los mejores conjuntos de datos para Machine Learning.

1. UCI Machine Learning Repository

El UCI Machine Learning Repository, mantenido por la Universidad de California en Irvine, es uno de los recursos más antiguos donde se puede conseguir conjuntos de datos para Machine Learning. Creado en 1978 por David Aha como un repositorio FTP. Siendo ampliamente utilizado por estudiantes y académicos en innumerables investigaciones y proyectos de Machine Learning desde su creación hace casi 50 años. Actualmente, alberga cientos de conjuntos de datos que cubren diversas áreas como biología, medicina, finanzas y más.

Cada conjunto de datos en el repositorio de UCI está acompañado de una descripción detallada que incluye información sobre sus características, posibles aplicaciones y referencias a estudios académicos que los han utilizado. Facilitando a los estudiantes, investigadores y profesionales encontrar el conjunto de datos más adecuado. Además, los datos se encuentran en formatos independientes de la plataforma como CSV, lo que simplifica su uso en prácticamente cualquier plataforma de análisis.

Augurios deportivos y portadas malditas, o cuando The Economist predice mejor al revés – El bestiario de los indicadores económicos absurdos (parte 3)
En Analytics Lane
Augurios deportivos y portadas malditas, o cuando The Economist predice mejor al revés – El bestiario de los indicadores económicos absurdos (parte 3)

2. Kaggle Datasets

Kaggle es una plataforma, propiedad de Alphabet (Google), conocida por sus competiciones de data science en la que también se pueden encontrar conjuntos de datos para Machine Learning. Existiendo una gran variedad de archivos aportados por la comunidad. Por lo que es fácil localizar muchos conjuntos de datos con descripciones detalladas y ejemplos de uso.

Los conjuntos de datos en Kaggle son diversos, cubriendo diferentes áreas como visión por computador, procesamiento de lenguaje natural, análisis de redes sociales y más. Además, Kaggle también ofrece notebooks con los que los usuarios pueden explorar y analizar los datos directamente en la plataforma, facilitando la experimentación y el desarrollo de prototipos. Otro punto a favor de esta plataforma es su comunidad, la cual proporciona soporte y recursos adicionales, como tutoriales y foros, que pueden ser muy útiles para principiantes.

Publicidad


3. Google Dataset Search

Google Dataset Search es una versión del buscador especializado en búsqueda de conjuntos de datos disponibles públicamente en la web. Siendo una mejor opción cuando sólo se desea buscar conjuntos de datos para Machine Learning. Este servicio, lanzado por Google en 2018, indexa conjuntos de datos de diversas fuentes, incluyendo repositorios institucionales, organizaciones gubernamentales y sitios web comerciales.

Resultado de la búsqueda de datos sobre “coronavirus covid-19” en Google Dataset Search
Detalle de los resultados de búsqueda en Google Dataset Search

La interfaz de Google Dataset Search es similar a la del buscador estándar de Google, facilitando enormemente su uso. Los resultados incluyen metadatos sobre los conjuntos de datos, como la fuente, el formato y las condiciones de uso, permitiendo a los usuarios evaluar rápidamente la relevancia de los datos para sus proyectos. Además, la capacidad de filtrar resultados por atributos específicos, como el tipo de archivo y la licencia, ayuda a encontrar conjuntos de datos que se ajusten a necesidades particulares.

4. Data.gov

Data.gov es el portal oficial de datos abiertos del gobierno de los Estados Unidos. Lanzado el 30 de mayo de 2009, proporciona acceso a miles de conjuntos de datos de agencias federales, estatales y locales. Los conjuntos de datos cubren una amplia gama de temas, incluidos medio ambiente, salud, educación, transporte y más.

Una de las mayores ventajas de Data.gov es que los conjuntos de datos son generalmente de alta calidad y están bien documentados, ya que han sido proporcionados por agencias gubernamentales que siguen estándares estrictos de recopilación y mantenimiento de datos. Además, muchos de los conjuntos de datos son actualizados de forma regular. La plataforma también ofrece herramientas para explorar y visualizar los datos, facilitando la realización de análisis preliminares y la identificación de tendencias y patrones.

Quizás el único problema de esta plataforma, es que los datos son específicos de los Estados Unidos, por lo que pueden carecer de interés para algunos estudios.

5. Awesome Public Datasets

Awesome Public Datasets es una lista colaborativa mantenida en GitHub que recopila enlaces a conjuntos de datos públicos disponibles en la web. Siendo una lista actualizada y curada por la comunidad. Por lo que añaden nuevos recursos de forma continuada gracias a los colaboradores. En esta lista, los conjuntos de datos abarcan una amplia variedad de temas provenientes de diversas fuentes entre las que se incluyen universidades, organizaciones no gubernamentales y empresas.

Lo que hace especial a Awesome Public Datasets es su organización y categorización. Los conjuntos de datos están agrupados por temas específicos, como imágenes, texto, biología, economía y más, lo que facilita la búsqueda de datos relevantes para un campo particular. Además, cada entrada incluye una breve descripción del conjunto de datos y un enlace directo a la fuente, lo que simplifica el acceso y la descarga. Esta plataforma es especialmente útil para aquellos que buscan datos específicos o desean explorar nuevas áreas de investigación.

Publicidad


Conclusiones

El acceso a conjuntos de datos de calidad es imprescindible para la creación de modelos de aprendizaje automático robustos. Independientemente del modelo usado, si los datos no son de calidad, lo más probable es que las predicciones tampoco sean de calidad. Uno de los problemas más habituales al trabajar en aprendizaje automático. Las plataformas mencionadas anteriormente en esta entrada —UCI Machine Learning Repository, Kaggle Datasets, Google Dataset Search, Data.gov y Awesome Public Datasets— ofrecen una amplia variedad de datos que pueden ser utilizados en proyectos en múltiples áreas de investigación. Al acceder a estas plataformas no solo se puede obtener los conjuntos de datos, sino que también inspiración y conocimientos que pueden ayudar a mejorar significativamente los resultados de nuestros proyectos.

Imagen de Dimuth De Zoysa en Pixabay

¿Te ha parecido de utilidad el contenido?

¡Puntúalo entre una y cinco estrellas!

Puntuación promedio 0 / 5. Votos emitidos: 0

Ya que has encontrado útil este contenido...

¡Síguenos en redes sociales!

¡Siento que este contenido no te haya sido útil!

¡Déjame mejorar este contenido!

Dime, ¿cómo puedo mejorar este contenido?

Publicaciones relacionadas

  • Augurios deportivos y portadas malditas, o cuando The Economist predice mejor al revés – El bestiario de los indicadores económicos absurdos (parte 3)
  • Lanzamos el video de ScoreFlow: crea scorecards de crédito de forma ágil y sin IT
  • El bestiario de los indicadores económicos absurdos: El zoo patrio
  • Las fórmulas con DNI, o cómo dividir cualquier cosa entre cualquier otra cosa puede acabar publicado en un titular serio – El bestiario de los indicadores económicos absurdos (parte 5)
  • Data Leakage en Credit Scoring: El Error que Invalida tu Modelo
  • Analytics Lane lanza la versión 1.3 del laboratorio con nuevas herramientas de evaluación de modelos y utilidades prácticas
  • La liga internacional, o cuando Harvard y Johns Hopkins suman peras con manzanas – El bestiario de los indicadores económicos absurdos (parte 6)
  • Los indicadores que se autocumplen, o cuando medir es modificar – El bestiario de los indicadores económicos absurdos (parte 7)
  • Customer Lifetime Value: la fórmula clásica que todo analista debería dominar

Publicado en: Ciencia de datos, Reseñas Etiquetado como: Machine learning

Interacciones con los lectores

Deja una respuesta Cancelar la respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

I accept the Terms and Conditions and the Privacy Policy

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

Barra lateral principal

Suscríbete a nuestro boletín

Suscríbete al boletín semanal para estar al día de todas las publicaciones.

Política de Privacidad

Analytics Lane en redes sociales

  • Amazon
  • Bluesky
  • Facebook
  • GitHub
  • Instagram
  • Mastodon
  • Pinterest
  • RSS
  • Telegram
  • Tumblr
  • Twitter
  • YouTube

Publicidad

Entradas recientes

Los indicadores que se autocumplen, o cuando medir es modificar – El bestiario de los indicadores económicos absurdos (parte 7)

julio 16, 2026 Por Daniel Rodríguez

Customer Lifetime Value: la fórmula clásica que todo analista debería dominar

julio 14, 2026 Por Daniel Rodríguez

Noticias

Analytics Lane lanza la versión 1.4 del laboratorio con nuevas herramientas de conversión y modelos avanzados de CLV

julio 10, 2026 Por Daniel Rodríguez

Publicidad

Es tendencia

  • Visualización de datos categóricos en Seaborn publicado el agosto 1, 2023 | en Python
  • Error de VirtualBox: Kernel Driver Not Installed (rc=-1908) Solucionar problema de VirtualBox: Kernel Driver Not Installed (rc=-1908) publicado el octubre 21, 2022 | en Herramientas
  • Introducción a XGBoost: Instalación y primeros pasos publicado el abril 5, 2024 | en Ciencia de datos
  • Inteligencia artificial generativa en seguros: Cinco aplicaciones que están transformando la industria publicado el marzo 14, 2025 | en Ciencia de datos, Opinión
  • Introducción a igraph en R (Parte 3): Centralidad de Intermediación (Betweenness) en Grafos publicado el marzo 26, 2025 | en R

Publicidad

Lo mejor valorado

4.9 (24)

Seleccionar filas y columnas en Pandas con iloc y loc

4.6 (16)

Archivos JSON con Python: lectura y escritura

4.4 (14)

Ordenación de diccionarios en Python mediante clave o valor

4.7 (13)

Operaciones de filtrado de DataFrame con Pandas en base a los valores de las columnas

4.1 (11)

Aplicar el método D’Hondt en Excel

Comentarios recientes

  • bif en JSON en bases de datos: cuándo es buena idea y cuándo no
  • bif en Cómo desinstalar Oracle Database 19c en Windows
  • M. Pilar en Cómo eliminar las noticias en Windows 11 y recuperar tu concentración
  • Daniel Rodríguez en Probabilidad básica: cómo entender el azar en nuestra vida diaria
  • Pepe en Probabilidad básica: cómo entender el azar en nuestra vida diaria

Publicidad


Footer

Analytics Lane

  • Acerca de Analytics Lane
  • Boletín de noticias
  • Contacto
  • Libros
  • Lo más popular
  • Noticias
  • Tienda
  • Tiendas afiliadas

Secciones

  • Ciencia de datos
  • Criptografía
  • Herramientas
  • Machine Learning
  • Opinión
  • Productividad
  • Programación
  • Reseñas

Sobre de Analytics Lane

En Analytics Lane tratamos de explicar los principales conceptos de la ciencia e ingeniería de datos con un enfoque práctico. Los principales temas tratados son ciencia de datos, ingeniería de datos, inteligencia artificial, machine learning, deep learning y criptografía. Además, también se habla de los principales lenguajes de programación y herramientas utilizadas por los científicos e ingenieros de datos.

Copyright © 2018-2026 Analytics Lane ·Términos y condiciones ·Política de Cookies ·Política de Privacidad ·Herramientas de privacidad ·Contacto