El sesgo de datos en IA es la desviación sistemática del comportamiento de un modelo causada por defectos en los datos de entrenamiento, no por el algoritmo en sí. Es uno de los siete tipos de sesgo documentados y, posiblemente, el más frecuente en producción. Esta guía explica cómo identificarlo, cómo corregirlo y qué herramientas usar.

Qué es el sesgo de datos

El sesgo de datos aparece cuando el conjunto de entrenamiento no representa correctamente la realidad sobre la que el modelo va a actuar. Tres causas posibles: muestreo insuficiente de subgrupos, datos históricamente sesgados o etiquetado defectuoso por humanos.

Se distingue del sesgo algorítmico (que viene del diseño del modelo) en que la causa es externa al modelo. Datos malos producen modelos malos, por buena que sea la arquitectura.

3 sub-tipos de sesgo de datos

Sesgo de muestra

El dataset no representa a la población destinataria. Caso clásico: reconocimiento facial entrenado con rostros mayoritariamente blancos masculinos falla en mujeres de piel oscura (Buolamwini & Gebru, MIT 2018).

Sesgo histórico

Los datos reflejan desigualdades pasadas que el modelo perpetúa. Caso Amazon hiring: 10 años de contrataciones masculinizadas convierten al modelo en discriminador de mujeres.

Sesgo de etiquetado

Las anotaciones manuales contienen sesgos de los anotadores. Caso ImageNet: estudios han documentado etiquetas culturalmente sesgadas en categorías humanas.

Cómo identificarlo

  1. Análisis estadístico de la distribución de variables protegidas en el dataset.
  2. Comparación con la distribución de la población destinataria real.
  3. Análisis de etiquetado: qué fracción del dataset fue anotada por qué grupo de personas.
  4. Test post-modelo: equidad por subgrupo en validación holdout.

Cómo corregirlo

  • Recopilación adicional: el camino más limpio. Aumentar muestra de subgrupos infrarrepresentados.
  • Reponderación: dar más peso en entrenamiento a ejemplos de subgrupos minoritarios.
  • Resampling: SMOTE, oversampling, undersampling.
  • Datos sintéticos: generación con modelos generativos cuidando no introducir nuevos sesgos.
  • Re-etiquetado: revisión por equipo diverso de anotadores.

Herramientas open source

HerramientaUsoLicencia
AI Fairness 360 (IBM)Detección y mitigación pre-procesamientoApache 2.0
Fairlearn (Microsoft)Reponderación + métricasMIT
What-If Tool (Google)Análisis visual interactivoApache 2.0
AequitasReportes para stakeholders no técnicosMIT
Datasheets for DatasetsDocumentación estructurada de datasetsMarco abierto

Preguntas frecuentes

¿Es lo mismo sesgo de datos que sesgo de muestra?

El sesgo de muestra es uno de los tres sub-tipos del sesgo de datos.

¿Datos sintéticos resuelven el problema?

Pueden ayudar pero conllevan riesgo de introducir nuevos sesgos. Siempre validar con datos reales.

¿La auditoría de datos es obligatoria por AI Act?

Sí para sistemas alto riesgo. Art. 10 exige examen del dataset antes del entrenamiento.

En síntesis

El sesgo de datos es la causa más frecuente de sistemas de IA injustos. Tiene tres sub-tipos identificados, métodos técnicos para detectarlo y herramientas open source para mitigarlo. Para el contexto completo ver la guía pilar de sesgos en IA.

Fuentes: Buolamwini & Gebru, MIT 2018; AI Fairness 360 IBM; Fairlearn Microsoft; Datasheets for Datasets (Gebru et al. 2018); Reglamento (UE) 2024/1689 art. 10.

Autor: Daniel Bellido Pérez · iasostenible.com · 5 mayo 2026

Autor

· Especialista en IA aplicada y sostenibilidad. Análisis basado en fuentes oficiales: MITECO, IPCC, EUR-Lex, AEMET. Última revisión: 12 mayo 2026.

También te puede interesar

author avatar
Daniel Bellido Pérez

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *