El sesgo de datos en IA es la desviación sistemática del comportamiento de un modelo causada por defectos en los datos de entrenamiento, no por el algoritmo en sí. Es uno de los siete tipos de sesgo documentados y, posiblemente, el más frecuente en producción. Esta guía explica cómo identificarlo, cómo corregirlo y qué herramientas usar.
Qué es el sesgo de datos
El sesgo de datos aparece cuando el conjunto de entrenamiento no representa correctamente la realidad sobre la que el modelo va a actuar. Tres causas posibles: muestreo insuficiente de subgrupos, datos históricamente sesgados o etiquetado defectuoso por humanos.
Se distingue del sesgo algorítmico (que viene del diseño del modelo) en que la causa es externa al modelo. Datos malos producen modelos malos, por buena que sea la arquitectura.
3 sub-tipos de sesgo de datos
Sesgo de muestra
El dataset no representa a la población destinataria. Caso clásico: reconocimiento facial entrenado con rostros mayoritariamente blancos masculinos falla en mujeres de piel oscura (Buolamwini & Gebru, MIT 2018).
Sesgo histórico
Los datos reflejan desigualdades pasadas que el modelo perpetúa. Caso Amazon hiring: 10 años de contrataciones masculinizadas convierten al modelo en discriminador de mujeres.
Sesgo de etiquetado
Las anotaciones manuales contienen sesgos de los anotadores. Caso ImageNet: estudios han documentado etiquetas culturalmente sesgadas en categorías humanas.
Cómo identificarlo
- Análisis estadístico de la distribución de variables protegidas en el dataset.
- Comparación con la distribución de la población destinataria real.
- Análisis de etiquetado: qué fracción del dataset fue anotada por qué grupo de personas.
- Test post-modelo: equidad por subgrupo en validación holdout.
Cómo corregirlo
- Recopilación adicional: el camino más limpio. Aumentar muestra de subgrupos infrarrepresentados.
- Reponderación: dar más peso en entrenamiento a ejemplos de subgrupos minoritarios.
- Resampling: SMOTE, oversampling, undersampling.
- Datos sintéticos: generación con modelos generativos cuidando no introducir nuevos sesgos.
- Re-etiquetado: revisión por equipo diverso de anotadores.
Herramientas open source
| Herramienta | Uso | Licencia |
|---|---|---|
| AI Fairness 360 (IBM) | Detección y mitigación pre-procesamiento | Apache 2.0 |
| Fairlearn (Microsoft) | Reponderación + métricas | MIT |
| What-If Tool (Google) | Análisis visual interactivo | Apache 2.0 |
| Aequitas | Reportes para stakeholders no técnicos | MIT |
| Datasheets for Datasets | Documentación estructurada de datasets | Marco abierto |
Preguntas frecuentes
¿Es lo mismo sesgo de datos que sesgo de muestra?
El sesgo de muestra es uno de los tres sub-tipos del sesgo de datos.
¿Datos sintéticos resuelven el problema?
Pueden ayudar pero conllevan riesgo de introducir nuevos sesgos. Siempre validar con datos reales.
¿La auditoría de datos es obligatoria por AI Act?
Sí para sistemas alto riesgo. Art. 10 exige examen del dataset antes del entrenamiento.
En síntesis
El sesgo de datos es la causa más frecuente de sistemas de IA injustos. Tiene tres sub-tipos identificados, métodos técnicos para detectarlo y herramientas open source para mitigarlo. Para el contexto completo ver la guía pilar de sesgos en IA.
Fuentes: Buolamwini & Gebru, MIT 2018; AI Fairness 360 IBM; Fairlearn Microsoft; Datasheets for Datasets (Gebru et al. 2018); Reglamento (UE) 2024/1689 art. 10.
Autor: Daniel Bellido Pérez · iasostenible.com · 5 mayo 2026


Deja una respuesta