La IA generativa no convierte todos los centros de datos en instalaciones iguales. Entrenamiento, ajuste e inferencia crean perfiles distintos de potencia, memoria, red, refrigeración y disponibilidad. El cambio importante no es solo consumir más electricidad: es concentrar cargas variables y térmicas en equipos acelerados que deben operar como un sistema.

Esta guía explica qué cambia físicamente, qué métricas permiten comparar diseños y cómo decidir entre adaptar una sala, crear una zona de alta densidad, contratar capacidad o construir nuevo. Evita cifras universales por rack porque dependen de configuración, generación de hardware, redundancia y límite térmico real.

Principio de diseño

No dimensione cada subsistema por separado. Potencia IT, distribución eléctrica, rechazo de calor, agua, red, almacenamiento y red exterior deben responder al mismo perfil de carga y al mismo nivel de servicio.

1. Qué hace diferente a una carga generativa

Entrenamiento

Distribuye un trabajo grande entre aceleradores durante periodos prolongados. Necesita intercambio de datos rápido y predecible; una interrupción puede perder tiempo de cálculo o exigir recuperar un punto de control. Potencia sostenida, red entre nodos y almacenamiento de checkpoints son críticos.

Ajuste y evaluación

Puede usar menos infraestructura, pero multiplica experimentos, versiones y conjuntos de evaluación. Una organización que solo dimensiona el entrenamiento final ignora el laboratorio que lo precede.

Inferencia interactiva

Prioriza latencia y disponibilidad. La demanda varía con usuarios, longitud de contexto, salida, modalidad y técnicas de razonamiento. Mantener capacidad lista para picos reduce utilización media.

Inferencia por lotes

Admite colas y programación temporal. Puede aprovechar mejor el equipo y desplazarse a horas convenientes, siempre que se respeten plazos y localización de datos.

Carga Restricción dominante Oportunidad de diseño
Entrenamiento distribuido Red, sincronización y potencia sostenida Programar trabajos y checkpoints robustos
Inferencia interactiva Latencia, picos y disponibilidad Enrutado, caché y modelos por nivel
Inferencia por lotes Plazo y capacidad total Agrupar y desplazar en el tiempo
Multimedia o agentes Duración, memoria y llamadas encadenadas Presupuestos y límites por tarea

La AIE señala que entrenamiento y uso de IA producen oscilaciones de potencia rápidas, diferentes de muchas cargas tradicionales. También advierte que vídeo, razonamiento y agentes pueden consumir mucho más por tarea que texto sencillo.

2. Potencia, racks y distribución eléctrica

Los aceleradores concentran cálculo y calor. Sin embargo, una cifra como «100 kW por rack» no describe una instalación: puede ser placa nominal, diseño, pico o uso medido. Pregunta siempre qué representa y durante cuánto tiempo.

Cadena eléctrica que debe verificarse

  1. capacidad y contrato de conexión;
  2. subestación y transformadores;
  3. generación o almacenamiento de respaldo;
  4. UPS y distribución;
  5. busway, PDU y alimentación de rack;
  6. fuentes del servidor y aceleradores.

La capacidad útil queda limitada por el eslabón menor, la redundancia y la temperatura. Sumar potencias nominales de servidores sin perfil de simultaneidad puede sobredimensionar; usar promedios sin picos puede disparar protecciones.

Redundancia no significa siempre 2N

El nivel adecuado depende del coste de interrupción y de la capacidad del software para reanudar o redistribuir. Una topología extrema puede duplicar equipos y pérdidas sin mejorar proporcionalmente el servicio. Diferencia cargas críticas, tolerantes a cola y recuperables.

Armónicos, rampas y calidad

Equipos de potencia, UPS y protecciones deben validarse con el comportamiento real de la carga. Las rampas rápidas importan para red y respaldo. Registra potencia a intervalos suficientemente cortos; un promedio mensual no revela eventos.

3. Refrigeración y agua

Más calor en menos espacio reduce el margen del aire, pero no impone una única tecnología. Existen aire optimizado, puertas traseras, directo al chip, inmersión y configuraciones híbridas. La elección depende de temperatura del fluido, equipo compatible, clima, agua, mantenimiento, seguridad y recuperación de calor.

Opción Ventaja Pregunta crítica
Aire optimizado Reutiliza infraestructura conocida ¿Cubre densidad y puntos calientes reales?
Puerta trasera Añade capacidad térmica por zona ¿Cómo se integran condensación y mantenimiento?
Directo al chip Extrae calor cerca de CPU/GPU ¿Qué componentes siguen dependiendo del aire?
Inmersión Alta transferencia térmica ¿Compatibilidad, fluido, servicio y fin de vida?

«Líquido» no significa «sin agua»

Un circuito interno cerrado puede rechazar calor mediante torre evaporativa, enfriadora o dry cooler. Para conocer el uso hídrico hay que seguir el sistema hasta el exterior, distinguir extracción de consumo y considerar estación y cuenca. La guía de agua de la IA desarrolla estas diferencias.

Temperatura útil para recuperar calor

El calor solo se reutiliza si existe una demanda próxima, temperatura adecuada, infraestructura y coincidencia temporal. Informar energía «disponible» no equivale a energía entregada. Mide el Energy Reuse Factor y el destino real.

Operación y seguridad

Incluye detección de fugas, calidad de fluido, corrosión, aislamiento, repuestos, procedimientos y formación. Una prueba térmica debe cubrir fallo de bomba, pérdida de suministro y transición de respaldo.

4. Red, memoria y almacenamiento

El cuello de botella puede no estar en el acelerador

Un dispositivo esperando datos consume y alarga el trabajo. Mide utilización junto a ancho de banda, latencia, memoria, I/O y comunicación colectiva. Comprar más aceleradores sin resolver red puede empeorar energía por resultado.

Topología de red

Entrenamiento distribuido exige conexiones rápidas dentro del clúster; inferencia puede necesitar tráfico este-oeste entre componentes y norte-sur hacia usuarios. Diseña rutas, sobreasignación y fallos para la carga, no solo para la velocidad de puerto.

Datos y checkpoints

Separar almacenamiento caliente, conjuntos de entrenamiento, artefactos y archivo reduce coste y energía. Define retención, deduplicación, borrado y recuperación. Copias abandonadas también ocupan discos y replicación.

5. Utilización y operación

La infraestructura eficiente con baja utilización puede ofrecer un resultado deficiente. Deben observarse simultáneamente potencia, trabajo útil y nivel de servicio.

Planificador consciente de restricciones

El programador puede agrupar trabajos, elegir hardware, respetar temperatura y mover tareas flexibles. La programación sensible al carbono solo debe usarse con factores horarios y sin trasladar impacto a agua o congestión.

Particionado y consolidación

Compartir aceleradores mejora ocupación en algunas cargas, pero puede introducir interferencia. Mide energía por resultado válido y latencia, no solo porcentaje de GPU.

Capacidad ociosa necesaria

Parte de la ociosidad sostiene disponibilidad y picos. No debe ocultarse ni eliminarse sin analizar SLO. La medición de producción de Google para Gemini incluye máquinas ociosas necesarias dentro del perímetro, un criterio más completo que observar solo el acelerador activo.

Para controles de modelo, caché, enrutado y MLOps consulta el playbook de Green AI.

6. Conexión a red y flexibilidad

La AIE estimó en 2025 que el consumo eléctrico mundial de centros de datos fue unos 415 TWh en 2024 y proyectó cerca de 945 TWh en 2030 en su escenario base. Son todos los centros de datos, no solo IA. El impacto local puede ser mucho mayor que el porcentaje mundial por concentración geográfica.

Interconexión

Antes de elegir ubicación confirma potencia firme, calendario, refuerzos, subestación, curtailment, calidad y coste. Un terreno disponible no garantiza conexión. Evita prometer plazos universales: dependen de red, permisos y cadena de suministro.

Flexibilidad real

Clasifica cargas:

  • interactivas que requieren respuesta inmediata;
  • aplazables dentro de una ventana;
  • interrumpibles con checkpoint;
  • críticas por seguridad o continuidad.

Solo las tres últimas pueden ofrecer flexibilidad en determinadas condiciones. Documenta tiempo de respuesta, duración, recuperación y efecto en calidad.

Electricidad contractual y física

Un PPA puede respaldar una declaración basada en mercado, pero no garantiza coincidencia horaria ni ausencia de congestión. Para operación y planificación conserva ubicación, hora, mezcla física e instrumentos contractuales como campos diferentes.

7. Métricas que deben medirse juntas

Métrica Pregunta que responde Límite
PUE = energía total / energía IT ¿Cuánta energía auxiliar acompaña a IT? No mide eficiencia del trabajo de IA
WUE = agua / energía IT ¿Qué agua entra por unidad IT? Necesita categoría, frontera y cuenca
ERF = energía reutilizada / energía total ¿Qué parte se entrega como uso útil? No describe calidad ni demanda evitada
REF = renovable / energía total ¿Qué fracción se declara renovable? No sustituye localización y horario
kWh por resultado válido ¿Es eficiente la carga? Requiere definición de calidad
kWh y MW absolutos ¿Cuál es el impacto total y pico? No normaliza producción

Agrega utilización de acelerador, latencia, errores, reintentos, tokens o unidad funcional y emisiones incorporadas cuando la decisión implique hardware.

8. Adaptar, contratar o construir

Adaptar una sala existente

Puede ser razonable si quedan capacidad eléctrica y térmica, espacio de tuberías, suelo, altura, redundancia y operación segura. Realiza una prueba de carga y un análisis de fallo. Evita asumir que cambiar puertas resuelve alimentación y rechazo exterior.

Crear una zona de alta densidad

Segmenta riesgos y permite convivir con cargas tradicionales. Comprueba interfaces entre circuitos, detección, distribución y procedimientos. Define quién opera cada lado.

Colocation o nube

Reduce inversión propia, pero puede perderse visibilidad. Pide energía IT asignada, PUE/WUE compatibles, región, método de carbono, agua, hardware, volumen y derecho de auditoría. No aceptes solo un certificado renovable.

Construcción nueva

Ofrece integración, pero añade carbono incorporado, permisos, red y plazos. Compara ciclo de vida con modernizar o contratar. Incluye escenario de demanda baja para evitar activos sobredimensionados.

Decisión Evidencia necesaria
Adaptar Capacidad medida, simulación térmica, prueba de carga y fallos
Zona dedicada Interfaces, segregación, operación y crecimiento
Contratar Datos asignados, SLA, región, agua, energía, salida y auditoría
Construir Interconexión, permisos, demanda, ACV y escenarios

9. Reporte de centros de datos en la UE

El Reglamento Delegado (UE) 2024/1364 desarrolla la primera fase del régimen común de evaluación. Se aplica al reporte de operadores con demanda de potencia IT instalada de al menos 500 kW. Desde 2025 la comunicación a la base europea se realiza cada año antes del 15 de mayo sobre el año anterior.

Los indicadores incluyen energía, potencia, temperaturas, calor reutilizado, agua y renovables. El reglamento define, entre otros, PUE, WUE, ERF y REF y publica información agregada por Estado y Unión. No afirma que cumplir un único umbral convierta un centro en sostenible.

Qué significa para una carga de IA

El reporte es de instalación. Para gestionar IA necesitas además asignar consumo a clúster, servicio y unidad funcional. PUE puede mejorar mientras la electricidad total aumenta; WUE medio puede ocultar una estación crítica.

Código de Conducta europeo

El Código de Conducta del JRC es una iniciativa voluntaria de mejores prácticas. No debe confundirse con la obligación de reporte de la Directiva de Eficiencia Energética.

10. Preguntas de compra y colocación

  1. ¿Qué potencia media, pico, rampa y simultaneidad se han medido?
  2. ¿Cuál es el perímetro de la energía declarada?
  3. ¿Qué capacidad útil queda después de redundancia y temperatura?
  4. ¿Cómo se extrae y rechaza el calor en cada estación?
  5. ¿Qué agua se extrae y consume, de qué fuente y cuenca?
  6. ¿Qué componentes siguen refrigerados por aire?
  7. ¿Qué PUE, WUE, ERF y REF corresponden a la instalación y periodo?
  8. ¿Cómo se asignan energía y agua al cliente o clúster?
  9. ¿Qué región, factor de carbono y método se usan?
  10. ¿Qué red, almacenamiento y memoria evitan espera del acelerador?
  11. ¿Qué cargas son flexibles y cómo se recuperan?
  12. ¿Qué datos se exportan al terminar el contrato?
  13. ¿Cómo se gestionan fugas, fallos, repuestos y formación?
  14. ¿Cuál es la vida útil y el plan de reutilización del hardware?
  15. ¿Qué cambio obliga a recalcular el diseño?

11. Preguntas frecuentes

¿Todo rack de IA necesita refrigeración líquida?

No. Depende de potencia, distribución, equipo, clima y margen de la sala. Puede existir aire optimizado o una solución híbrida. Valida condiciones reales.

¿Directo al chip elimina el aire?

No necesariamente. Memoria, red, fuentes y otros componentes pueden seguir disipando al aire. El porcentaje de calor capturado debe especificarse.

¿La refrigeración líquida consume menos agua?

No siempre. Depende de cómo se rechaza calor fuera del rack. Un circuito cerrado puede conectarse a refrigeración evaporativa. Mide la frontera completa.

¿PUE indica si la IA es eficiente?

No. PUE relaciona energía total e IT, pero no mide trabajo útil. Añade kWh por resultado válido y consumo absoluto.

¿Los centros existentes pueden adaptarse?

Algunos sí. La decisión requiere capacidad eléctrica, térmica, hidráulica, estructural y operativa. Una prueba es más fiable que una categoría por antigüedad.

¿El AI Act obliga a publicar PUE y WUE?

No. El reporte de centros de datos deriva de la Directiva de Eficiencia Energética y el Reglamento Delegado 2024/1364. El AI Act tiene obligaciones distintas por roles y modelos.

¿Los 945 TWh de 2030 son solo IA?

No. La proyección base de la AIE cubre todos los centros de datos. IA es un impulsor importante, junto con otros servicios digitales.

¿España es automáticamente una buena ubicación?

No existe una respuesta nacional única. Hay que evaluar nodo de red, permisos, agua, clima, demanda de calor, suelo, biodiversidad, telecomunicaciones y riesgos locales.

Fuentes y actualización

Guía revisada el 28 de julio de 2026. Se apoya en Key Questions on Energy and AI 2026 y Energy and AI 2025 de la AIE, el Reglamento Delegado (UE) 2024/1364, la página de la Comisión sobre rendimiento energético de centros de datos, el Código de Conducta del JRC y la medición de producción de Google. Separamos datos observados, diseño nominal y proyecciones.

author avatar
Daniel Bellido Pérez

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *