La IA generativa no convierte todos los centros de datos en instalaciones iguales. Entrenamiento, ajuste e inferencia crean perfiles distintos de potencia, memoria, red, refrigeración y disponibilidad. El cambio importante no es solo consumir más electricidad: es concentrar cargas variables y térmicas en equipos acelerados que deben operar como un sistema.
Esta guía explica qué cambia físicamente, qué métricas permiten comparar diseños y cómo decidir entre adaptar una sala, crear una zona de alta densidad, contratar capacidad o construir nuevo. Evita cifras universales por rack porque dependen de configuración, generación de hardware, redundancia y límite térmico real.
Principio de diseño
No dimensione cada subsistema por separado. Potencia IT, distribución eléctrica, rechazo de calor, agua, red, almacenamiento y red exterior deben responder al mismo perfil de carga y al mismo nivel de servicio.
1. Qué hace diferente a una carga generativa
Entrenamiento
Distribuye un trabajo grande entre aceleradores durante periodos prolongados. Necesita intercambio de datos rápido y predecible; una interrupción puede perder tiempo de cálculo o exigir recuperar un punto de control. Potencia sostenida, red entre nodos y almacenamiento de checkpoints son críticos.
Ajuste y evaluación
Puede usar menos infraestructura, pero multiplica experimentos, versiones y conjuntos de evaluación. Una organización que solo dimensiona el entrenamiento final ignora el laboratorio que lo precede.
Inferencia interactiva
Prioriza latencia y disponibilidad. La demanda varía con usuarios, longitud de contexto, salida, modalidad y técnicas de razonamiento. Mantener capacidad lista para picos reduce utilización media.
Inferencia por lotes
Admite colas y programación temporal. Puede aprovechar mejor el equipo y desplazarse a horas convenientes, siempre que se respeten plazos y localización de datos.
| Carga | Restricción dominante | Oportunidad de diseño |
|---|---|---|
| Entrenamiento distribuido | Red, sincronización y potencia sostenida | Programar trabajos y checkpoints robustos |
| Inferencia interactiva | Latencia, picos y disponibilidad | Enrutado, caché y modelos por nivel |
| Inferencia por lotes | Plazo y capacidad total | Agrupar y desplazar en el tiempo |
| Multimedia o agentes | Duración, memoria y llamadas encadenadas | Presupuestos y límites por tarea |
La AIE señala que entrenamiento y uso de IA producen oscilaciones de potencia rápidas, diferentes de muchas cargas tradicionales. También advierte que vídeo, razonamiento y agentes pueden consumir mucho más por tarea que texto sencillo.
2. Potencia, racks y distribución eléctrica
Los aceleradores concentran cálculo y calor. Sin embargo, una cifra como «100 kW por rack» no describe una instalación: puede ser placa nominal, diseño, pico o uso medido. Pregunta siempre qué representa y durante cuánto tiempo.
Cadena eléctrica que debe verificarse
- capacidad y contrato de conexión;
- subestación y transformadores;
- generación o almacenamiento de respaldo;
- UPS y distribución;
- busway, PDU y alimentación de rack;
- fuentes del servidor y aceleradores.
La capacidad útil queda limitada por el eslabón menor, la redundancia y la temperatura. Sumar potencias nominales de servidores sin perfil de simultaneidad puede sobredimensionar; usar promedios sin picos puede disparar protecciones.
Redundancia no significa siempre 2N
El nivel adecuado depende del coste de interrupción y de la capacidad del software para reanudar o redistribuir. Una topología extrema puede duplicar equipos y pérdidas sin mejorar proporcionalmente el servicio. Diferencia cargas críticas, tolerantes a cola y recuperables.
Armónicos, rampas y calidad
Equipos de potencia, UPS y protecciones deben validarse con el comportamiento real de la carga. Las rampas rápidas importan para red y respaldo. Registra potencia a intervalos suficientemente cortos; un promedio mensual no revela eventos.
3. Refrigeración y agua
Más calor en menos espacio reduce el margen del aire, pero no impone una única tecnología. Existen aire optimizado, puertas traseras, directo al chip, inmersión y configuraciones híbridas. La elección depende de temperatura del fluido, equipo compatible, clima, agua, mantenimiento, seguridad y recuperación de calor.
| Opción | Ventaja | Pregunta crítica |
|---|---|---|
| Aire optimizado | Reutiliza infraestructura conocida | ¿Cubre densidad y puntos calientes reales? |
| Puerta trasera | Añade capacidad térmica por zona | ¿Cómo se integran condensación y mantenimiento? |
| Directo al chip | Extrae calor cerca de CPU/GPU | ¿Qué componentes siguen dependiendo del aire? |
| Inmersión | Alta transferencia térmica | ¿Compatibilidad, fluido, servicio y fin de vida? |
«Líquido» no significa «sin agua»
Un circuito interno cerrado puede rechazar calor mediante torre evaporativa, enfriadora o dry cooler. Para conocer el uso hídrico hay que seguir el sistema hasta el exterior, distinguir extracción de consumo y considerar estación y cuenca. La guía de agua de la IA desarrolla estas diferencias.
Temperatura útil para recuperar calor
El calor solo se reutiliza si existe una demanda próxima, temperatura adecuada, infraestructura y coincidencia temporal. Informar energía «disponible» no equivale a energía entregada. Mide el Energy Reuse Factor y el destino real.
Operación y seguridad
Incluye detección de fugas, calidad de fluido, corrosión, aislamiento, repuestos, procedimientos y formación. Una prueba térmica debe cubrir fallo de bomba, pérdida de suministro y transición de respaldo.
4. Red, memoria y almacenamiento
El cuello de botella puede no estar en el acelerador
Un dispositivo esperando datos consume y alarga el trabajo. Mide utilización junto a ancho de banda, latencia, memoria, I/O y comunicación colectiva. Comprar más aceleradores sin resolver red puede empeorar energía por resultado.
Topología de red
Entrenamiento distribuido exige conexiones rápidas dentro del clúster; inferencia puede necesitar tráfico este-oeste entre componentes y norte-sur hacia usuarios. Diseña rutas, sobreasignación y fallos para la carga, no solo para la velocidad de puerto.
Datos y checkpoints
Separar almacenamiento caliente, conjuntos de entrenamiento, artefactos y archivo reduce coste y energía. Define retención, deduplicación, borrado y recuperación. Copias abandonadas también ocupan discos y replicación.
5. Utilización y operación
La infraestructura eficiente con baja utilización puede ofrecer un resultado deficiente. Deben observarse simultáneamente potencia, trabajo útil y nivel de servicio.
Planificador consciente de restricciones
El programador puede agrupar trabajos, elegir hardware, respetar temperatura y mover tareas flexibles. La programación sensible al carbono solo debe usarse con factores horarios y sin trasladar impacto a agua o congestión.
Particionado y consolidación
Compartir aceleradores mejora ocupación en algunas cargas, pero puede introducir interferencia. Mide energía por resultado válido y latencia, no solo porcentaje de GPU.
Capacidad ociosa necesaria
Parte de la ociosidad sostiene disponibilidad y picos. No debe ocultarse ni eliminarse sin analizar SLO. La medición de producción de Google para Gemini incluye máquinas ociosas necesarias dentro del perímetro, un criterio más completo que observar solo el acelerador activo.
Para controles de modelo, caché, enrutado y MLOps consulta el playbook de Green AI.
6. Conexión a red y flexibilidad
La AIE estimó en 2025 que el consumo eléctrico mundial de centros de datos fue unos 415 TWh en 2024 y proyectó cerca de 945 TWh en 2030 en su escenario base. Son todos los centros de datos, no solo IA. El impacto local puede ser mucho mayor que el porcentaje mundial por concentración geográfica.
Interconexión
Antes de elegir ubicación confirma potencia firme, calendario, refuerzos, subestación, curtailment, calidad y coste. Un terreno disponible no garantiza conexión. Evita prometer plazos universales: dependen de red, permisos y cadena de suministro.
Flexibilidad real
Clasifica cargas:
- interactivas que requieren respuesta inmediata;
- aplazables dentro de una ventana;
- interrumpibles con checkpoint;
- críticas por seguridad o continuidad.
Solo las tres últimas pueden ofrecer flexibilidad en determinadas condiciones. Documenta tiempo de respuesta, duración, recuperación y efecto en calidad.
Electricidad contractual y física
Un PPA puede respaldar una declaración basada en mercado, pero no garantiza coincidencia horaria ni ausencia de congestión. Para operación y planificación conserva ubicación, hora, mezcla física e instrumentos contractuales como campos diferentes.
7. Métricas que deben medirse juntas
| Métrica | Pregunta que responde | Límite |
|---|---|---|
| PUE = energía total / energía IT | ¿Cuánta energía auxiliar acompaña a IT? | No mide eficiencia del trabajo de IA |
| WUE = agua / energía IT | ¿Qué agua entra por unidad IT? | Necesita categoría, frontera y cuenca |
| ERF = energía reutilizada / energía total | ¿Qué parte se entrega como uso útil? | No describe calidad ni demanda evitada |
| REF = renovable / energía total | ¿Qué fracción se declara renovable? | No sustituye localización y horario |
| kWh por resultado válido | ¿Es eficiente la carga? | Requiere definición de calidad |
| kWh y MW absolutos | ¿Cuál es el impacto total y pico? | No normaliza producción |
Agrega utilización de acelerador, latencia, errores, reintentos, tokens o unidad funcional y emisiones incorporadas cuando la decisión implique hardware.
8. Adaptar, contratar o construir
Adaptar una sala existente
Puede ser razonable si quedan capacidad eléctrica y térmica, espacio de tuberías, suelo, altura, redundancia y operación segura. Realiza una prueba de carga y un análisis de fallo. Evita asumir que cambiar puertas resuelve alimentación y rechazo exterior.
Crear una zona de alta densidad
Segmenta riesgos y permite convivir con cargas tradicionales. Comprueba interfaces entre circuitos, detección, distribución y procedimientos. Define quién opera cada lado.
Colocation o nube
Reduce inversión propia, pero puede perderse visibilidad. Pide energía IT asignada, PUE/WUE compatibles, región, método de carbono, agua, hardware, volumen y derecho de auditoría. No aceptes solo un certificado renovable.
Construcción nueva
Ofrece integración, pero añade carbono incorporado, permisos, red y plazos. Compara ciclo de vida con modernizar o contratar. Incluye escenario de demanda baja para evitar activos sobredimensionados.
| Decisión | Evidencia necesaria |
|---|---|
| Adaptar | Capacidad medida, simulación térmica, prueba de carga y fallos |
| Zona dedicada | Interfaces, segregación, operación y crecimiento |
| Contratar | Datos asignados, SLA, región, agua, energía, salida y auditoría |
| Construir | Interconexión, permisos, demanda, ACV y escenarios |
9. Reporte de centros de datos en la UE
El Reglamento Delegado (UE) 2024/1364 desarrolla la primera fase del régimen común de evaluación. Se aplica al reporte de operadores con demanda de potencia IT instalada de al menos 500 kW. Desde 2025 la comunicación a la base europea se realiza cada año antes del 15 de mayo sobre el año anterior.
Los indicadores incluyen energía, potencia, temperaturas, calor reutilizado, agua y renovables. El reglamento define, entre otros, PUE, WUE, ERF y REF y publica información agregada por Estado y Unión. No afirma que cumplir un único umbral convierta un centro en sostenible.
Qué significa para una carga de IA
El reporte es de instalación. Para gestionar IA necesitas además asignar consumo a clúster, servicio y unidad funcional. PUE puede mejorar mientras la electricidad total aumenta; WUE medio puede ocultar una estación crítica.
Código de Conducta europeo
El Código de Conducta del JRC es una iniciativa voluntaria de mejores prácticas. No debe confundirse con la obligación de reporte de la Directiva de Eficiencia Energética.
10. Preguntas de compra y colocación
- ¿Qué potencia media, pico, rampa y simultaneidad se han medido?
- ¿Cuál es el perímetro de la energía declarada?
- ¿Qué capacidad útil queda después de redundancia y temperatura?
- ¿Cómo se extrae y rechaza el calor en cada estación?
- ¿Qué agua se extrae y consume, de qué fuente y cuenca?
- ¿Qué componentes siguen refrigerados por aire?
- ¿Qué PUE, WUE, ERF y REF corresponden a la instalación y periodo?
- ¿Cómo se asignan energía y agua al cliente o clúster?
- ¿Qué región, factor de carbono y método se usan?
- ¿Qué red, almacenamiento y memoria evitan espera del acelerador?
- ¿Qué cargas son flexibles y cómo se recuperan?
- ¿Qué datos se exportan al terminar el contrato?
- ¿Cómo se gestionan fugas, fallos, repuestos y formación?
- ¿Cuál es la vida útil y el plan de reutilización del hardware?
- ¿Qué cambio obliga a recalcular el diseño?
11. Preguntas frecuentes
¿Todo rack de IA necesita refrigeración líquida?
No. Depende de potencia, distribución, equipo, clima y margen de la sala. Puede existir aire optimizado o una solución híbrida. Valida condiciones reales.
¿Directo al chip elimina el aire?
No necesariamente. Memoria, red, fuentes y otros componentes pueden seguir disipando al aire. El porcentaje de calor capturado debe especificarse.
¿La refrigeración líquida consume menos agua?
No siempre. Depende de cómo se rechaza calor fuera del rack. Un circuito cerrado puede conectarse a refrigeración evaporativa. Mide la frontera completa.
¿PUE indica si la IA es eficiente?
No. PUE relaciona energía total e IT, pero no mide trabajo útil. Añade kWh por resultado válido y consumo absoluto.
¿Los centros existentes pueden adaptarse?
Algunos sí. La decisión requiere capacidad eléctrica, térmica, hidráulica, estructural y operativa. Una prueba es más fiable que una categoría por antigüedad.
¿El AI Act obliga a publicar PUE y WUE?
No. El reporte de centros de datos deriva de la Directiva de Eficiencia Energética y el Reglamento Delegado 2024/1364. El AI Act tiene obligaciones distintas por roles y modelos.
¿Los 945 TWh de 2030 son solo IA?
No. La proyección base de la AIE cubre todos los centros de datos. IA es un impulsor importante, junto con otros servicios digitales.
¿España es automáticamente una buena ubicación?
No existe una respuesta nacional única. Hay que evaluar nodo de red, permisos, agua, clima, demanda de calor, suelo, biodiversidad, telecomunicaciones y riesgos locales.
Fuentes y actualización
Guía revisada el 28 de julio de 2026. Se apoya en Key Questions on Energy and AI 2026 y Energy and AI 2025 de la AIE, el Reglamento Delegado (UE) 2024/1364, la página de la Comisión sobre rendimiento energético de centros de datos, el Código de Conducta del JRC y la medición de producción de Google. Separamos datos observados, diseño nominal y proyecciones.


Deja una respuesta