Green AI es diseñar, desarrollar y operar sistemas de inteligencia artificial que cumplen su objetivo con la menor cantidad razonable de energía, carbono, agua y materiales. No consiste en poner el modelo en una nube «verde» después de construirlo: empieza al decidir si la tarea necesita IA, continúa al elegir arquitectura y modelo, y termina al vigilar el consumo absoluto durante toda la vida del servicio.

Esta guía es un playbook de ingeniería y gobernanza. Explica cómo convertir la sostenibilidad en requisitos medibles, cómo introducir presupuestos de recursos en el ciclo de desarrollo y cómo evitar que una mejora por consulta quede anulada por más tráfico. Las cifras de otros modelos y la contribución climática de la IA se analizan en artículos separados para no confundir objetivos.

Principio rector: optimiza impacto por resultado útil y también el total absoluto. Un modelo que consume menos por respuesta, pero falla más o se usa diez veces más, puede aumentar la huella final.

1. Qué es y qué no es Green AI

Green AI reduce la huella de la propia IA

Su objeto es el sistema digital: datos, experimentos, entrenamiento, inferencia, almacenamiento, red, infraestructura y equipos. Busca una relación mejor entre desempeño y recursos. La unidad puede ser Wh por documento correctamente procesado, gCO₂e por incidencia resuelta o litros de agua por mil predicciones válidas.

AI for Green aplica IA a un objetivo ambiental

Un algoritmo puede detectar fugas de metano, optimizar climatización o anticipar inundaciones. Eso es IA para sostenibilidad. No implica que el sistema sea eficiente ni que haya reducido emisiones: se necesitan una acción posterior y un contrafactual. En IA y cambio climático explicamos cómo separar huella propia de reducciones habilitadas.

No toda IA pequeña es sostenible

Un modelo pequeño ejecutado miles de millones de veces, en equipos infrautilizados o con respuestas inútiles puede tener más impacto total que un modelo mayor bien aprovechado. Tampoco ejecutar localmente es siempre mejor: un centro de datos eficiente puede compartir hardware, mientras un dispositivo doméstico puede permanecer infrautilizado y renovarse antes.

No es una etiqueta comercial

«Eficiente», «entrenado con renovables» o «carbono neutral» no describen por sí solos el sistema. Green AI requiere unidad funcional, método, límites, fecha, calidad y resultado absoluto. Una compensación no sustituye la reducción bruta de recursos.

2. Traducir sostenibilidad a requisitos de producto

Los equipos suelen definir precisión, latencia, disponibilidad, seguridad y coste. La eficiencia ambiental debe entrar en el mismo documento, con una prioridad y un propietario. Si aparece al final, la arquitectura ya habrá fijado gran parte del consumo.

Requisito Métrica de ejemplo Condición de aceptación
Calidad Porcentaje de casos aceptados sin corrección ≥ 95 % en el conjunto representativo
Energía Wh por caso aceptado No superar la línea base
Carbono gCO₂e por 1.000 operaciones −20 % con método constante
Volumen kWh y tCO₂e al mes Alerta si crece más que el valor aportado
Latencia Percentil 95 Dentro del objetivo del servicio
Agua Litros por unidad, si existe dato fiable Evitar regiones de estrés sin mitigación
Hardware Emisiones incorporadas amortizadas Documentar vida útil y utilización

La unidad funcional debe representar valor

«Por prompt» es cómodo, pero puede ocultar reintentos y resultados fallidos. Prefiere unidades como factura extraída correctamente, conversación resuelta, informe aprobado, kilómetro de carretera inspeccionado o predicción dentro del umbral. Así, una reducción de energía no se consigue degradando silenciosamente la calidad.

Usa dos límites: intensidad y presupuesto absoluto

La intensidad permite comparar versiones. El presupuesto absoluto controla el efecto escala. Un equipo puede exigir menos de 0,5 Wh por documento y, al mismo tiempo, un máximo mensual de 2 MWh. Si crece el uso, producto e ingeniería revisan si el valor justifica ampliar el presupuesto.

3. Crear una línea base reproducible

Congela una carga de trabajo representativa

Construye un conjunto de pruebas con distribución real de longitudes, idiomas, formatos, dificultad y errores. Incluye casos sencillos y extremos. Guarda la versión de datos, los criterios de calidad y las salidas aceptadas. Probar solo diez prompts cortos favorece modelos que después fallarán en producción.

Registra el sistema completo

Para hardware bajo control, CodeCarbon puede medir o estimar energía y emisiones del proceso. En APIs cerradas, EcoLogits ofrece estimaciones de inferencia basadas en modelos abiertos de ciclo de vida. Ninguna herramienta ve automáticamente todos los componentes: documenta CPU, GPU, memoria, tiempo, región, PUE, red y exclusiones.

Para comparar equipos de inferencia bajo tareas y restricciones controladas, los benchmarks de MLCommons Power integran medición de energía con MLPerf. Sus resultados son referencias de sistemas y escenarios específicos, no una predicción directa de tu aplicación.

Mide calentamiento, repetición y variabilidad

La primera ejecución puede cargar pesos y compilar kernels. Ejecuta una fase de calentamiento separada, varias repeticiones y reporta mediana, percentiles e intervalo. Mantén constantes concurrencia, tamaño de lote, precisión numérica, límites de salida y latencia. Sin ese control, una diferencia puede proceder del experimento y no de la mejora.

Conserva datos brutos y método

Guarda kWh antes de convertir a CO₂e. El factor de emisión puede actualizarse, pero la actividad observada debe permanecer. Registra versión de la herramienta, fuente eléctrica, fecha y si el carbono es basado en ubicación o mercado.

4. Elegir la arquitectura mínima antes del modelo

Primera opción: no usar un modelo generativo

Una validación de formato, consulta SQL, búsqueda exacta, regla de negocio o plantilla puede resolver tareas deterministas con menos coste y mayor auditabilidad. La pregunta inicial no es «qué LLM usamos», sino «qué decisión debemos automatizar y cuál es la solución más simple que cumple».

Recuperar antes que regenerar

Si la respuesta ya existe, recupérala. Un índice, una caché semántica o una base de conocimiento puede evitar que el modelo redacte de nuevo. Diseña caducidad, control de permisos y evaluación de respuestas reutilizadas para no ahorrar energía a costa de información obsoleta.

Reglas más modelo solo para excepciones

Un flujo híbrido clasifica primero los casos seguros y envía al modelo únicamente los ambiguos. Esto reduce llamadas y facilita explicar decisiones. Debe vigilarse el sesgo del filtro: no conviene derivar casos complejos de un grupo a una ruta de peor calidad.

Compra frente a construcción

Entrenar desde cero rara vez es la primera opción para una organización. Compara API, modelo abierto, ajuste eficiente, recuperación aumentada y reglas. Incluye en el coste experimentos, operación, seguridad, observabilidad y renovación del hardware; no solo el precio de una GPU o de tokens.

5. Enrutado y cartera de modelos

Un único modelo grande para todas las tareas simplifica la integración, pero desperdicia capacidad. Una cartera permite usar la opción mínima que satisface calidad y riesgo.

Ruta Casos Guardarraíl Métrica
Regla o recuperación Respuestas conocidas y validaciones Confianza y vigencia Porcentaje sin inferencia
Modelo pequeño Clasificación, extracción, resumen simple Umbral de calidad por clase Wh por resultado válido
Modelo medio Redacción y razonamiento moderado Evaluación factual y de seguridad Coste y energía por flujo
Modelo avanzado Casos difíciles o de alto valor Justificación de escalado Tasa de escalado y éxito incremental
Revisión humana Riesgo alto o baja confianza Cola y tiempo máximo Errores evitados

Enrutado estático

Asigna tareas conocidas a modelos concretos. Es fácil de auditar y evita que un clasificador de rutas añada otra inferencia. Funciona bien cuando los flujos son estables y el equipo puede mantener pruebas por tarea.

Enrutado dinámico

Un clasificador estima dificultad o confianza y escala solo cuando es necesario. Mide su coste y sus fallos. Un router que envía demasiado al modelo grande no ahorra; uno agresivo puede perjudicar calidad en grupos minoritarios.

Prueba el beneficio incremental

No preguntes si el modelo grande obtiene mejor puntuación, sino cuánto mejora respecto al pequeño y a qué coste. Si pasa de 94,8 % a 95,0 % mientras multiplica energía y latencia, quizá no merezca la ruta general; puede reservarse a la fracción donde la mejora es material.

6. Reducir datos, contexto y tokens

Elimina contexto que no cambia la decisión

En recuperación aumentada, mide qué fragmentos contribuyen. Ajusta número y tamaño de documentos, deduplica, filtra por permisos y resume historiales antiguos. Enviar un manual completo en cada consulta aumenta entrada, latencia y riesgo de contradicciones.

Diseña salidas con longitud adecuada

La investigación de UNESCO y University College London publicada en 2025 encontró, en su conjunto de modelos abiertos, que prompts y respuestas más cortos podían reducir energía en más del 50 %. No es un porcentaje universal, pero confirma una palanca medible: solicita el formato y detalle que el usuario necesita, no verbosidad automática.

No confundas cortesía con desperdicio

La prioridad no es perseguir palabras como «gracias», sino eliminar ciclos, contexto duplicado, reintentos y salidas que nadie utiliza. Una instrucción clara algo más larga puede evitar tres consultas fallidas y consumir menos en total.

Preprocesa una vez

Calcula embeddings, OCR, normalización o resúmenes cuando cambia el documento, no en cada pregunta. Registra la versión y vuelve a procesar solo lo afectado. El ahorro debe equilibrarse con almacenamiento y riesgo de datos obsoletos.

7. Optimizar el servicio en producción

Caché exacta y semántica

La caché exacta evita respuestas idénticas; la semántica reutiliza resultados parecidos. Define ámbitos por usuario, permisos y sensibilidad. En información médica, legal, financiera o cambiante, un falso acierto puede ser peor que la inferencia ahorrada.

Lotes y utilización

Agrupar peticiones eleva utilización del acelerador, pero puede aumentar espera. Ajusta lotes dinámicos según el objetivo de latencia y separa trabajos interactivos de procesamiento diferido. Informa energía por tarea y no solo potencia: un servidor de más vatios puede terminar antes y usar menos energía total.

Autoescalado con límite inferior

Demasiadas réplicas ociosas aumentan el impacto por petición. Muy pocas degradan latencia y provocan reintentos. Mide utilización, cola, arranques y capacidad reservada. El mínimo sostenible es el que cumple disponibilidad sin mantener exceso permanente.

Detención temprana y límites

Configura máximo de tokens, número de pasos de agente, tiempo, llamadas a herramientas y reintentos. Detecta bucles y respuestas suficientes. En entrenamiento, usa parada temprana según una métrica de validación definida antes del experimento.

Observabilidad por flujo

Una interfaz puede realizar clasificación, recuperación, generación, verificación y reformulación. Suma todas las llamadas y asigna impacto al flujo completo. Optimizar solo la generación principal oculta el coste de los pasos auxiliares.

8. Cuantización, destilación, poda y sparsidad

Cuantización

Reduce la precisión numérica de pesos o activaciones para disminuir memoria y, según hardware, energía y latencia. UNESCO/UCL observó ahorros de hasta el 44 % en los experimentos citados. Valida calidad, compatibilidad del acelerador y consumo medido: un formato no optimizado puede introducir conversiones y no aportar el ahorro esperado.

Destilación

Un modelo pequeño aprende de salidas o representaciones de uno mayor. Puede reducir inferencia repetida, pero crear el conjunto de destilación y entrenar también consume. Incluye ese coste inicial y amortízalo sobre el volumen real.

Poda y sparsidad

Eliminar pesos o activar solo partes del modelo reduce operaciones en teoría. El beneficio físico depende de que software y hardware aprovechen esa estructura. Informa FLOPs, tiempo y kWh; no des por hecho que una reducción matemática se convierte íntegramente en energía.

Ajuste eficiente de parámetros

Adaptadores de bajo rango y otras técnicas evitan actualizar todos los pesos. Comparan favorablemente con el ajuste completo en muchos casos, pero no siempre reducen la energía de inferencia. Separa eficiencia de entrenamiento y de servicio.

9. Hardware, lugar y momento

Ajusta el acelerador a la carga

Más nuevo no significa automáticamente más sostenible. Compara energía hasta alcanzar la calidad objetivo, memoria, utilización y vida útil. Una GPU grande infrautilizada puede ser peor que varias opciones pequeñas bien ocupadas; consolidar puede ser mejor si evita capacidad ociosa.

Desplaza cargas realmente flexibles

Entrenamiento, evaluación por lotes y generación diferida pueden programarse cuando la intensidad de carbono sea menor. El Carbon Aware SDK permite consultar datos de emisiones y construir decisiones temporales o geográficas. Conserva requisitos de privacidad, soberanía, agua, latencia y disponibilidad.

Distingue carbono medio y marginal

Un factor medio describe una mezcla; uno marginal intenta representar qué generación responde a un cambio de demanda. El enfoque adecuado depende de inventario o decisión operativa. Decláralo y realiza sensibilidad: mover una carga con el factor equivocado puede no lograr la reducción prevista.

La ubicación no resuelve el volumen

Una región de baja intensidad reduce carbono por kWh, pero una aplicación ineficiente seguirá usando electricidad, agua y equipos. Sigue primero la jerarquía de evitar y reducir; después optimiza lugar y tiempo.

10. Incluir hardware y ciclo de vida

Amortiza fabricación de forma transparente

Registra modelo y cantidad de equipos, fecha, utilización, vida útil prevista y fuente de emisiones incorporadas. Reparte por horas de uso o trabajo realizado y explica el criterio. Si no hay dato, marca la exclusión; no uses cero.

Alarga vida útil cuando el balance lo justifique

Reemplazar equipos puede reducir energía operativa, pero adelanta emisiones de fabricación. Calcula el punto de equilibrio: emisiones incorporadas del equipo nuevo divididas por ahorro operativo esperado por periodo. Añade fallos, capacidad y reutilización del equipo antiguo.

Agua y carbono pueden entrar en conflicto

La refrigeración evaporativa puede reducir electricidad y aumentar consumo de agua. Una región baja en carbono puede sufrir estrés hídrico. Green AI no optimiza una sola métrica: presenta el intercambio y prioriza según contexto local.

Evita trasladar la huella a la nube

Migrar un modelo fuera de la empresa elimina consumo del contador propio, no del sistema. Solicita datos al proveedor y registra el servicio en alcance 3 según el inventario aplicable.

11. Presupuestos de recursos en CI/CD y MLOps

La sostenibilidad se mantiene cuando una regresión bloquea o alerta igual que un fallo de seguridad o latencia. No hace falta detener todo desde el primer día: empieza observando, estabiliza la medición y después activa límites.

Etapa Prueba Salida Acción
Commit Conjunto pequeño y estable Calidad, tiempo y energía Aviso si cambia más del umbral
Pull request Benchmark representativo Wh por resultado válido Exigir explicación de regresión
Preproducción Carga y concurrencia Latencia, utilización y kWh Bloquear si incumple SLO
Producción Telemetría por flujo Intensidad y total mensual Alerta y revisión de capacidad
Trimestral Ciclo de vida y proveedor CO₂e, agua y hardware Repriorizar cartera y presupuesto

Ejemplo de presupuesto

  • Calidad mínima: 95 % de documentos válidos.
  • Latencia p95: menos de 2 segundos.
  • Energía: máximo 0,35 Wh por documento válido en el benchmark.
  • Regresión permitida: 5 % si mejora calidad o seguridad y queda justificada.
  • Presupuesto mensual: 500 kWh para el flujo completo.
  • Revisión: si tráfico o reintentos crecen un 20 %.

Los valores deben salir de tu línea base, no copiarse de este ejemplo. Versiona conjunto de pruebas, medidor y factores. Una mejora solo se acepta cuando usa el mismo método o explica el cambio.

Software Carbon Intensity

La norma ISO/IEC 21031:2024 define una metodología para calcular la intensidad de carbono de software por unidad funcional. Puede complementar la medición específica de IA al unir emisiones operativas e incorporadas con una unidad de servicio. No reemplaza evaluar calidad del modelo ni los impactos no climáticos.

12. Gobernanza y compra responsable

Responsabilidades claras

Rol Responsabilidad
Producto Define valor, unidad funcional y presupuesto absoluto
Datos/ML Compara modelos, calidad y experimentos
Plataforma Mide infraestructura, utilización y despliegue
Sostenibilidad Valida factores, perímetro y conexión con inventario
Seguridad/Legal Controla datos, región, proveedores y regulación
Compras Incluye transparencia y auditoría en contratos

Preguntas para proveedores

  • ¿Publican energía por unidad funcional y versión del modelo?
  • ¿Incluyen host, capacidad ociosa, PUE y hardware incorporado?
  • ¿Qué regiones, periodos y factores eléctricos utiliza la cifra?
  • ¿Distinguen datos medidos de estimados?
  • ¿Permiten exportar tokens, llamadas, caché y reintentos?
  • ¿Cómo notifican cambios de modelo que alteran calidad o consumo?
  • ¿Qué datos facilitan para el alcance 3 del cliente?
  • ¿Existe verificación externa y qué cubre exactamente?

España: UNE 0086:2025

La Especificación UNE 0086:2025 ofrece un marco para medir consumo energético, huella de carbono, agua y rendimiento de sistemas de IA a través de su ciclo de vida. Obliga a pensar conjuntamente en recursos y desempeño. Su uso debe declararse con precisión: seguir algunas métricas no equivale a certificación.

13. Antipatrones que parecen sostenibles

Elegir el modelo por parámetros

No mide activación, hardware, utilización ni calidad. Compara tareas y energía observada.

Reducir tokens sin medir reintentos

Una respuesta demasiado corta puede obligar a preguntar otra vez. Mide el flujo completo.

Migrar a una región «verde» sin límites

Puede aumentar latencia, red, agua o incumplir soberanía. Evalúa el sistema completo.

Comprar renovables y dejar de optimizar

Los contratos eléctricos no eliminan hardware, agua ni presión local. Continúa reduciendo energía absoluta.

Publicar porcentajes sin línea base

«90 % menos» no informa si cambió la tarea, calidad, lote o perímetro. Conserva valores absolutos y método.

Crear un dashboard sin propietario

Medir no cambia el sistema. Cada alerta necesita una persona, plazo y decisión asociada.

14. Plan de implantación de Green AI en 90 días

Días 1–30: inventario y línea base

  1. Selecciona los tres flujos de mayor volumen o coste.
  2. Define unidad funcional y calidad mínima.
  3. Instrumenta llamadas, tokens, tiempo, reintentos y energía disponible.
  4. Registra proveedor, modelo, región, hardware y exclusiones.
  5. Publica intensidad y total semanal sin fijar aún objetivos arbitrarios.

Días 31–60: experimentos controlados

  1. Prueba regla, recuperación, modelo pequeño y modelo actual.
  2. Reduce contexto, activa caché y limita salidas.
  3. Evalúa cuantización o ajuste eficiente cuando controles el modelo.
  4. Compara calidad, energía, latencia y coste con el mismo conjunto.
  5. Documenta efectos secundarios y grupos con peor resultado.

Días 61–90: presupuestos y operación

  1. Elige mejoras que sobrevivan al escenario conservador.
  2. Define umbrales de regresión en el pipeline.
  3. Asigna presupuesto absoluto al producto.
  4. Incluye preguntas de sostenibilidad en compras y renovaciones.
  5. Programa revisión trimestral de volumen, factores y hardware.

Al terminar, el entregable no es un sello: es una línea base reproducible, una cartera de decisiones, telemetría en producción y responsables capaces de actuar.

15. Preguntas frecuentes

¿Green AI y IA sostenible son lo mismo?

Se solapan, pero IA sostenible es más amplia e incluye efectos sociales, económicos, derechos y gobernanza. Green AI se centra en eficiencia de recursos e impacto ambiental del sistema.

¿Usar un modelo pequeño siempre reduce energía?

No siempre. Depende de hardware, implementación, lote, calidad y reintentos. UNESCO/UCL encontró reducciones de hasta el 90 % para modelos pequeños adaptados en las tareas estudiadas; úsalo como hipótesis que debes medir, no como garantía.

¿Es mejor ejecutar IA localmente?

Puede mejorar privacidad y evitar red, pero no garantiza menor huella. Compara utilización, eficiencia del dispositivo, vida útil, electricidad y volumen con la alternativa en nube.

¿Qué es más importante: entrenamiento o inferencia?

Depende del sistema. En un modelo poco usado, el desarrollo puede dominar. En un servicio masivo, la inferencia acumulada puede superarlo. Registra ambos y evita dividir entrenamiento por un volumen hipotético.

¿Debo usar CodeCarbon o EcoLogits?

CodeCarbon es adecuado para cómputo local o hardware controlado. EcoLogits estima llamadas a APIs generativas. Si el proveedor publica telemetría específica, consérvala como otro nivel de evidencia. En todos los casos documenta perímetro e incertidumbre.

¿Cómo sé si una optimización merece la pena?

Compara resultado útil, intensidad y total. Acepta la mejora si mantiene requisitos de calidad, seguridad y latencia, reduce recursos en pruebas reproducibles y no crea una subida de volumen que anule el ahorro.

¿La regulación europea obliga a que toda IA sea verde?

No establece un umbral universal de sostenibilidad para cada aplicación. Existen obligaciones y trabajos de normalización sobre consumo y documentación para determinados actores y modelos. Cumplir transparencia no demuestra eficiencia; cada organización debe definir y validar sus objetivos.

Conclusión: Green AI es una disciplina de producto

La eficiencia no pertenece solo al centro de datos ni a la persona que entrena el modelo. Se decide en la necesidad de producto, la arquitectura, los datos, el modelo, el servicio, el hardware, la compra y la política de crecimiento.

El enfoque más robusto combina cuatro elementos: una unidad funcional ligada a calidad, una línea base reproducible, límites de intensidad y volumen, y responsables que actúan ante regresiones. Con esa base, técnicas como enrutado, caché, lotes, cuantización o programación sensible al carbono dejan de ser una lista de buenas intenciones y se convierten en mejoras verificables.

Metodología y fuentes

Esta guía sintetiza documentación primaria y estándares: el informe de UNESCO y UCL sobre IA eficiente en recursos, la actualización Energy and AI 2026 de la AIE, la UNE 0086:2025, la ISO/IEC 21031:2024, MLCommons Power, CodeCarbon, EcoLogits y el Carbon Aware SDK. Los porcentajes experimentales se presentan con su contexto y no como garantías universales.

author avatar
Daniel Bellido Pérez

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *