Green AI es diseñar, desarrollar y operar sistemas de inteligencia artificial que cumplen su objetivo con la menor cantidad razonable de energía, carbono, agua y materiales. No consiste en poner el modelo en una nube «verde» después de construirlo: empieza al decidir si la tarea necesita IA, continúa al elegir arquitectura y modelo, y termina al vigilar el consumo absoluto durante toda la vida del servicio.
Esta guía es un playbook de ingeniería y gobernanza. Explica cómo convertir la sostenibilidad en requisitos medibles, cómo introducir presupuestos de recursos en el ciclo de desarrollo y cómo evitar que una mejora por consulta quede anulada por más tráfico. Las cifras de otros modelos y la contribución climática de la IA se analizan en artículos separados para no confundir objetivos.
Principio rector: optimiza impacto por resultado útil y también el total absoluto. Un modelo que consume menos por respuesta, pero falla más o se usa diez veces más, puede aumentar la huella final.
1. Qué es y qué no es Green AI
Green AI reduce la huella de la propia IA
Su objeto es el sistema digital: datos, experimentos, entrenamiento, inferencia, almacenamiento, red, infraestructura y equipos. Busca una relación mejor entre desempeño y recursos. La unidad puede ser Wh por documento correctamente procesado, gCO₂e por incidencia resuelta o litros de agua por mil predicciones válidas.
AI for Green aplica IA a un objetivo ambiental
Un algoritmo puede detectar fugas de metano, optimizar climatización o anticipar inundaciones. Eso es IA para sostenibilidad. No implica que el sistema sea eficiente ni que haya reducido emisiones: se necesitan una acción posterior y un contrafactual. En IA y cambio climático explicamos cómo separar huella propia de reducciones habilitadas.
No toda IA pequeña es sostenible
Un modelo pequeño ejecutado miles de millones de veces, en equipos infrautilizados o con respuestas inútiles puede tener más impacto total que un modelo mayor bien aprovechado. Tampoco ejecutar localmente es siempre mejor: un centro de datos eficiente puede compartir hardware, mientras un dispositivo doméstico puede permanecer infrautilizado y renovarse antes.
No es una etiqueta comercial
«Eficiente», «entrenado con renovables» o «carbono neutral» no describen por sí solos el sistema. Green AI requiere unidad funcional, método, límites, fecha, calidad y resultado absoluto. Una compensación no sustituye la reducción bruta de recursos.
2. Traducir sostenibilidad a requisitos de producto
Los equipos suelen definir precisión, latencia, disponibilidad, seguridad y coste. La eficiencia ambiental debe entrar en el mismo documento, con una prioridad y un propietario. Si aparece al final, la arquitectura ya habrá fijado gran parte del consumo.
| Requisito | Métrica de ejemplo | Condición de aceptación |
|---|---|---|
| Calidad | Porcentaje de casos aceptados sin corrección | ≥ 95 % en el conjunto representativo |
| Energía | Wh por caso aceptado | No superar la línea base |
| Carbono | gCO₂e por 1.000 operaciones | −20 % con método constante |
| Volumen | kWh y tCO₂e al mes | Alerta si crece más que el valor aportado |
| Latencia | Percentil 95 | Dentro del objetivo del servicio |
| Agua | Litros por unidad, si existe dato fiable | Evitar regiones de estrés sin mitigación |
| Hardware | Emisiones incorporadas amortizadas | Documentar vida útil y utilización |
La unidad funcional debe representar valor
«Por prompt» es cómodo, pero puede ocultar reintentos y resultados fallidos. Prefiere unidades como factura extraída correctamente, conversación resuelta, informe aprobado, kilómetro de carretera inspeccionado o predicción dentro del umbral. Así, una reducción de energía no se consigue degradando silenciosamente la calidad.
Usa dos límites: intensidad y presupuesto absoluto
La intensidad permite comparar versiones. El presupuesto absoluto controla el efecto escala. Un equipo puede exigir menos de 0,5 Wh por documento y, al mismo tiempo, un máximo mensual de 2 MWh. Si crece el uso, producto e ingeniería revisan si el valor justifica ampliar el presupuesto.
3. Crear una línea base reproducible
Congela una carga de trabajo representativa
Construye un conjunto de pruebas con distribución real de longitudes, idiomas, formatos, dificultad y errores. Incluye casos sencillos y extremos. Guarda la versión de datos, los criterios de calidad y las salidas aceptadas. Probar solo diez prompts cortos favorece modelos que después fallarán en producción.
Registra el sistema completo
Para hardware bajo control, CodeCarbon puede medir o estimar energía y emisiones del proceso. En APIs cerradas, EcoLogits ofrece estimaciones de inferencia basadas en modelos abiertos de ciclo de vida. Ninguna herramienta ve automáticamente todos los componentes: documenta CPU, GPU, memoria, tiempo, región, PUE, red y exclusiones.
Para comparar equipos de inferencia bajo tareas y restricciones controladas, los benchmarks de MLCommons Power integran medición de energía con MLPerf. Sus resultados son referencias de sistemas y escenarios específicos, no una predicción directa de tu aplicación.
Mide calentamiento, repetición y variabilidad
La primera ejecución puede cargar pesos y compilar kernels. Ejecuta una fase de calentamiento separada, varias repeticiones y reporta mediana, percentiles e intervalo. Mantén constantes concurrencia, tamaño de lote, precisión numérica, límites de salida y latencia. Sin ese control, una diferencia puede proceder del experimento y no de la mejora.
Conserva datos brutos y método
Guarda kWh antes de convertir a CO₂e. El factor de emisión puede actualizarse, pero la actividad observada debe permanecer. Registra versión de la herramienta, fuente eléctrica, fecha y si el carbono es basado en ubicación o mercado.
4. Elegir la arquitectura mínima antes del modelo
Primera opción: no usar un modelo generativo
Una validación de formato, consulta SQL, búsqueda exacta, regla de negocio o plantilla puede resolver tareas deterministas con menos coste y mayor auditabilidad. La pregunta inicial no es «qué LLM usamos», sino «qué decisión debemos automatizar y cuál es la solución más simple que cumple».
Recuperar antes que regenerar
Si la respuesta ya existe, recupérala. Un índice, una caché semántica o una base de conocimiento puede evitar que el modelo redacte de nuevo. Diseña caducidad, control de permisos y evaluación de respuestas reutilizadas para no ahorrar energía a costa de información obsoleta.
Reglas más modelo solo para excepciones
Un flujo híbrido clasifica primero los casos seguros y envía al modelo únicamente los ambiguos. Esto reduce llamadas y facilita explicar decisiones. Debe vigilarse el sesgo del filtro: no conviene derivar casos complejos de un grupo a una ruta de peor calidad.
Compra frente a construcción
Entrenar desde cero rara vez es la primera opción para una organización. Compara API, modelo abierto, ajuste eficiente, recuperación aumentada y reglas. Incluye en el coste experimentos, operación, seguridad, observabilidad y renovación del hardware; no solo el precio de una GPU o de tokens.
5. Enrutado y cartera de modelos
Un único modelo grande para todas las tareas simplifica la integración, pero desperdicia capacidad. Una cartera permite usar la opción mínima que satisface calidad y riesgo.
| Ruta | Casos | Guardarraíl | Métrica |
|---|---|---|---|
| Regla o recuperación | Respuestas conocidas y validaciones | Confianza y vigencia | Porcentaje sin inferencia |
| Modelo pequeño | Clasificación, extracción, resumen simple | Umbral de calidad por clase | Wh por resultado válido |
| Modelo medio | Redacción y razonamiento moderado | Evaluación factual y de seguridad | Coste y energía por flujo |
| Modelo avanzado | Casos difíciles o de alto valor | Justificación de escalado | Tasa de escalado y éxito incremental |
| Revisión humana | Riesgo alto o baja confianza | Cola y tiempo máximo | Errores evitados |
Enrutado estático
Asigna tareas conocidas a modelos concretos. Es fácil de auditar y evita que un clasificador de rutas añada otra inferencia. Funciona bien cuando los flujos son estables y el equipo puede mantener pruebas por tarea.
Enrutado dinámico
Un clasificador estima dificultad o confianza y escala solo cuando es necesario. Mide su coste y sus fallos. Un router que envía demasiado al modelo grande no ahorra; uno agresivo puede perjudicar calidad en grupos minoritarios.
Prueba el beneficio incremental
No preguntes si el modelo grande obtiene mejor puntuación, sino cuánto mejora respecto al pequeño y a qué coste. Si pasa de 94,8 % a 95,0 % mientras multiplica energía y latencia, quizá no merezca la ruta general; puede reservarse a la fracción donde la mejora es material.
6. Reducir datos, contexto y tokens
Elimina contexto que no cambia la decisión
En recuperación aumentada, mide qué fragmentos contribuyen. Ajusta número y tamaño de documentos, deduplica, filtra por permisos y resume historiales antiguos. Enviar un manual completo en cada consulta aumenta entrada, latencia y riesgo de contradicciones.
Diseña salidas con longitud adecuada
La investigación de UNESCO y University College London publicada en 2025 encontró, en su conjunto de modelos abiertos, que prompts y respuestas más cortos podían reducir energía en más del 50 %. No es un porcentaje universal, pero confirma una palanca medible: solicita el formato y detalle que el usuario necesita, no verbosidad automática.
No confundas cortesía con desperdicio
La prioridad no es perseguir palabras como «gracias», sino eliminar ciclos, contexto duplicado, reintentos y salidas que nadie utiliza. Una instrucción clara algo más larga puede evitar tres consultas fallidas y consumir menos en total.
Preprocesa una vez
Calcula embeddings, OCR, normalización o resúmenes cuando cambia el documento, no en cada pregunta. Registra la versión y vuelve a procesar solo lo afectado. El ahorro debe equilibrarse con almacenamiento y riesgo de datos obsoletos.
7. Optimizar el servicio en producción
Caché exacta y semántica
La caché exacta evita respuestas idénticas; la semántica reutiliza resultados parecidos. Define ámbitos por usuario, permisos y sensibilidad. En información médica, legal, financiera o cambiante, un falso acierto puede ser peor que la inferencia ahorrada.
Lotes y utilización
Agrupar peticiones eleva utilización del acelerador, pero puede aumentar espera. Ajusta lotes dinámicos según el objetivo de latencia y separa trabajos interactivos de procesamiento diferido. Informa energía por tarea y no solo potencia: un servidor de más vatios puede terminar antes y usar menos energía total.
Autoescalado con límite inferior
Demasiadas réplicas ociosas aumentan el impacto por petición. Muy pocas degradan latencia y provocan reintentos. Mide utilización, cola, arranques y capacidad reservada. El mínimo sostenible es el que cumple disponibilidad sin mantener exceso permanente.
Detención temprana y límites
Configura máximo de tokens, número de pasos de agente, tiempo, llamadas a herramientas y reintentos. Detecta bucles y respuestas suficientes. En entrenamiento, usa parada temprana según una métrica de validación definida antes del experimento.
Observabilidad por flujo
Una interfaz puede realizar clasificación, recuperación, generación, verificación y reformulación. Suma todas las llamadas y asigna impacto al flujo completo. Optimizar solo la generación principal oculta el coste de los pasos auxiliares.
8. Cuantización, destilación, poda y sparsidad
Cuantización
Reduce la precisión numérica de pesos o activaciones para disminuir memoria y, según hardware, energía y latencia. UNESCO/UCL observó ahorros de hasta el 44 % en los experimentos citados. Valida calidad, compatibilidad del acelerador y consumo medido: un formato no optimizado puede introducir conversiones y no aportar el ahorro esperado.
Destilación
Un modelo pequeño aprende de salidas o representaciones de uno mayor. Puede reducir inferencia repetida, pero crear el conjunto de destilación y entrenar también consume. Incluye ese coste inicial y amortízalo sobre el volumen real.
Poda y sparsidad
Eliminar pesos o activar solo partes del modelo reduce operaciones en teoría. El beneficio físico depende de que software y hardware aprovechen esa estructura. Informa FLOPs, tiempo y kWh; no des por hecho que una reducción matemática se convierte íntegramente en energía.
Ajuste eficiente de parámetros
Adaptadores de bajo rango y otras técnicas evitan actualizar todos los pesos. Comparan favorablemente con el ajuste completo en muchos casos, pero no siempre reducen la energía de inferencia. Separa eficiencia de entrenamiento y de servicio.
9. Hardware, lugar y momento
Ajusta el acelerador a la carga
Más nuevo no significa automáticamente más sostenible. Compara energía hasta alcanzar la calidad objetivo, memoria, utilización y vida útil. Una GPU grande infrautilizada puede ser peor que varias opciones pequeñas bien ocupadas; consolidar puede ser mejor si evita capacidad ociosa.
Desplaza cargas realmente flexibles
Entrenamiento, evaluación por lotes y generación diferida pueden programarse cuando la intensidad de carbono sea menor. El Carbon Aware SDK permite consultar datos de emisiones y construir decisiones temporales o geográficas. Conserva requisitos de privacidad, soberanía, agua, latencia y disponibilidad.
Distingue carbono medio y marginal
Un factor medio describe una mezcla; uno marginal intenta representar qué generación responde a un cambio de demanda. El enfoque adecuado depende de inventario o decisión operativa. Decláralo y realiza sensibilidad: mover una carga con el factor equivocado puede no lograr la reducción prevista.
La ubicación no resuelve el volumen
Una región de baja intensidad reduce carbono por kWh, pero una aplicación ineficiente seguirá usando electricidad, agua y equipos. Sigue primero la jerarquía de evitar y reducir; después optimiza lugar y tiempo.
10. Incluir hardware y ciclo de vida
Amortiza fabricación de forma transparente
Registra modelo y cantidad de equipos, fecha, utilización, vida útil prevista y fuente de emisiones incorporadas. Reparte por horas de uso o trabajo realizado y explica el criterio. Si no hay dato, marca la exclusión; no uses cero.
Alarga vida útil cuando el balance lo justifique
Reemplazar equipos puede reducir energía operativa, pero adelanta emisiones de fabricación. Calcula el punto de equilibrio: emisiones incorporadas del equipo nuevo divididas por ahorro operativo esperado por periodo. Añade fallos, capacidad y reutilización del equipo antiguo.
Agua y carbono pueden entrar en conflicto
La refrigeración evaporativa puede reducir electricidad y aumentar consumo de agua. Una región baja en carbono puede sufrir estrés hídrico. Green AI no optimiza una sola métrica: presenta el intercambio y prioriza según contexto local.
Evita trasladar la huella a la nube
Migrar un modelo fuera de la empresa elimina consumo del contador propio, no del sistema. Solicita datos al proveedor y registra el servicio en alcance 3 según el inventario aplicable.
11. Presupuestos de recursos en CI/CD y MLOps
La sostenibilidad se mantiene cuando una regresión bloquea o alerta igual que un fallo de seguridad o latencia. No hace falta detener todo desde el primer día: empieza observando, estabiliza la medición y después activa límites.
| Etapa | Prueba | Salida | Acción |
|---|---|---|---|
| Commit | Conjunto pequeño y estable | Calidad, tiempo y energía | Aviso si cambia más del umbral |
| Pull request | Benchmark representativo | Wh por resultado válido | Exigir explicación de regresión |
| Preproducción | Carga y concurrencia | Latencia, utilización y kWh | Bloquear si incumple SLO |
| Producción | Telemetría por flujo | Intensidad y total mensual | Alerta y revisión de capacidad |
| Trimestral | Ciclo de vida y proveedor | CO₂e, agua y hardware | Repriorizar cartera y presupuesto |
Ejemplo de presupuesto
- Calidad mínima: 95 % de documentos válidos.
- Latencia p95: menos de 2 segundos.
- Energía: máximo 0,35 Wh por documento válido en el benchmark.
- Regresión permitida: 5 % si mejora calidad o seguridad y queda justificada.
- Presupuesto mensual: 500 kWh para el flujo completo.
- Revisión: si tráfico o reintentos crecen un 20 %.
Los valores deben salir de tu línea base, no copiarse de este ejemplo. Versiona conjunto de pruebas, medidor y factores. Una mejora solo se acepta cuando usa el mismo método o explica el cambio.
Software Carbon Intensity
La norma ISO/IEC 21031:2024 define una metodología para calcular la intensidad de carbono de software por unidad funcional. Puede complementar la medición específica de IA al unir emisiones operativas e incorporadas con una unidad de servicio. No reemplaza evaluar calidad del modelo ni los impactos no climáticos.
12. Gobernanza y compra responsable
Responsabilidades claras
| Rol | Responsabilidad |
|---|---|
| Producto | Define valor, unidad funcional y presupuesto absoluto |
| Datos/ML | Compara modelos, calidad y experimentos |
| Plataforma | Mide infraestructura, utilización y despliegue |
| Sostenibilidad | Valida factores, perímetro y conexión con inventario |
| Seguridad/Legal | Controla datos, región, proveedores y regulación |
| Compras | Incluye transparencia y auditoría en contratos |
Preguntas para proveedores
- ¿Publican energía por unidad funcional y versión del modelo?
- ¿Incluyen host, capacidad ociosa, PUE y hardware incorporado?
- ¿Qué regiones, periodos y factores eléctricos utiliza la cifra?
- ¿Distinguen datos medidos de estimados?
- ¿Permiten exportar tokens, llamadas, caché y reintentos?
- ¿Cómo notifican cambios de modelo que alteran calidad o consumo?
- ¿Qué datos facilitan para el alcance 3 del cliente?
- ¿Existe verificación externa y qué cubre exactamente?
España: UNE 0086:2025
La Especificación UNE 0086:2025 ofrece un marco para medir consumo energético, huella de carbono, agua y rendimiento de sistemas de IA a través de su ciclo de vida. Obliga a pensar conjuntamente en recursos y desempeño. Su uso debe declararse con precisión: seguir algunas métricas no equivale a certificación.
13. Antipatrones que parecen sostenibles
Elegir el modelo por parámetros
No mide activación, hardware, utilización ni calidad. Compara tareas y energía observada.
Reducir tokens sin medir reintentos
Una respuesta demasiado corta puede obligar a preguntar otra vez. Mide el flujo completo.
Migrar a una región «verde» sin límites
Puede aumentar latencia, red, agua o incumplir soberanía. Evalúa el sistema completo.
Comprar renovables y dejar de optimizar
Los contratos eléctricos no eliminan hardware, agua ni presión local. Continúa reduciendo energía absoluta.
Publicar porcentajes sin línea base
«90 % menos» no informa si cambió la tarea, calidad, lote o perímetro. Conserva valores absolutos y método.
Crear un dashboard sin propietario
Medir no cambia el sistema. Cada alerta necesita una persona, plazo y decisión asociada.
14. Plan de implantación de Green AI en 90 días
Días 1–30: inventario y línea base
- Selecciona los tres flujos de mayor volumen o coste.
- Define unidad funcional y calidad mínima.
- Instrumenta llamadas, tokens, tiempo, reintentos y energía disponible.
- Registra proveedor, modelo, región, hardware y exclusiones.
- Publica intensidad y total semanal sin fijar aún objetivos arbitrarios.
Días 31–60: experimentos controlados
- Prueba regla, recuperación, modelo pequeño y modelo actual.
- Reduce contexto, activa caché y limita salidas.
- Evalúa cuantización o ajuste eficiente cuando controles el modelo.
- Compara calidad, energía, latencia y coste con el mismo conjunto.
- Documenta efectos secundarios y grupos con peor resultado.
Días 61–90: presupuestos y operación
- Elige mejoras que sobrevivan al escenario conservador.
- Define umbrales de regresión en el pipeline.
- Asigna presupuesto absoluto al producto.
- Incluye preguntas de sostenibilidad en compras y renovaciones.
- Programa revisión trimestral de volumen, factores y hardware.
Al terminar, el entregable no es un sello: es una línea base reproducible, una cartera de decisiones, telemetría en producción y responsables capaces de actuar.
15. Preguntas frecuentes
¿Green AI y IA sostenible son lo mismo?
Se solapan, pero IA sostenible es más amplia e incluye efectos sociales, económicos, derechos y gobernanza. Green AI se centra en eficiencia de recursos e impacto ambiental del sistema.
¿Usar un modelo pequeño siempre reduce energía?
No siempre. Depende de hardware, implementación, lote, calidad y reintentos. UNESCO/UCL encontró reducciones de hasta el 90 % para modelos pequeños adaptados en las tareas estudiadas; úsalo como hipótesis que debes medir, no como garantía.
¿Es mejor ejecutar IA localmente?
Puede mejorar privacidad y evitar red, pero no garantiza menor huella. Compara utilización, eficiencia del dispositivo, vida útil, electricidad y volumen con la alternativa en nube.
¿Qué es más importante: entrenamiento o inferencia?
Depende del sistema. En un modelo poco usado, el desarrollo puede dominar. En un servicio masivo, la inferencia acumulada puede superarlo. Registra ambos y evita dividir entrenamiento por un volumen hipotético.
¿Debo usar CodeCarbon o EcoLogits?
CodeCarbon es adecuado para cómputo local o hardware controlado. EcoLogits estima llamadas a APIs generativas. Si el proveedor publica telemetría específica, consérvala como otro nivel de evidencia. En todos los casos documenta perímetro e incertidumbre.
¿Cómo sé si una optimización merece la pena?
Compara resultado útil, intensidad y total. Acepta la mejora si mantiene requisitos de calidad, seguridad y latencia, reduce recursos en pruebas reproducibles y no crea una subida de volumen que anule el ahorro.
¿La regulación europea obliga a que toda IA sea verde?
No establece un umbral universal de sostenibilidad para cada aplicación. Existen obligaciones y trabajos de normalización sobre consumo y documentación para determinados actores y modelos. Cumplir transparencia no demuestra eficiencia; cada organización debe definir y validar sus objetivos.
Conclusión: Green AI es una disciplina de producto
La eficiencia no pertenece solo al centro de datos ni a la persona que entrena el modelo. Se decide en la necesidad de producto, la arquitectura, los datos, el modelo, el servicio, el hardware, la compra y la política de crecimiento.
El enfoque más robusto combina cuatro elementos: una unidad funcional ligada a calidad, una línea base reproducible, límites de intensidad y volumen, y responsables que actúan ante regresiones. Con esa base, técnicas como enrutado, caché, lotes, cuantización o programación sensible al carbono dejan de ser una lista de buenas intenciones y se convierten en mejoras verificables.
Metodología y fuentes
Esta guía sintetiza documentación primaria y estándares: el informe de UNESCO y UCL sobre IA eficiente en recursos, la actualización Energy and AI 2026 de la AIE, la UNE 0086:2025, la ISO/IEC 21031:2024, MLCommons Power, CodeCarbon, EcoLogits y el Carbon Aware SDK. Los porcentajes experimentales se presentan con su contexto y no como garantías universales.


Deja una respuesta