No existe una cifra única para la huella de carbono de la inteligencia artificial. Un entrenamiento completo, una consulta de texto y una imagen generada son unidades distintas. También cambian el hardware, la duración, el centro de datos, la electricidad y las emisiones incluidas. Por eso, dos números correctos pueden diferir cien veces y, aun así, no contradecirse.

Esta guía funciona como una ficha de evidencia: reúne cifras públicas que permiten aprender cómo se mide la IA, explica qué incluyen y señala qué comparaciones no son válidas. No pretende crear un ranking de modelos «verdes», porque los proveedores todavía no publican datos equivalentes para productos y periodos comparables.

Dato clave: una cifra de CO₂e sin fase, unidad funcional, fecha, ubicación, fuente de electricidad y límites del sistema no sirve para comparar modelos. Antes de usarla, exige al menos esos seis campos.

1. Qué significa huella de carbono de la IA

La huella de carbono expresa el conjunto de gases de efecto invernadero en masa de dióxido de carbono equivalente, CO₂e. En IA puede referirse a una fase muy concreta o a un ciclo de vida más amplio. La etiqueta «huella del modelo» es ambigua si no se aclara cuál.

Desarrollo y experimentación

Antes del entrenamiento final se prueban arquitecturas, conjuntos de datos, hiperparámetros y versiones fallidas. Muchos artículos solo publican el consumo de la ejecución final; el trabajo exploratorio puede quedar fuera. No es un error si se declara, pero sí lo es presentar esa cifra como huella completa de desarrollo.

Preentrenamiento y ajuste

El preentrenamiento suele concentrar una gran carga computacional en modelos fundacionales. Después pueden existir ajuste supervisado, aprendizaje por preferencias, evaluaciones de seguridad y actualizaciones. Cada fase requiere su propia actividad y factores de emisión.

Inferencia o uso

Es la operación repetida cuando una persona o aplicación solicita una salida. Su impacto unitario puede ser pequeño frente al entrenamiento, pero se multiplica por el número de peticiones. Longitud de entrada y salida, modalidad, razonamiento, tamaño de lote, latencia, utilización del hardware y capacidad ociosa cambian el resultado.

Infraestructura y ciclo de vida

La electricidad no es toda la huella. Fabricar aceleradores, servidores y edificios también genera emisiones; además existen red, almacenamiento, refrigeración, pérdidas eléctricas y fin de vida. Un estudio puede medir solo el chip activo mientras otro amortiza toda la plataforma. Compararlos sin corregir el perímetro premia al que omite más componentes.

Para el panorama completo —agua, materiales, territorio y residuos— consulta nuestro análisis del impacto ambiental de la IA. Aquí nos concentramos en energía y carbono.

2. La ficha mínima de un dato fiable

Cada cifra debería poder reconstruirse con una ficha semejante a esta:

Campo Pregunta que responde Ejemplo de valor
Objeto ¿Qué sistema o versión se midió? Modelo X, servicio Y
Fase ¿Desarrollo, entrenamiento, ajuste o inferencia? Inferencia en producción
Unidad funcional ¿A qué se refiere el resultado? Prompt mediano de texto
Fecha ¿Cuándo se tomó la muestra? Mayo de 2025
Actividad ¿Qué energía o cómputo se registró? 0,24 Wh por prompt
Perímetro ¿Incluye CPU, memoria, inactividad y PUE? Pila completa de servicio
Electricidad ¿Qué factor y enfoque se aplicaron? Emisiones de mercado
Hardware ¿Incluye fabricación amortizada? Aceleradores incluidos
Método ¿Medición, asignación o estimación? Telemetría de producción
Incertidumbre ¿Qué rango y limitaciones existen? No generalizable a imagen

Si faltan fecha o versión, el dato envejece mal: la eficiencia de hardware y software cambia con rapidez. Si falta la unidad funcional, no sabemos si se midió un token, una respuesta, una sesión o un millón de peticiones. Si falta el perímetro, no puede compararse con otro estudio.

3. Cifras públicas de entrenamiento: qué dicen realmente

La siguiente tabla conserva el contexto de la fuente. No es una clasificación de eficiencia ni permite deducir el consumo de las versiones comerciales actuales.

Modelo y publicación Actividad declarada Emisiones declaradas o calculadas Lectura correcta
GPT‑3, análisis de Patterson et al. (2021) 1.287 MWh para el entrenamiento analizado 502 tCO₂e dinámicas; 552 tCO₂e al aplicar PUE en la comparación posterior de BLOOM Estimación retrospectiva con información compartida; no es GPT‑4 ni ChatGPT actual
OPT‑175B, Meta (2022) 324 MWh en la tabla comparativa de BLOOM Unas 70 tCO₂e dinámicas y 76,3 tCO₂e con PUE El artículo de OPT describe también experimentos; hay que verificar qué ejecuciones incluye cada total
BLOOM‑176B, Luccioni et al. (2022) 433 MWh en entrenamiento final 24,7 tCO₂e de consumo dinámico; 50,5 tCO₂e al ampliar a fabricación y operación La diferencia entre 24,7 y 50,5 demuestra el efecto del perímetro
Familia Llama 2, Meta (2023) 3,3 millones de horas de GPU para 7B, 13B, 34B y 70B 539 tCO₂e estimadas en conjunto; 291,42 tCO₂e para 70B Usa potencia máxima ajustada por PUE; excluye fabricación, interconexión y otros consumos

GPT‑3: una estimación útil, no una constante

El trabajo Carbon Emissions and Large Neural Network Training calculó energía y emisiones para varios modelos y mostró que arquitectura, procesador, centro de datos y ubicación pueden modificar el resultado en órdenes de magnitud. Su valor principal no es convertir 552 toneladas en un «precio» permanente de entrenar IA, sino documentar por qué las estimaciones retroactivas son frágiles.

Aplicar esa cifra a GPT‑4, GPT‑4o o cualquier servicio actual es incorrecto. Cambian arquitectura, datos, aceleradores, optimización, periodo y electricidad; además, los proveedores no han publicado un inventario de entrenamiento equivalente para todas esas versiones.

BLOOM: tres resultados para un mismo entrenamiento

El estudio de BLOOM estimó 24,7 tCO₂e considerando el consumo eléctrico dinámico del entrenamiento final. La cifra sube al ampliar límites: el artículo estima 50,5 tCO₂e desde fabricación de equipos hasta consumo operativo. Ninguna cifra es «la mentira»; responden a preguntas diferentes.

También muestra por qué energía y carbono no son sinónimos. BLOOM consumió cientos de MWh, pero se ejecutó con electricidad de baja intensidad de carbono en el supercomputador Jean Zay. Trasladar la misma energía a otro lugar o momento cambiaría las emisiones operativas.

Llama 2: familia completa frente a un solo tamaño

El artículo de Llama 2 estima 539 tCO₂e para entrenar la familia de cuatro tamaños. De ese total, 291,42 tCO₂e corresponden a 70B. Confundir el dato familiar con el modelo de 70.000 millones o transformar toneladas en MWh produce tablas falsas.

Los autores explican que usan la potencia de diseño térmico de las GPU, no una lectura completa de cada componente, y que quedan fuera interconexiones, hardware incorporado y otros consumos. Además, que las emisiones fueran compensadas no elimina las emisiones brutas del entrenamiento.

4. Cifras públicas de inferencia: la unidad cambia el resultado

Servicio o referencia Resultado Perímetro y calidad No permite afirmar
Gemini Apps, mediana de texto, mayo de 2025 0,24 Wh; 0,03 gCO₂e; 0,26 ml de agua por prompt Medición de producción de Google con acelerador, host, capacidad ociosa, sobrecarga y parte incorporada El consumo de todos los prompts, imágenes, vídeos o versiones futuras
ChatGPT con GPT‑4o, referencia difundida por OpenAI Academy Alrededor de 0,3 Wh por consulta típica Estimación independiente de Epoch AI, reconocida por OpenAI; no es telemetría pública del proveedor Una cifra de CO₂e sin región, electricidad y perímetro adicionales

Gemini: por qué el perímetro duplicó la cifra estrecha

El estudio de Google Measuring the Environmental Impact of Delivering AI at Google Scale midió el prompt mediano de texto de Gemini Apps. El enfoque estrecho —principalmente aceleradores activos y centros más eficientes— daba 0,10 Wh. El método completo llegó a 0,24 Wh al incluir CPU y memoria, máquinas ociosas necesarias para disponibilidad y sobrecarga del centro de datos.

La lección es más importante que la comparación doméstica: omitir capacidad reservada y sistemas auxiliares reduce artificialmente el impacto por petición. Google también declara 0,03 gCO₂e con un enfoque de mercado y una parte de emisiones incorporadas del acelerador. Ese valor no debe recalcularse aplicando otra vez un factor eléctrico, porque se duplicaría una etapa ya incluida.

ChatGPT: estimación reconocida, pero no medición equivalente

OpenAI Academy señala que una consulta típica de GPT‑4o probablemente consume unos 0,3 Wh, citando un análisis independiente. También reconoce que no se han publicado benchmarks energéticos propietarios equivalentes para GPT‑4. Por ello, la cifra es útil como orden de magnitud, no como una medición de producto comparable con la metodología de Google.

Para la situación de transparencia de cada proveedor, consulta nuestra comparación entre ChatGPT, Claude y Gemini. Esta página mantiene el foco en la calidad del dato, no en declarar un ganador.

5. Por qué estas cifras no deben ordenarse como un ranking

Entrenamiento no es inferencia

Dividir las emisiones de entrenamiento entre una petición no funciona sin conocer la vida útil, el tráfico, las actualizaciones y el reparto entre productos. Un modelo puede entrenarse una vez y utilizarse miles de millones de veces; otro puede necesitar reentrenamientos frecuentes y poco uso.

Un prompt no es una tarea estable

Un saludo breve, un documento largo, una respuesta con razonamiento, una imagen y un vídeo requieren trabajo diferente. Incluso dentro de texto cambian tokens, longitud generada, recuperación de documentos, herramientas externas, caché y número de pasos. «Por consulta» solo es comparable si la tarea y la distribución están definidas.

Parámetros no equivalen a energía

El número de parámetros no indica cuántos se activan por token ni la eficiencia del hardware. Modelos con mezcla de expertos pueden activar una fracción de sus pesos. Cuantización, atención optimizada, tamaño de lote y utilización pueden alterar la energía sin cambiar el número nominal.

Carbono operativo no equivale a ciclo de vida

Un servicio con electricidad de baja intensidad puede tener pocas emisiones operativas y, aun así, una contribución material de fabricación. Otro estudio puede incluir refrigeración pero no equipos. Un ranking solo sería defendible con la misma unidad funcional, periodo, hardware, límites y método eléctrico.

6. Escala de calidad de la evidencia

Nivel Descripción Uso adecuado
A — medido y reproducible Telemetría directa, versión, tarea, límites, factores y periodo documentados; incertidumbre disponible Decisión operativa y seguimiento
B — medido con límites parciales Actividad observada, pero faltan componentes o asignaciones de ciclo de vida Optimización interna con advertencias
C — estimación parametrizada Hardware, tiempo o tokens conocidos; consumo o carbono modelizados Orden de magnitud y escenarios
D — aproximación genérica Promedio ajeno, equivalencia divulgativa o supuestos no verificables Orientación inicial, nunca comparación comercial

Una fuente corporativa no recibe automáticamente nivel A. Puede tener acceso a telemetría excelente y omitir el método. Una investigación externa tampoco es automáticamente superior: si desconoce la arquitectura o el tráfico, debe modelizar. La calidad depende de datos, perímetro y transparencia.

Regla editorial para citar cifras

Una cifra debería aparecer acompañada por una frase de alcance: «para el entrenamiento final», «mediana de prompts de texto en mayo de 2025», «estimación basada en potencia máxima» o «incluye fabricación amortizada». Si no cabe esa explicación, la cifra probablemente se está usando como eslogan.

7. Qué suele quedar fuera de las estimaciones

Capacidad ociosa y redundancia

Los servicios interactivos reservan máquinas para absorber picos y fallos. Aunque una GPU no esté generando tokens, forma parte de la capacidad necesaria para la promesa de latencia y disponibilidad. El estudio de Gemini muestra que su inclusión es material.

CPU, memoria, red y almacenamiento

Medir solo el acelerador ignora preparación de datos, alojamiento del modelo, recuperación de contexto, comunicaciones y resultados. En sistemas con agentes se añaden búsquedas, llamadas a herramientas y múltiples inferencias invisibles para la persona usuaria.

Fabricación y renovación del hardware

La amortización exige conocer vida útil, utilización y reparto entre cargas. Una GPU compartida por varios clientes y modelos no puede asignarse a una petición sin una regla. La ausencia de datos no convierte esa fase en cero; debe declararse como exclusión.

Desarrollo, fallos y evaluaciones

El entrenamiento final publicado puede ser solo una parte del cómputo de I+D. También existen generación y limpieza de datos, pruebas de seguridad, ajuste y evaluación continua. Para comparar proyectos internos conviene registrar todas las ejecuciones desde el inicio, no reconstruirlas al final.

Electricidad marginal y momento

Los inventarios de organización suelen usar factores medios según reglas de alcance 2. Para decidir cuándo ejecutar una carga flexible puede ser más informativo un factor horario o marginal. Son preguntas diferentes y sus resultados deben etiquetarse, no fusionarse.

8. Cómo leer los informes ambientales de empresas tecnológicas

Los informes corporativos sirven para observar emisiones totales, electricidad, agua y objetivos de una empresa. Rara vez permiten atribuir una fracción exacta a un modelo o cliente. La empresa opera buscadores, publicidad, nube, oficinas, fabricación contratada y otros productos.

Antes de relacionar una variación corporativa con la IA, comprueba:

  • Si el dato es bruto o «neto» después de certificados, créditos o remociones.
  • Si corresponde a alcance 1, 2 basado en ubicación, 2 basado en mercado o alcance 3.
  • Si cambió el perímetro organizativo o la metodología.
  • Si la cifra es absoluta o intensidad por ingresos, usuario o unidad de cómputo.
  • Si el informe atribuye explícitamente la variación a IA o solo lo infiere un tercero.
  • Si las emisiones incorporadas de servidores están en compras, bienes de capital u otra categoría.

Comprar electricidad renovable anual puede reducir el resultado basado en mercado, pero no demuestra coincidencia horaria ni ausencia de restricciones locales de red. Por eso conviene conservar también el dato basado en ubicación y explicar el instrumento contractual.

9. Medición de IA en España: UNE 0086:2025

La Especificación UNE 0086:2025, vigente desde octubre de 2025 y corregida en noviembre, se titula Medición del consumo energético, huella de carbono, consumo del agua y rendimiento de sistemas de Inteligencia Artificial. Establece un marco común para distintas fases del ciclo de vida, incluido entrenamiento e inferencia.

UNE explica que se elaboró con más de 70 especialistas de 35 entidades. Su importancia práctica es unir impacto y rendimiento: reducir energía a costa de una caída inaceptable de calidad no es necesariamente una mejora. La especificación es de pago; su existencia no debe usarse para afirmar que un proyecto está certificado si no ha pasado el proceso correspondiente.

El Programa Nacional de Algoritmos Verdes publicó además una calculadora alfa de consumo energético y huella de carbono basada inicialmente en CodeCarbon. Es un punto de partida para software bajo control propio, no una ventana a la energía real de una API cerrada.

Herramienta y norma no son lo mismo

CodeCarbon monitoriza cómputo que se ejecuta en hardware controlado o visible. EcoLogits modeliza el impacto de llamadas a APIs generativas cuando el proveedor no expone telemetría suficiente. UNE 0086 proporciona un marco de medición y evaluación. Elegir una herramienta no garantiza por sí solo conformidad ni cobertura completa.

Si necesitas implementar el cálculo, sigue el tutorial de estimación de huella de prompts y API, donde distinguimos dato de proveedor, estimación abierta y medición local.

10. Qué dato necesitas para cada decisión

Decisión Unidad recomendada Dato mínimo
Elegir entre dos modelos para una tarea Wh y calidad por resultado válido Mismo conjunto de pruebas, hardware y latencia
Optimizar una API Impacto por flujo completado Tokens, llamadas, reintentos, caché y herramientas
Entrenar o ajustar kWh y CO₂e por experimento y modelo aceptado Telemetría, región, PUE, fallos y hardware
Comprar un servicio kgCO₂e por unidad facturada o de negocio Metodología del proveedor y cobertura de alcance 3
Informar a dirección tCO₂e absolutas y por unidad útil Inventario, incertidumbre y evolución temporal
Comunicar al público Resultado verificable con límites Fuente primaria, fecha y exclusiones

La calidad debe estar en el denominador

El modelo que consume menos por respuesta puede fallar más y obligar a repetir peticiones o revisar manualmente. Para comparar alternativas, mide energía por respuesta aceptada, documento procesado correctamente, incidencia resuelta o predicción útil. Esta unidad evita premiar salidas baratas pero inservibles.

El total absoluto debe acompañar a la intensidad

Una reducción del 40 % por petición puede coexistir con un aumento del consumo total si el tráfico se triplica. Publica ambos: intensidad y volumen. De lo contrario, la eficiencia puede ocultar el efecto escala.

11. Cómo reducir la huella sin desplazarla

  1. Evita la petición: elimina llamadas duplicadas, pruebas sin propósito y agentes que entran en bucle.
  2. Usa la solución mínima: reglas, búsqueda o modelos pequeños pueden resolver tareas sencillas.
  3. Reduce entrada y salida: recupera solo el contexto necesario y limita respuestas cuando el caso lo permita.
  4. Reutiliza: caché, procesamiento por lotes y resultados compartidos reducen inferencias repetidas.
  5. Optimiza el modelo: cuantización, destilación y enrutado requieren validar que la calidad se conserva.
  6. Mejora utilización: hardware ocioso, lotes mal configurados y baja ocupación elevan energía por tarea.
  7. Elige lugar y momento: desplaza cargas flexibles sin ignorar agua, red, latencia y requisitos legales.
  8. Alarga la vida del equipo: sustituir hardware por eficiencia operativa puede aumentar emisiones incorporadas.
  9. Mide el total: comprueba que la mejora unitaria no provoca más tráfico o reintentos.

Estas acciones siguen una jerarquía: evitar, reducir, optimizar infraestructura y, por último, abordar las emisiones residuales. Una compensación no convierte en cero la energía ni las emisiones brutas del sistema.

12. Preguntas frecuentes

¿Cuánto CO₂ emite una consulta a ChatGPT?

No hay una cifra pública única que cubra todas las versiones, tareas y regiones. OpenAI Academy cita una estimación de unos 0,3 Wh para una consulta típica de GPT‑4o, pero convertirla a CO₂e requiere electricidad, perímetro y asignación. No debe aplicarse a imagen, vídeo o agentes.

¿Una consulta de IA consume diez veces más que una búsqueda?

Como regla universal, no. Procede de comparaciones antiguas o de límites diferentes. La AIE señala en 2026 que las consultas sencillas de texto han mejorado mucho en eficiencia; las tareas de vídeo, razonamiento y agentes pueden consumir cientos o miles de veces más que texto simple. Hay que comparar la misma tarea y fecha.

¿BLOOM emitió 24,7 o 50,5 toneladas?

Ambas cifras aparecen en el estudio para perímetros distintos. 24,7 tCO₂e corresponden al consumo dinámico del entrenamiento final; 50,5 tCO₂e amplían el análisis a fabricación y consumo operativo. La diferencia ilustra por qué siempre debe publicarse el límite.

¿Las 539 toneladas de Llama 2 son del modelo 70B?

No. Son la estimación conjunta para preentrenar la familia 7B, 13B, 34B y 70B. El artículo asigna 291,42 tCO₂e a 70B y declara exclusiones importantes.

¿Qué herramienta ofrece la cifra más exacta?

Depende del acceso. Con hardware propio, un monitor como CodeCarbon puede observar actividad local. Para APIs cerradas, EcoLogits construye estimaciones. El dato directo y documentado del proveedor puede cubrir mejor la producción, pero debe examinarse su perímetro. Ninguna herramienta conoce automáticamente todo el ciclo de vida.

¿Puedo comparar Gemini y ChatGPT con 0,24 y 0,3 Wh?

Solo como órdenes de magnitud y dejando claro que los métodos no son equivalentes. Gemini es una mediana de producción de mayo de 2025 con perímetro completo descrito por Google; la cifra de GPT‑4o es una estimación independiente citada por OpenAI. No son un benchmark controlado.

¿La energía renovable elimina la huella?

No. Puede reducir emisiones operativas según el método y contrato, pero permanecen fabricación, construcción, respaldo y otros impactos. También hay que distinguir electricidad comprada anualmente de coincidencia horaria y local.

Conclusión: una cifra útil necesita apellidos

La huella de la IA no se entiende memorizando un número. Se entiende preguntando qué sistema, qué fase, qué tarea, qué fecha, qué energía y qué límites produjo ese número. Los casos de BLOOM, Llama 2, Gemini y GPT‑3 demuestran que el perímetro y el método pueden importar tanto como el tamaño del modelo.

La mejor práctica es conservar una ficha de evidencia junto a cada cifra, puntuar su calidad y no completar los huecos con certezas inventadas. Así es posible comparar opciones internas, detectar mejoras reales y comunicar sin convertir una estimación en un hecho universal.

Metodología y fuentes

La revisión se apoya en fuentes primarias o documentación técnica: Patterson et al. sobre entrenamiento, el análisis de ciclo de vida de BLOOM, el artículo de Llama 2, la medición de Gemini en producción, la explicación de OpenAI Academy, la actualización de la AIE de 2026 y la ficha oficial de UNE 0086:2025. Las comparaciones indican cuándo una cifra procede de una estimación o de un perímetro parcial.

author avatar
Daniel Bellido Pérez

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *