No existe una cifra única para la huella de carbono de la inteligencia artificial. Un entrenamiento completo, una consulta de texto y una imagen generada son unidades distintas. También cambian el hardware, la duración, el centro de datos, la electricidad y las emisiones incluidas. Por eso, dos números correctos pueden diferir cien veces y, aun así, no contradecirse.
Esta guía funciona como una ficha de evidencia: reúne cifras públicas que permiten aprender cómo se mide la IA, explica qué incluyen y señala qué comparaciones no son válidas. No pretende crear un ranking de modelos «verdes», porque los proveedores todavía no publican datos equivalentes para productos y periodos comparables.
Dato clave: una cifra de CO₂e sin fase, unidad funcional, fecha, ubicación, fuente de electricidad y límites del sistema no sirve para comparar modelos. Antes de usarla, exige al menos esos seis campos.
1. Qué significa huella de carbono de la IA
La huella de carbono expresa el conjunto de gases de efecto invernadero en masa de dióxido de carbono equivalente, CO₂e. En IA puede referirse a una fase muy concreta o a un ciclo de vida más amplio. La etiqueta «huella del modelo» es ambigua si no se aclara cuál.
Desarrollo y experimentación
Antes del entrenamiento final se prueban arquitecturas, conjuntos de datos, hiperparámetros y versiones fallidas. Muchos artículos solo publican el consumo de la ejecución final; el trabajo exploratorio puede quedar fuera. No es un error si se declara, pero sí lo es presentar esa cifra como huella completa de desarrollo.
Preentrenamiento y ajuste
El preentrenamiento suele concentrar una gran carga computacional en modelos fundacionales. Después pueden existir ajuste supervisado, aprendizaje por preferencias, evaluaciones de seguridad y actualizaciones. Cada fase requiere su propia actividad y factores de emisión.
Inferencia o uso
Es la operación repetida cuando una persona o aplicación solicita una salida. Su impacto unitario puede ser pequeño frente al entrenamiento, pero se multiplica por el número de peticiones. Longitud de entrada y salida, modalidad, razonamiento, tamaño de lote, latencia, utilización del hardware y capacidad ociosa cambian el resultado.
Infraestructura y ciclo de vida
La electricidad no es toda la huella. Fabricar aceleradores, servidores y edificios también genera emisiones; además existen red, almacenamiento, refrigeración, pérdidas eléctricas y fin de vida. Un estudio puede medir solo el chip activo mientras otro amortiza toda la plataforma. Compararlos sin corregir el perímetro premia al que omite más componentes.
Para el panorama completo —agua, materiales, territorio y residuos— consulta nuestro análisis del impacto ambiental de la IA. Aquí nos concentramos en energía y carbono.
2. La ficha mínima de un dato fiable
Cada cifra debería poder reconstruirse con una ficha semejante a esta:
| Campo | Pregunta que responde | Ejemplo de valor |
|---|---|---|
| Objeto | ¿Qué sistema o versión se midió? | Modelo X, servicio Y |
| Fase | ¿Desarrollo, entrenamiento, ajuste o inferencia? | Inferencia en producción |
| Unidad funcional | ¿A qué se refiere el resultado? | Prompt mediano de texto |
| Fecha | ¿Cuándo se tomó la muestra? | Mayo de 2025 |
| Actividad | ¿Qué energía o cómputo se registró? | 0,24 Wh por prompt |
| Perímetro | ¿Incluye CPU, memoria, inactividad y PUE? | Pila completa de servicio |
| Electricidad | ¿Qué factor y enfoque se aplicaron? | Emisiones de mercado |
| Hardware | ¿Incluye fabricación amortizada? | Aceleradores incluidos |
| Método | ¿Medición, asignación o estimación? | Telemetría de producción |
| Incertidumbre | ¿Qué rango y limitaciones existen? | No generalizable a imagen |
Si faltan fecha o versión, el dato envejece mal: la eficiencia de hardware y software cambia con rapidez. Si falta la unidad funcional, no sabemos si se midió un token, una respuesta, una sesión o un millón de peticiones. Si falta el perímetro, no puede compararse con otro estudio.
3. Cifras públicas de entrenamiento: qué dicen realmente
La siguiente tabla conserva el contexto de la fuente. No es una clasificación de eficiencia ni permite deducir el consumo de las versiones comerciales actuales.
| Modelo y publicación | Actividad declarada | Emisiones declaradas o calculadas | Lectura correcta |
|---|---|---|---|
| GPT‑3, análisis de Patterson et al. (2021) | 1.287 MWh para el entrenamiento analizado | 502 tCO₂e dinámicas; 552 tCO₂e al aplicar PUE en la comparación posterior de BLOOM | Estimación retrospectiva con información compartida; no es GPT‑4 ni ChatGPT actual |
| OPT‑175B, Meta (2022) | 324 MWh en la tabla comparativa de BLOOM | Unas 70 tCO₂e dinámicas y 76,3 tCO₂e con PUE | El artículo de OPT describe también experimentos; hay que verificar qué ejecuciones incluye cada total |
| BLOOM‑176B, Luccioni et al. (2022) | 433 MWh en entrenamiento final | 24,7 tCO₂e de consumo dinámico; 50,5 tCO₂e al ampliar a fabricación y operación | La diferencia entre 24,7 y 50,5 demuestra el efecto del perímetro |
| Familia Llama 2, Meta (2023) | 3,3 millones de horas de GPU para 7B, 13B, 34B y 70B | 539 tCO₂e estimadas en conjunto; 291,42 tCO₂e para 70B | Usa potencia máxima ajustada por PUE; excluye fabricación, interconexión y otros consumos |
GPT‑3: una estimación útil, no una constante
El trabajo Carbon Emissions and Large Neural Network Training calculó energía y emisiones para varios modelos y mostró que arquitectura, procesador, centro de datos y ubicación pueden modificar el resultado en órdenes de magnitud. Su valor principal no es convertir 552 toneladas en un «precio» permanente de entrenar IA, sino documentar por qué las estimaciones retroactivas son frágiles.
Aplicar esa cifra a GPT‑4, GPT‑4o o cualquier servicio actual es incorrecto. Cambian arquitectura, datos, aceleradores, optimización, periodo y electricidad; además, los proveedores no han publicado un inventario de entrenamiento equivalente para todas esas versiones.
BLOOM: tres resultados para un mismo entrenamiento
El estudio de BLOOM estimó 24,7 tCO₂e considerando el consumo eléctrico dinámico del entrenamiento final. La cifra sube al ampliar límites: el artículo estima 50,5 tCO₂e desde fabricación de equipos hasta consumo operativo. Ninguna cifra es «la mentira»; responden a preguntas diferentes.
También muestra por qué energía y carbono no son sinónimos. BLOOM consumió cientos de MWh, pero se ejecutó con electricidad de baja intensidad de carbono en el supercomputador Jean Zay. Trasladar la misma energía a otro lugar o momento cambiaría las emisiones operativas.
Llama 2: familia completa frente a un solo tamaño
El artículo de Llama 2 estima 539 tCO₂e para entrenar la familia de cuatro tamaños. De ese total, 291,42 tCO₂e corresponden a 70B. Confundir el dato familiar con el modelo de 70.000 millones o transformar toneladas en MWh produce tablas falsas.
Los autores explican que usan la potencia de diseño térmico de las GPU, no una lectura completa de cada componente, y que quedan fuera interconexiones, hardware incorporado y otros consumos. Además, que las emisiones fueran compensadas no elimina las emisiones brutas del entrenamiento.
4. Cifras públicas de inferencia: la unidad cambia el resultado
| Servicio o referencia | Resultado | Perímetro y calidad | No permite afirmar |
|---|---|---|---|
| Gemini Apps, mediana de texto, mayo de 2025 | 0,24 Wh; 0,03 gCO₂e; 0,26 ml de agua por prompt | Medición de producción de Google con acelerador, host, capacidad ociosa, sobrecarga y parte incorporada | El consumo de todos los prompts, imágenes, vídeos o versiones futuras |
| ChatGPT con GPT‑4o, referencia difundida por OpenAI Academy | Alrededor de 0,3 Wh por consulta típica | Estimación independiente de Epoch AI, reconocida por OpenAI; no es telemetría pública del proveedor | Una cifra de CO₂e sin región, electricidad y perímetro adicionales |
Gemini: por qué el perímetro duplicó la cifra estrecha
El estudio de Google Measuring the Environmental Impact of Delivering AI at Google Scale midió el prompt mediano de texto de Gemini Apps. El enfoque estrecho —principalmente aceleradores activos y centros más eficientes— daba 0,10 Wh. El método completo llegó a 0,24 Wh al incluir CPU y memoria, máquinas ociosas necesarias para disponibilidad y sobrecarga del centro de datos.
La lección es más importante que la comparación doméstica: omitir capacidad reservada y sistemas auxiliares reduce artificialmente el impacto por petición. Google también declara 0,03 gCO₂e con un enfoque de mercado y una parte de emisiones incorporadas del acelerador. Ese valor no debe recalcularse aplicando otra vez un factor eléctrico, porque se duplicaría una etapa ya incluida.
ChatGPT: estimación reconocida, pero no medición equivalente
OpenAI Academy señala que una consulta típica de GPT‑4o probablemente consume unos 0,3 Wh, citando un análisis independiente. También reconoce que no se han publicado benchmarks energéticos propietarios equivalentes para GPT‑4. Por ello, la cifra es útil como orden de magnitud, no como una medición de producto comparable con la metodología de Google.
Para la situación de transparencia de cada proveedor, consulta nuestra comparación entre ChatGPT, Claude y Gemini. Esta página mantiene el foco en la calidad del dato, no en declarar un ganador.
5. Por qué estas cifras no deben ordenarse como un ranking
Entrenamiento no es inferencia
Dividir las emisiones de entrenamiento entre una petición no funciona sin conocer la vida útil, el tráfico, las actualizaciones y el reparto entre productos. Un modelo puede entrenarse una vez y utilizarse miles de millones de veces; otro puede necesitar reentrenamientos frecuentes y poco uso.
Un prompt no es una tarea estable
Un saludo breve, un documento largo, una respuesta con razonamiento, una imagen y un vídeo requieren trabajo diferente. Incluso dentro de texto cambian tokens, longitud generada, recuperación de documentos, herramientas externas, caché y número de pasos. «Por consulta» solo es comparable si la tarea y la distribución están definidas.
Parámetros no equivalen a energía
El número de parámetros no indica cuántos se activan por token ni la eficiencia del hardware. Modelos con mezcla de expertos pueden activar una fracción de sus pesos. Cuantización, atención optimizada, tamaño de lote y utilización pueden alterar la energía sin cambiar el número nominal.
Carbono operativo no equivale a ciclo de vida
Un servicio con electricidad de baja intensidad puede tener pocas emisiones operativas y, aun así, una contribución material de fabricación. Otro estudio puede incluir refrigeración pero no equipos. Un ranking solo sería defendible con la misma unidad funcional, periodo, hardware, límites y método eléctrico.
6. Escala de calidad de la evidencia
| Nivel | Descripción | Uso adecuado |
|---|---|---|
| A — medido y reproducible | Telemetría directa, versión, tarea, límites, factores y periodo documentados; incertidumbre disponible | Decisión operativa y seguimiento |
| B — medido con límites parciales | Actividad observada, pero faltan componentes o asignaciones de ciclo de vida | Optimización interna con advertencias |
| C — estimación parametrizada | Hardware, tiempo o tokens conocidos; consumo o carbono modelizados | Orden de magnitud y escenarios |
| D — aproximación genérica | Promedio ajeno, equivalencia divulgativa o supuestos no verificables | Orientación inicial, nunca comparación comercial |
Una fuente corporativa no recibe automáticamente nivel A. Puede tener acceso a telemetría excelente y omitir el método. Una investigación externa tampoco es automáticamente superior: si desconoce la arquitectura o el tráfico, debe modelizar. La calidad depende de datos, perímetro y transparencia.
Regla editorial para citar cifras
Una cifra debería aparecer acompañada por una frase de alcance: «para el entrenamiento final», «mediana de prompts de texto en mayo de 2025», «estimación basada en potencia máxima» o «incluye fabricación amortizada». Si no cabe esa explicación, la cifra probablemente se está usando como eslogan.
7. Qué suele quedar fuera de las estimaciones
Capacidad ociosa y redundancia
Los servicios interactivos reservan máquinas para absorber picos y fallos. Aunque una GPU no esté generando tokens, forma parte de la capacidad necesaria para la promesa de latencia y disponibilidad. El estudio de Gemini muestra que su inclusión es material.
CPU, memoria, red y almacenamiento
Medir solo el acelerador ignora preparación de datos, alojamiento del modelo, recuperación de contexto, comunicaciones y resultados. En sistemas con agentes se añaden búsquedas, llamadas a herramientas y múltiples inferencias invisibles para la persona usuaria.
Fabricación y renovación del hardware
La amortización exige conocer vida útil, utilización y reparto entre cargas. Una GPU compartida por varios clientes y modelos no puede asignarse a una petición sin una regla. La ausencia de datos no convierte esa fase en cero; debe declararse como exclusión.
Desarrollo, fallos y evaluaciones
El entrenamiento final publicado puede ser solo una parte del cómputo de I+D. También existen generación y limpieza de datos, pruebas de seguridad, ajuste y evaluación continua. Para comparar proyectos internos conviene registrar todas las ejecuciones desde el inicio, no reconstruirlas al final.
Electricidad marginal y momento
Los inventarios de organización suelen usar factores medios según reglas de alcance 2. Para decidir cuándo ejecutar una carga flexible puede ser más informativo un factor horario o marginal. Son preguntas diferentes y sus resultados deben etiquetarse, no fusionarse.
8. Cómo leer los informes ambientales de empresas tecnológicas
Los informes corporativos sirven para observar emisiones totales, electricidad, agua y objetivos de una empresa. Rara vez permiten atribuir una fracción exacta a un modelo o cliente. La empresa opera buscadores, publicidad, nube, oficinas, fabricación contratada y otros productos.
Antes de relacionar una variación corporativa con la IA, comprueba:
- Si el dato es bruto o «neto» después de certificados, créditos o remociones.
- Si corresponde a alcance 1, 2 basado en ubicación, 2 basado en mercado o alcance 3.
- Si cambió el perímetro organizativo o la metodología.
- Si la cifra es absoluta o intensidad por ingresos, usuario o unidad de cómputo.
- Si el informe atribuye explícitamente la variación a IA o solo lo infiere un tercero.
- Si las emisiones incorporadas de servidores están en compras, bienes de capital u otra categoría.
Comprar electricidad renovable anual puede reducir el resultado basado en mercado, pero no demuestra coincidencia horaria ni ausencia de restricciones locales de red. Por eso conviene conservar también el dato basado en ubicación y explicar el instrumento contractual.
9. Medición de IA en España: UNE 0086:2025
La Especificación UNE 0086:2025, vigente desde octubre de 2025 y corregida en noviembre, se titula Medición del consumo energético, huella de carbono, consumo del agua y rendimiento de sistemas de Inteligencia Artificial. Establece un marco común para distintas fases del ciclo de vida, incluido entrenamiento e inferencia.
UNE explica que se elaboró con más de 70 especialistas de 35 entidades. Su importancia práctica es unir impacto y rendimiento: reducir energía a costa de una caída inaceptable de calidad no es necesariamente una mejora. La especificación es de pago; su existencia no debe usarse para afirmar que un proyecto está certificado si no ha pasado el proceso correspondiente.
El Programa Nacional de Algoritmos Verdes publicó además una calculadora alfa de consumo energético y huella de carbono basada inicialmente en CodeCarbon. Es un punto de partida para software bajo control propio, no una ventana a la energía real de una API cerrada.
Herramienta y norma no son lo mismo
CodeCarbon monitoriza cómputo que se ejecuta en hardware controlado o visible. EcoLogits modeliza el impacto de llamadas a APIs generativas cuando el proveedor no expone telemetría suficiente. UNE 0086 proporciona un marco de medición y evaluación. Elegir una herramienta no garantiza por sí solo conformidad ni cobertura completa.
Si necesitas implementar el cálculo, sigue el tutorial de estimación de huella de prompts y API, donde distinguimos dato de proveedor, estimación abierta y medición local.
10. Qué dato necesitas para cada decisión
| Decisión | Unidad recomendada | Dato mínimo |
|---|---|---|
| Elegir entre dos modelos para una tarea | Wh y calidad por resultado válido | Mismo conjunto de pruebas, hardware y latencia |
| Optimizar una API | Impacto por flujo completado | Tokens, llamadas, reintentos, caché y herramientas |
| Entrenar o ajustar | kWh y CO₂e por experimento y modelo aceptado | Telemetría, región, PUE, fallos y hardware |
| Comprar un servicio | kgCO₂e por unidad facturada o de negocio | Metodología del proveedor y cobertura de alcance 3 |
| Informar a dirección | tCO₂e absolutas y por unidad útil | Inventario, incertidumbre y evolución temporal |
| Comunicar al público | Resultado verificable con límites | Fuente primaria, fecha y exclusiones |
La calidad debe estar en el denominador
El modelo que consume menos por respuesta puede fallar más y obligar a repetir peticiones o revisar manualmente. Para comparar alternativas, mide energía por respuesta aceptada, documento procesado correctamente, incidencia resuelta o predicción útil. Esta unidad evita premiar salidas baratas pero inservibles.
El total absoluto debe acompañar a la intensidad
Una reducción del 40 % por petición puede coexistir con un aumento del consumo total si el tráfico se triplica. Publica ambos: intensidad y volumen. De lo contrario, la eficiencia puede ocultar el efecto escala.
11. Cómo reducir la huella sin desplazarla
- Evita la petición: elimina llamadas duplicadas, pruebas sin propósito y agentes que entran en bucle.
- Usa la solución mínima: reglas, búsqueda o modelos pequeños pueden resolver tareas sencillas.
- Reduce entrada y salida: recupera solo el contexto necesario y limita respuestas cuando el caso lo permita.
- Reutiliza: caché, procesamiento por lotes y resultados compartidos reducen inferencias repetidas.
- Optimiza el modelo: cuantización, destilación y enrutado requieren validar que la calidad se conserva.
- Mejora utilización: hardware ocioso, lotes mal configurados y baja ocupación elevan energía por tarea.
- Elige lugar y momento: desplaza cargas flexibles sin ignorar agua, red, latencia y requisitos legales.
- Alarga la vida del equipo: sustituir hardware por eficiencia operativa puede aumentar emisiones incorporadas.
- Mide el total: comprueba que la mejora unitaria no provoca más tráfico o reintentos.
Estas acciones siguen una jerarquía: evitar, reducir, optimizar infraestructura y, por último, abordar las emisiones residuales. Una compensación no convierte en cero la energía ni las emisiones brutas del sistema.
12. Preguntas frecuentes
¿Cuánto CO₂ emite una consulta a ChatGPT?
No hay una cifra pública única que cubra todas las versiones, tareas y regiones. OpenAI Academy cita una estimación de unos 0,3 Wh para una consulta típica de GPT‑4o, pero convertirla a CO₂e requiere electricidad, perímetro y asignación. No debe aplicarse a imagen, vídeo o agentes.
¿Una consulta de IA consume diez veces más que una búsqueda?
Como regla universal, no. Procede de comparaciones antiguas o de límites diferentes. La AIE señala en 2026 que las consultas sencillas de texto han mejorado mucho en eficiencia; las tareas de vídeo, razonamiento y agentes pueden consumir cientos o miles de veces más que texto simple. Hay que comparar la misma tarea y fecha.
¿BLOOM emitió 24,7 o 50,5 toneladas?
Ambas cifras aparecen en el estudio para perímetros distintos. 24,7 tCO₂e corresponden al consumo dinámico del entrenamiento final; 50,5 tCO₂e amplían el análisis a fabricación y consumo operativo. La diferencia ilustra por qué siempre debe publicarse el límite.
¿Las 539 toneladas de Llama 2 son del modelo 70B?
No. Son la estimación conjunta para preentrenar la familia 7B, 13B, 34B y 70B. El artículo asigna 291,42 tCO₂e a 70B y declara exclusiones importantes.
¿Qué herramienta ofrece la cifra más exacta?
Depende del acceso. Con hardware propio, un monitor como CodeCarbon puede observar actividad local. Para APIs cerradas, EcoLogits construye estimaciones. El dato directo y documentado del proveedor puede cubrir mejor la producción, pero debe examinarse su perímetro. Ninguna herramienta conoce automáticamente todo el ciclo de vida.
¿Puedo comparar Gemini y ChatGPT con 0,24 y 0,3 Wh?
Solo como órdenes de magnitud y dejando claro que los métodos no son equivalentes. Gemini es una mediana de producción de mayo de 2025 con perímetro completo descrito por Google; la cifra de GPT‑4o es una estimación independiente citada por OpenAI. No son un benchmark controlado.
¿La energía renovable elimina la huella?
No. Puede reducir emisiones operativas según el método y contrato, pero permanecen fabricación, construcción, respaldo y otros impactos. También hay que distinguir electricidad comprada anualmente de coincidencia horaria y local.
Conclusión: una cifra útil necesita apellidos
La huella de la IA no se entiende memorizando un número. Se entiende preguntando qué sistema, qué fase, qué tarea, qué fecha, qué energía y qué límites produjo ese número. Los casos de BLOOM, Llama 2, Gemini y GPT‑3 demuestran que el perímetro y el método pueden importar tanto como el tamaño del modelo.
La mejor práctica es conservar una ficha de evidencia junto a cada cifra, puntuar su calidad y no completar los huecos con certezas inventadas. Así es posible comparar opciones internas, detectar mejoras reales y comunicar sin convertir una estimación en un hecho universal.
Metodología y fuentes
La revisión se apoya en fuentes primarias o documentación técnica: Patterson et al. sobre entrenamiento, el análisis de ciclo de vida de BLOOM, el artículo de Llama 2, la medición de Gemini en producción, la explicación de OpenAI Academy, la actualización de la AIE de 2026 y la ficha oficial de UNE 0086:2025. Las comparaciones indican cuándo una cifra procede de una estimación o de un perímetro parcial.


Deja una respuesta