Respuesta corta: no existe una comparación pública, actual y equivalente que permita afirmar si ChatGPT, Claude o Gemini tiene menor huella de carbono por respuesta. Google ha publicado una medición de producción para un prompt de texto mediano de Gemini Apps. OpenAI remite a una estimación externa de energía para consultas típicas de GPT‑4o. En la documentación pública de Anthropic revisada no encontramos una cifra equivalente para Claude.

El dato más completo de los tres es el de Gemini Apps: 0,24 Wh de energía, 0,03 gCO₂e y 0,26 ml de agua para el prompt de texto mediano medido en mayo de 2025. No debe aplicarse a imágenes, vídeo, Deep Research, agentes, contextos largos ni a todas las versiones de Gemini.

Conclusión: hoy se puede comparar la calidad de la transparencia, no ordenar con rigor los tres productos por emisiones.

Preguntar cuánto contamina “una consulta” parece sencillo, pero la unidad oculta decisiones: modelo y versión, longitud, razonamiento, herramientas, hardware, centro de datos, electricidad, capacidad inactiva y fabricación de equipos. Si dos cifras no comparten esas condiciones, colocarlas en la misma tabla produce una precisión falsa.

Durante esta investigación revisamos documentación de Google, OpenAI y Anthropic, estudios con metodología y las reglas de contabilidad eléctrica de GHG Protocol. Separamos medición del operador, estimación externa y ausencia de dato comparable. Esa distinción es más útil que asignar etiquetas “alto”, “medio” o “bajo” sin unidades.

Última revisión documental: 28 de julio de 2026.

ChatGPT, Claude y Gemini: la comparación honesta

Producto Dato público localizado Tipo de evidencia Qué permite concluir
Gemini Apps 0,24 Wh, 0,03 gCO₂e y 0,26 ml para el prompt de texto mediano, medido en mayo de 2025. Medición de producción publicada por Google con metodología de pila completa. Orden de magnitud de esa unidad funcional y periodo; no de todas las tareas Gemini.
ChatGPT Aproximadamente 0,3 Wh para una consulta típica de GPT‑4o. Estimación independiente de Epoch AI difundida por OpenAI Academy; no una medición de carbono del operador. Escenario energético orientativo; no gCO₂e por consulta ni huella completa.
Claude Sin cifra equivalente localizada para energía, carbono y agua por prompt de producción. Ausencia en la documentación oficial revisada, incluido el system card de Claude 4.1. No permite inferir que Claude consuma más o menos; solo revela una brecha de información.

Las dos cifras energéticas visibles —0,24 y aproximadamente 0,3 Wh— son cercanas, pero no forman un ensayo comparativo. Proceden de métodos diferentes y no garantizan la misma longitud, modelo, fecha, centro, mezcla eléctrica ni distribución de tareas. Una diferencia de centésimas de Wh sería mucho menor que la incertidumbre creada por esas variables.

Resultado editorial: transparencia, no podio

Google ofrece la divulgación de producto más detallada localizada. OpenAI aporta contexto oficial, pero la cifra que presenta procede de un análisis externo. Anthropic publica información amplia de seguridad y capacidades, pero no encontramos una métrica ambiental de producto equivalente. Esto no demuestra qué asistente es “más verde”; indica qué proveedor permite verificar más.

Qué mide exactamente el dato de Gemini Apps

El estudio Measuring the environmental impact of delivering AI at Google Scale utilizó instrumentación de la infraestructura que servía Gemini Apps. Su unidad funcional fue el prompt de texto mediano observado durante mayo de 2025, no una media de cualquier interacción.

El cálculo de energía incluye más que el acelerador ocupado durante la respuesta:

  • aceleradores de IA activos;
  • CPU y memoria de los equipos anfitriones;
  • capacidad de máquinas provisionadas pero inactivas;
  • sobrecarga energética del centro de datos;
  • asignación de emisiones operativas y parte incorporada descrita por el método.

Ese perímetro explica por qué la medición es más útil que multiplicar la potencia máxima de una GPU por segundos supuestos. También impide trasladar el resultado a otro proveedor: Google mide su propia pila, utilización y flota.

Mediana no significa promedio ni máximo

La mediana divide la distribución: la mitad de los prompts medidos quedó por debajo y la otra mitad por encima según la métrica elegida. No conocemos el impacto de una tarea concreta solo con ese punto. Una pregunta corta y una investigación con múltiples búsquedas, razonamiento y contexto no representan la misma carga.

La fecha forma parte del dato

Google informó de reducciones muy rápidas por mejoras de modelos, software y utilización. Esa evolución es positiva, pero significa que una cifra envejece deprisa. Toda comunicación debería incluir fecha de medición, versión de producto y distribución, no presentar el valor como constante.

0,03 gCO₂e no es solo energía por un factor cualquiera

El estudio aplica el método de emisiones de Google, incluida su contabilidad eléctrica y componentes asignados. Recalcular el mismo prompt con el promedio anual de otro país produciría un escenario distinto, no una corrección del dato de Google.

Qué sabemos —y qué no— de la huella de ChatGPT

La página de OpenAI Academy sobre impacto ambiental, actualizada en junio de 2026, contrasta la afirmación popular de 3 Wh por consulta con una estimación de Epoch AI: una consulta típica de GPT‑4o utilizaría alrededor de 0,3 Wh.

Es importante conservar el verbo: estima. El análisis modela hardware, tokens y servicio; no equivale a telemetría completa de ChatGPT publicada por OpenAI. La página oficial tampoco proporciona, junto a ese número, un valor de gCO₂e por consulta comparable con Gemini.

Por qué no basta con 0,3 Wh para calcular emisiones exactas

Faltan al menos ubicación o mezcla eléctrica, método location-based o market-based, sobrecarga del centro, capacidad inactiva, hardware incorporado, herramientas ejecutadas y distribución real de solicitudes. Se puede construir un escenario; no atribuir una huella exacta al historial personal.

ChatGPT no es un único modelo ni una tarea constante

El producto puede enrutar solicitudes, utilizar búsqueda, procesar archivos, generar imágenes, ejecutar código o realizar investigación en varios pasos. Una cifra asociada a “GPT‑4o típico” no describe automáticamente otros modelos, agentes o funciones lanzados después.

Para consumo de agua, consulte nuestro análisis separado de cuánta agua consume ChatGPT por pregunta. Mezclar agua, energía y carbono en una única clasificación oculta compensaciones importantes.

Qué sabemos —y qué no— de la huella de Claude

Anthropic publica system cards, evaluaciones de seguridad y documentación técnica. En la tarjeta de sistema de Claude 4.1 y los recursos corporativos revisados no localizamos energía, gCO₂e y agua por una unidad de uso de producción comparable con el estudio de Gemini.

Esta ausencia no autoriza a asignar a Claude una categoría “media-alta”, como hacía la versión anterior de este artículo. Tampoco permite utilizar la huella total de AWS o Google Cloud como si fuera la del producto: el proveedor de infraestructura, región, utilización y asignación entre clientes no están definidos por esos promedios.

Qué dato permitiría evaluar Claude

Una publicación útil indicaría versión, fecha, distribución de longitud, energía de aceleradores y host, capacidad inactiva, PUE, método eléctrico, emisiones incorporadas, agua y percentiles. Una mediana de texto sería un comienzo; herramientas y razonamiento deberían medirse por separado.

Nueve razones por las que dos cifras por consulta pueden no ser comparables

  1. Modelo: una versión compacta y una de razonamiento ejecutan trabajo diferente.
  2. Longitud de entrada: procesar miles de tokens no equivale a una pregunta breve.
  3. Longitud de salida: generar más tokens prolonga la inferencia.
  4. Herramientas: búsqueda, código, imágenes y agentes añaden sistemas y pasos.
  5. Hardware: generación, memoria, precisión numérica y lote cambian la eficiencia.
  6. Utilización: repartir capacidad entre solicitudes reduce energía asignada por resultado.
  7. Centro de datos: PUE y refrigeración añaden consumos distintos.
  8. Electricidad: ubicación, hora y contratos cambian el factor de emisiones.
  9. Perímetro: algunas cifras incluyen host, inactividad y fabricación; otras, solo el chip.

Prueba mínima: si una tabla no muestra unidad funcional, percentil, modelo, fecha, perímetro y método de carbono, no está comparando productos; está yuxtaponiendo números.

Cómo se calcula la huella de carbono a partir de energía

Para emisiones operativas de electricidad, la relación básica es:

Emisiones = energía (kWh) × factor de emisión eléctrica (gCO₂e/kWh)

Un consumo de 0,3 Wh son 0,0003 kWh. Si se aplica un factor hipotético de 200 gCO₂e/kWh, el escenario produciría 0,06 gCO₂e. La operación sirve para entender unidades; no es la huella real de ChatGPT, porque el factor y el perímetro son supuestos.

Ejemplo para mil consultas

Con el mismo escenario:

  • energía: 1.000 × 0,3 Wh = 300 Wh = 0,3 kWh;
  • emisiones: 0,3 kWh × 200 gCO₂e/kWh = 60 gCO₂e.

Cambiar el modelo, longitud o factor cambia el resultado. Por eso es preferible informar un rango de escenarios y guardar los supuestos que publicar tres decimales.

Location-based y market-based

La guía de Alcance 2 de GHG Protocol distingue:

  • método basado en localización: utiliza el promedio de la red donde se consume la electricidad;
  • método basado en mercado: refleja instrumentos contractuales que cumplen criterios de calidad.

Un valor contractual bajo no describe necesariamente las emisiones físicas horarias de la red. Para transparencia ambiental conviene mostrar ambos cuando sean aplicables y no llamar “cero emisiones” a toda la huella de ciclo de vida.

Factores de MITECO: útiles, pero con el año correcto

El Registro de huella de carbono de MITECO publica factores anuales para organizaciones en España. En julio de 2026 ya estaban disponibles los factores 2007–2025. MITECO indica que para inscribir una huella debe utilizarse el factor del año calculado, no el último valor como sustituto universal.

Estos factores ayudan a inventarios de una organización que conoce su consumo eléctrico. No revelan en qué región mundial ejecutó un proveedor cada solicitud.

Entrenamiento, desarrollo, inferencia y hardware: cuatro cuentas diferentes

Entrenamiento final

Es la ejecución que produce un modelo entrenado. La cifra de 1.287 MWh atribuida a GPT‑3 aparece con frecuencia en artículos, pero describe un modelo y entrenamiento de 2020; no permite calcular GPT‑4, GPT‑5 ni una consulta actual.

Desarrollo

Antes de la ejecución final se prueban arquitecturas, datos y configuraciones. Un estudio de 2025 sobre desarrollo de una familia de modelos encontró que esta fase podía ser material frente al entrenamiento final. Omitirla infravalora el coste de crear el sistema.

Inferencia

Es el uso repetido del modelo en producción. Su total depende de solicitudes, longitud, funciones y eficiencia. Un modelo puede mejorar Wh por tarea y aumentar electricidad agregada si se multiplica el uso. La IEA informó en 2026 de que la demanda eléctrica de centros de datos creció un 17 % en 2025 y proyecta que la de centros orientados a IA se triplique entre 2025 y 2030, aunque la eficiencia por tarea mejore con rapidez.

Hardware y edificios

Fabricar aceleradores, memoria, servidores, redes y edificios genera emisiones antes de su uso. Asignarlas a una respuesta exige vida útil, utilización y reparto entre servicios. Una evaluación de ciclo de vida de varias generaciones de TPU mostró que la eficiencia de hardware puede mejorar, pero también que la fabricación debe formar parte del perímetro cuando se afirma una huella completa.

Qué decisiones de uso cambian más el impacto

Decisión Por qué importa Práctica útil
Elegir capacidad Un modelo grande puede ejecutar más cómputo por tarea. Usar el modelo más pequeño que cumpla calidad y riesgo.
Limitar agentes Un pedido puede iniciar decenas de pasos y herramientas. Definir máximo de iteraciones, tiempo y llamadas.
Reducir regeneraciones Cada respuesta descartada añade trabajo sin utilidad. Especificar criterio, formato y datos desde el inicio.
Reutilizar resultados Repetir consultas idénticas desperdicia inferencia. Caché, plantillas y recuperación de respuestas validadas.
Medir por trabajo útil Menos Wh no compensa una respuesta inútil o errónea. Relacionar energía con tareas aceptadas y valor obtenido.

La responsabilidad principal sigue en proveedores y compradores, que eligen modelo, infraestructura y volumen. Un usuario individual no conoce el centro de datos ni la energía exacta. La recomendación no es evitar una pregunta útil, sino reducir ejecuciones automáticas sin propósito y exigir datos mejores.

Cómo estimar el uso de IA en una empresa sin inventar precisión

  1. Defina la unidad: solicitudes, tokens, minutos de audio, imágenes o tareas completas.
  2. Exporte actividad: proveedor, modelo, función, fecha y volumen. OpenAI permite consultar uso de tokens en respuestas de API y exportar el panel de uso.
  3. Separe modalidades: texto simple, razonamiento, búsqueda, imagen, vídeo y agentes.
  4. Solicite factores al proveedor: energía y emisiones por distribución de tareas, no un promedio corporativo.
  5. Construya escenarios: bajo, central y alto; marque qué valores son medidos y estimados.
  6. No mezcle alcances: electricidad operativa, emisiones incorporadas y huella del dispositivo del usuario deben quedar separadas.
  7. Documente el método: versión, periodo, fuente, factor eléctrico, exclusiones e incertidumbre.
  8. Mida utilidad: tareas aprobadas, horas evitadas, errores y efecto rebote por aumento de demanda.

Si solo dispone de número de consultas y un factor genérico, denomine el resultado escenario de emisiones operativas, no “huella de carbono real”. Nuestra calculadora de uso de IA sirve para explorar supuestos; no sustituye datos de proveedor.

Qué deberían publicar OpenAI, Anthropic y Google

Elemento Por qué es necesario
Modelo, versión y fecha La eficiencia y el enrutamiento cambian con rapidez.
Unidad funcional Define texto, longitud, modalidad, herramientas y resultado.
Distribución y percentiles Una mediana no muestra tareas intensivas ni variabilidad.
Energía de pila completa Evita limitar el cálculo al acelerador activo.
PUE, inactividad y utilización Permite asignar infraestructura compartida.
Carbono por localización y mercado Distingue red física y contratación.
Emisiones incorporadas Incluye fabricación y renovación del hardware.
Agua directa e indirecta Evita confundir carbono bajo con impacto hídrico bajo.
Revisión y datos reproducibles Permite comprobar el método y comparar periodos.

Una etiqueta ambiental por producto debería actualizarse como una ficha nutricional: rango de tareas, versión, fecha y perímetro. Sin esa disciplina, un proveedor puede mejorar un promedio mientras crecen las cargas más intensivas sin visibilidad.

Preguntas frecuentes

¿Qué contamina más, ChatGPT, Claude o Gemini?

No puede determinarse con datos públicos equivalentes. Gemini ofrece la medición de producto más completa localizada; eso demuestra mayor transparencia en este punto, no necesariamente menor huella para cualquier tarea.

¿Cuánto CO₂ emite una pregunta a ChatGPT?

No hay una cifra oficial de producto comparable que cubra modelo, tarea, infraestructura y carbono. Puede estimarse energía y aplicar escenarios eléctricos, pero el resultado debe etiquetarse como estimación.

¿La cifra de Gemini vale para cualquier prompt?

No. Describe el prompt de texto mediano de Gemini Apps medido en mayo de 2025. No representa automáticamente razonamiento largo, imágenes, vídeo, agentes o uso futuro.

¿Claude contamina más porque no publica el dato?

No. La ausencia impide evaluar y comparar; no demuestra un valor alto ni bajo. Sí justifica pedir transparencia equivalente.

¿Una consulta de IA consume diez veces una búsqueda?

La comparación se popularizó a partir de estimaciones con modelos y búsquedas que cambian. No es una constante técnica. Cada unidad debe medirse con fecha, tarea y perímetro equivalentes.

¿Generar una imagen equivale a cargar un móvil?

Algunos estudios han usado comparaciones de ese tipo para modelos concretos. No debe aplicarse a todos los generadores ni a versiones actuales sin conocer resolución, pasos, hardware y método.

¿Energía renovable significa cero carbono?

Puede reducir las emisiones operativas asignadas por contratos, pero no elimina fabricación, construcción, respaldo, pérdidas ni todos los impactos. Conviene mostrar métodos de localización y mercado por separado.

¿Un prompt corto siempre consume menos?

Suele reducir parte del procesamiento, pero no permite conocer el enrutamiento, lote, razonamiento interno ni herramientas. El efecto debe medirse; la utilidad importa más que contar caracteres de forma aislada.

¿Puedo calcular mi huella desde el historial de chat?

Solo un escenario aproximado. El historial no contiene telemetría energética, centro de datos, factor eléctrico ni infraestructura asignada. Guarde número y tipo de tareas y declare la incertidumbre.

¿Qué indicador debería usar una empresa?

Además de gCO₂e, mida energía y emisiones por tarea aceptada, por proceso completado o por resultado de negocio. Un indicador por prompt puede premiar dividir una tarea en más llamadas.

Metodología y fuentes

Se eliminaron el código Schema visible, categorías cualitativas sin unidad, cifras de GPT‑3 aplicadas a modelos actuales, comparaciones con búsquedas y móviles presentadas como universales, y proyecciones hídricas sin relación con la huella de un producto. La búsqueda de una cifra para Claude se limitó a documentación pública oficial localizada; por eso se formula como “no encontrada”, no como inexistencia absoluta.

Para comprender el marco general —energía, agua, materiales y beneficios potenciales— consulte la guía de IA sostenible.

Conclusión editorial: comparar asistentes exige la misma tarea, fecha, perímetro y método eléctrico. Hasta que los proveedores publiquen datos equivalentes, el resultado más riguroso no es un ganador: es una tabla que muestra medición, estimación y ausencia de información sin confundirlas.

author avatar
Daniel Bellido Pérez

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *