A-Jie (una persona ilustrativa, líder técnico de un equipo freelance que atiende a clientes en el extranjero — no un cliente real) suele revisar noticias de tecnología durante su pausa de café por la tarde. Ese día vio un fragmento de entrevista de CNBC Television con un titular: el modelo más nuevo de OpenAI usa 54% menos tokens en “agentic coding” (el tipo de flujo de trabajo en el que la IA planifica sus propios pasos, escribe código y ejecuta pruebas) en comparación con otros modelos. En pantalla, Sam Altman lo dijo al presentador como si fuera el progreso más natural del mundo.

El dedo de A-Jie se detuvo sobre la pantalla. No lo reenvió de inmediato al canal del equipo. Recordó lo ocurrido tres meses antes — otro proveedor de modelos había afirmado una “gran mejora de eficiencia”, y él había cambiado todo el flujo de trabajo del agente sin pensarlo dos veces. La factura de fin de mes no bajó, subió. La lección que aprendió fue simple: lo que otro llama “ahorro” no necesariamente es el ahorro que tú vas a obtener.

Lo que realmente dice la frase de CNBC

Según este fragmento de entrevista de CNBC Television, Sam Altman le dijo al presentador que el modelo más nuevo de OpenAI usa 54% menos tokens que otros modelos en tareas de agentic coding. En otras palabras, la “eficiencia de tokens” subió un 54% — pero esa frase en sí puede significar muchas cosas distintas.

Aquí hay un detalle que A-Jie no notó al principio: “con qué se compara” no es consistente entre los distintos medios que reportaron la misma entrevista. La URL de la propia página de video de CNBC dice “than Anthropic's latest” (más eficiente que el modelo más reciente de Anthropic), mientras que varios medios tecnológicos reportaron que la cifra proviene de un benchmark llamado ExploitBench, en el que el nuevo modelo de OpenAI empató con un modelo rival usando aproximadamente un tercio de los tokens de salida. En otras palabras, esto probablemente sea una comparación directa contra un competidor, no un salto generacional del propio modelo anterior de OpenAI. Es una cita directa de la entrevista, y el fragmento de CNBC en sí no explica cómo se calculó la cifra — si se trata de una reducción en el total de tokens para completar la misma tarea, menos ciclos de “reintento y corrección”, o una comparación contra un modelo rival específico en un benchmark específico. El fragmento no lo aclara.

A-Jie sabe que agentic coding no es como una conversación normal: el modelo tiene que planificar sus propios pasos, escribir código, ejecutar pruebas y corregir cuando algo falla — una sola tarea puede repetirse una docena de veces antes de terminar. Por eso “ahorrar tokens” resulta tan tentador en el contexto de agentic coding — cada ciclo cuesta dinero, así que en teoría, menos ciclos significa una factura visiblemente menor.

Un porcentaje, muchos significados posibles

Antes de reenviar la noticia al canal interno, A-Jie hizo algo primero: desglosó “54% más eficiente” en las distintas formas que realmente podría tomar.

La primera posibilidad es que el modelo mismo simplemente “hable menos” — produciendo menos tokens para lograr la misma tarea. La segunda es que su capacidad de planificación mejoró, tomando menos caminos equivocados — menos ciclos de “intentar, fallar, rehacer” que se traducen en menos tokens totales. La tercera es que el benchmark oficial usó un conjunto específico de tareas, y el resultado podría verse completamente distinto en los proyectos reales, desordenados y multi-archivo del equipo de A-Jie. La cuarta posibilidad se le ocurrió a A-Jie después, al investigar más: este 54% podría ni siquiera ser una comparación con la generación anterior de OpenAI — podría ser una comparación con el modelo de otra empresa por completo. Si es una cifra de “vencer a un competidor” en lugar de “nuestro propio salto generacional”, la respuesta a “¿bajará realmente mi factura si cambio?” podría ser completamente distinta — y podría no tener nada que ver con el modelo que el equipo de A-Jie usa actualmente.

Estos distintos tipos de “ahorro” afectarían la factura real de A-Jie de formas radicalmente diferentes, y el fragmento de CNBC nunca responde cuál de ellos es. Este es precisamente el punto que este artículo quiere señalar: cualquier afirmación de que “el Modelo X ahorra N% respecto al Modelo Y” — sin explicar la base de medición (mismo conjunto de tareas, mismo método de facturación, benchmark oficial o prueba independiente de terceros) — solo debería tratarse como “una dirección que vale la pena observar”, no como “el número que realmente vas a ahorrar”.

El giro: descubrió que no tenía una “línea base” con la cual comparar

A-Jie estaba a punto de preguntarle directamente a un ingeniero: “Si cambiamos a este nuevo modelo, ¿cuánto ahorraríamos?” Pero antes de terminar la idea, se dio cuenta de algo más fundamental — su equipo nunca había medido formalmente cuántos tokens consume su flujo actual de agentic coding para completar una tarea típica. La lección de la vez anterior no fue “el modelo nuevo no era lo bastante bueno”, sino que no tenían números reales de “antes” con los cuales comparar. Solo podían adivinar si estaban ahorrando algo, y solo lo descubrieron después de que la factura subiera — que en realidad no habían ahorrado nada.

Fue entonces cuando comprendió que la verdadera pregunta nunca fue “¿es exacto el 54% de Sam Altman?”, sino: si ni siquiera tienes tu propia línea base de uso, cualquier porcentaje anunciado oficialmente es un número sin punto de referencia.

Esta vez no se apresuró a cambiar — primero hizo otra cosa

Esta vez, A-Jie no cambió de inmediato el flujo de trabajo del agente. Primero hizo que el equipo registrara el uso de tokens de las tareas típicas que habían ejecutado en las últimas dos semanas — del tipo que siempre involucra la planificación, escritura y prueba repetidas de agentic coding — anotando el modelo, el tipo de tarea, el número de rondas hasta completarla y el total de tokens de cada una. Una vez que esa línea base quedó firme, sin importar qué proveedor afirmara después “X% más eficiente”, tendrían números reales con los cuales compararlo, en lugar de tomar decisiones basadas en un solo titular.

Para equipos freelance o de desarrollo pequeños, este es en realidad el primer paso que debería darse antes de creer cualquier afirmación de “mejora de eficiencia”: no confiar primero en el porcentaje, sino ver primero tu propio uso actual. Solo entonces tienes la base para juzgar si el “ahorro” del que habla otro es realmente un ahorro para ti.

Preguntas frecuentes

¿Es el “54% más eficiente en tokens” que dijo Sam Altman una garantía oficial? ¿Comparado con qué?

No es una cifra garantizada oficialmente. Es una declaración verbal que Sam Altman hizo en una entrevista de CNBC Television — no un documento oficial de precios de OpenAI ni un informe formal de benchmark. Y ni siquiera “comparado con qué” está del todo claro: varios medios reportaron la misma entrevista con enfoques distintos — algunos enfatizaron una comparación con el propio modelo anterior de OpenAI, mientras que la URL de la propia página de video de CNBC dice que se compara con el modelo más reciente de Anthropic (“than Anthropic's latest”), y otros reportes citaron una cifra proveniente del benchmark ExploitBench, comparando el uso de tokens contra un modelo rival cuando el rendimiento estaba empatado. Este artículo etiqueta consistentemente la cifra como “reportado por CNBC”, y su base de medición precisa está pendiente de verificación frente a la información pública oficial de OpenAI. Los lectores no deberían tratarla directamente como un porcentaje de costo que ellos mismos ahorrarán.

¿Qué es “agentic coding” y por qué consume tokens especialmente rápido?

Se refiere a un patrón de uso en el que la IA planifica sus propios pasos, escribe código, ejecuta pruebas y corrige y vuelve a ejecutar según los resultados — a diferencia de una simple pregunta y respuesta, una sola tarea a menudo requiere muchos ciclos repetidos, y cada ciclo consume tokens, por lo que el uso acumulado tiende a ser mucho más alto de lo esperado.

Cuando una empresa ve noticias sobre un modelo “más eficiente en tokens”, ¿cómo debería decidir si cambiar?

Primero, confirma la base de medición de la afirmación (benchmark oficial, prueba independiente, o una cita de entrevista como esta), y luego haz una prueba a pequeña escala contra la línea base real de uso de tu propio equipo — en lugar de cambiar todo basándote en un solo titular. Esto evita repetir la brecha entre “ahorro anunciado” y “la factura no bajó realmente”.

Nuestro equipo actualmente no registra una línea base de uso de tokens, ¿por dónde deberíamos empezar?

Empieza por los pocos tipos de tareas que ejecutas con más frecuencia. Registra el modelo usado, el tipo de tarea, el número de rondas hasta completarla y el total de tokens. Después de acumular dos o tres semanas de datos, tendrás números reales con los cuales comparar cualquier comparación futura de modelos o afirmación de un proveedor — en lugar de juzgar por impresión.

Nota sobre la fuente

Este artículo está adaptado de un video publicado por el canal de YouTube CNBC Television el 9 de julio de 2026, “OpenAI's newest AI model is 54% more token efficient on agentic coding, Sam Altman tells CNBC”, reorganizado y reescrito, no traducido de forma literal. Según la verificación de hechos, la misma entrevista también fue cubierta por un reportaje de CNBC.com y varios medios tecnológicos (como TechStartups), y sus descripciones de “con qué se compara el 54%” no son del todo consistentes; este artículo presenta esa inconsistencia con precisión en el cuerpo y en las preguntas frecuentes, en lugar de imponer una única conclusión al lector. “A-Jie” en este artículo es una persona ilustrativa con fines explicativos, no un caso real de cliente. Todas las afirmaciones de este artículo sobre “54% más eficiente en tokens” son citas de lo que dijo Sam Altman en la entrevista de CNBC y de otros reportes mediáticos, no un documento oficial de precios o de garantía de rendimiento de OpenAI, y no constituyen ninguna promesa de ahorro de costos. Los lectores deben evaluar sus propios datos medidos reales al valorar posibles beneficios.

Actúa ahora

No te apresures a creer el próximo titular que diga “X% más eficiente”. Prueba AI Token King gratis, y te ayudaremos a poner sobre la mesa el uso real de tokens de GPT, Claude, Gemini y otros modelos en tareas de agentic coding, para que primero construyas tu propia línea base — y compares cualquier afirmación futura de eficiencia contra números reales, en lugar de cambiar de modelo por intuición.