(El siguiente escenario es un caso ficticio con fines ilustrativos. El protagonista, «Wen Zixuan», es una figura representativa usada para explicar, no un cliente real.)

El jefe soltó una frase en el grupo

«La empresa de al lado ya compró sus propias GPU para correr IA. ¿Por qué seguimos pagando la factura mensual de Claude?»

Wen Zixuan es el líder técnico de una startup de una docena de personas, y al mirar la frase que su jefe acababa de soltar en el grupo, no se le ocurrió ninguna respuesta en el momento. La factura mensual de la API de Claude de su empresa efectivamente no dejaba de subir, y últimamente internet estaba lleno de afirmaciones de que «un solo Mac Studio puede superar a Claude». Su jefe añadió una línea más: «Reunión de presupuesto la próxima semana. Tráeme una comparación: comprar nuestro propio hardware o seguir pagando la API» — y así, todo el problema cayó sobre su escritorio.

Primero, encontrar un sustituto que sí se pueda calcular

Lo primero con lo que se topó Wen Zixuan al empezar a investigar fue que nadie sabe en realidad cuántas GPU harían falta para correr Claude Fable 5, porque Anthropic nunca ha publicado su número de parámetros, arquitectura ni pesos. Había todo un hilo en Reddit adivinando cuántas H100 harían falta para correr algo del nivel de Fable — una persona adivinó cuatro, otra adivinó ocho B200, alguien más simplemente dijo «necesitarías un rack entero». Las respuestas eran un desastre, porque nadie había hecho realmente el cálculo.

Eventualmente encontró un video que hacía el cálculo usando Kimi K3 como sustituto, y ahí fue cuando entendió: esta era la única forma de calcular algo de verdad. Los propios materiales de Kimi K3 publican 2.8 billones de parámetros (2.8×10¹²) y una ventana de contexto de 1 millón de tokens, y sus materiales de lanzamiento lo comparan directamente con Fable 5 en benchmarks de código y de agentes — aunque el propio blog de Kimi admite que en general todavía va por detrás de los modelos cerrados más fuertes, y una puntuación de benchmark no es lo mismo que hacer bien el trabajo real. El punto no es afirmar que Kimi K3 pueda reemplazar a Fable 5; es que Kimi K3 es el único sustituto que es a la vez de escala de frontera y tiene un tamaño publicado y transparente — lo que lo convierte en lo único con lo que se puede hacer aritmética real.

En cuanto hizo la cuenta, la respuesta apareció de inmediato

Kimi K3 almacena sus pesos en un formato de 4 bits llamado MXFP4. 2.8 billones de parámetros por medio byte da aproximadamente 1.4 terabytes solo para los pesos brutos — y eso es antes de contar el software de inferencia, el contexto de la conversación o cualquier margen de seguridad. Es el piso, no el total.

Wen Zixuan aplicó esa cuenta a cada opción que su empresa realmente podía costear, y chocó con una pared cada vez. Primero revisó el Mac Studio de gama más alta de la empresa — 512 GB de memoria unificada, ni siquiera un tercio del valor piso, descartado de inmediato. Recordó que un compañero había dicho «con cuatro H100 debería bastar» — hizo la cuenta: 80 GB cada una, cuatro suman 320 GB, incluso menos que el Mac Studio, tampoco alcanza. Subiendo más, un DGX B200 con ocho GPU B200 tiene 1.44 TB de memoria de GPU — en el papel, por fin supera el piso — pero después de los pesos quedan menos de 40 GB disponibles, y la ventana de contexto, la caché de la conversación y el software de inferencia tienen que caber todos en esos 40 GB sin espacio para respirar. Siguió subiendo y encontró el DGX B300: ocho tarjetas, 2.3 TB, dejando casi 900 GB después de los pesos — en teoría, por fin, viable. Excepto que la propia recomendación de Kimi para «inferencia eficiente» pide 64 o más aceleradores — lo que equivale a ocho servidores, no uno.

Un solo DGX B300 a plena carga tiene un consumo publicado de 14.5 kW; ocho de ellos se acercan a 116 kW antes de contar la refrigeración. También encontró a alguien en el hilo que decía que su empresa opera varias decenas de B200, y que encenderlas «suena como sentarse detrás de un Airbus A380». Hizo una estimación aproximada con los precios públicos de alquiler de hoy — ocho nodos así costarían entre 313,000 y 577,000 dólares al mes. Sabía que esto era solo una referencia de orden de magnitud, no una cotización, pero ya era suficiente para mostrar que la escala no tenía nada que ver con lo que él había imaginado originalmente.

Creía que estaba cotizando una compra única — en realidad estaba cotizando un centro de datos

Al llegar a este punto, Wen Zixuan se dio cuenta de que su suposición inicial había estado completamente equivocada. Había asumido que su jefe quería «comprar algunas GPU, pagar una vez, y no volver a tocar la factura de la API» — un gasto de capital único. Pero una vez desplegada la cuenta, resultó que una configuración autoalojada capaz de correr un modelo de la clase Fable no es en absoluto una compra de hardware de «una sola vez» — es toda una operación de centro de datos: energía, refrigeración, infraestructura de red, y alguien vigilando las máquinas las 24 horas. Y ese costo mensual era un orden de magnitud más alto que lo que actualmente pagaban a Claude.

Más importante aún, el video señaló que el hilo de Reddit había planteado mal la pregunta desde el principio: «100 usuarios» no es lo mismo que «100 solicitudes concurrentes». Si 100 empleados envían cada uno una solicitud cada 10 minutos, y cada respuesta ocupa el sistema durante 30 segundos, el promedio de solicitudes realmente activas al mismo tiempo resulta ser de apenas unas 5 — los agentes de IA sí pueden disparar esa cifra rápidamente, claro, pero cuando Wen Zixuan revisó el uso concurrente real de su propio equipo, estaba muy lejos de ser tan extremo como había imaginado.

Lo que llevó a la reunión no fue una cotización, fue una pregunta

En la reunión de presupuesto de la semana siguiente, Wen Zixuan no llegó con una orden de compra para ocho DGX B300 — eso habría sido precipitarse. Alguien en el video que había operado un servicio de LLM para miles de usuarios dijo una frase que él anotó: «Un modelo que sea suficientemente bueno y que realmente puedas escalar le gana a un supermodelo que solo puede atender a un par de personas». Coincidía con otro patrón que había encontrado: los equipos que realmente han corrido modelos locales por su cuenta casi nunca están «completamente autoalojados» — el trabajo privado o repetitivo va a un modelo local pequeño, y las tareas más difíciles siguen yendo a Claude o GPT.

Lo que Wen Zixuan llevó a la sala fue, en cambio, una pregunta: «¿Sabemos realmente cuántos tokens y cuántas solicitudes concurrentes usamos de verdad cada día?» Su sugerencia fue postergar la decisión de autoalojarse o no, y primero desplegar el uso real del equipo — qué tareas tienen mucho volumen pero son simples, cuáles tienen poco volumen pero son pesadas — antes de decidir si valía la pena cambiar la factura de la API por la responsabilidad operativa de todo un centro de datos.

Preguntas frecuentes (FAQ)

P1: ¿Qué es «Kimi K3», mencionado en este artículo? ¿Qué relación tiene con Claude Fable 5?

Kimi K3 es un modelo de lenguaje de gran escala con un número de parámetros divulgado públicamente (2.8 billones de parámetros, arquitectura de mezcla de expertos, ventana de contexto de 1 millón de tokens), y sus materiales de lanzamiento lo compararon directamente con Claude Fable 5 en benchmarks. Como Anthropic nunca ha publicado el número de parámetros ni la arquitectura de Fable 5, este artículo (y el video del que se adapta) usa Kimi K3 como sustituto «de escala similar, pero con especificaciones públicas y transparentes» para estimar el hardware necesario para un despliegue local — no es una afirmación de que ambos modelos rindan igual.

P2: ¿Realmente una empresa común necesita comprar sus propias GPU para correr un modelo de IA de primer nivel de forma local?

En la mayoría de los casos, no. La conclusión del video fuente es que los equipos que realmente han corrido modelos locales casi nunca están «completamente autoalojados» — los modelos locales pequeños son adecuados para trabajo privado o repetitivo (como búsqueda de documentos, clasificación o codificación rutinaria), mientras que las tareas más difíciles siguen yendo a servicios en la nube como Claude o GPT. Si vale la pena autoalojarse depende del uso concurrente real y del patrón de trabajo, no de un impulso reflejo por ahorrar costos.

P3: ¿Las cifras de compra y electricidad de este artículo (como 313,000–577,000 dólares al mes) son cotizaciones precisas?

No. Estas cifras son estimaciones aproximadas de orden de magnitud que el creador del video fuente calculó a partir de precios públicos de alquiler de hardware y especificaciones — no son una cotización formal, ni un precio oficial de Anthropic, Nvidia o ningún proveedor de nube. El costo real varía significativamente según la región, el proveedor y los términos del contrato; los lectores que evalúen su propia situación deben obtener una cotización real.

P4: ¿Cuál es la diferencia entre «100 usuarios» y «100 solicitudes concurrentes», y por qué importa tanto?

«Número de usuarios» es cuánta gente podría potencialmente usar el sistema; «solicitudes concurrentes» es cuántas solicitudes tiene que procesar el sistema realmente en un momento dado — y ambas pueden diferir enormemente. El ejemplo del artículo: si 100 empleados envían solicitudes de forma pareja y distribuida, el número que corre al mismo instante podría ser tan bajo como 5, muy por debajo del número intuitivo de «100». Esta distinción determina directamente cuánto hardware realmente hay que comprar, y es el punto de este artículo más propenso a malinterpretarse — y a llevar a comprar de más.

P5: En lugar de adivinar las especificaciones del hardware, ¿cómo debería una empresa decidir si mover el trabajo de IA a infraestructura local?

La sugerencia del video fuente es: no te apresures a hacer una orden de compra — alquila hardware por un par de semanas y observa cómo responden usuarios reales, lo cual dice más que cualquier hoja de especificaciones o gráfico de benchmark. Y antes incluso de alquilar para probar, el primer paso más fundamental es tener una imagen clara del uso real de tokens de tu equipo y de sus patrones de solicitudes concurrentes — necesitas saber cuánto estás usando de verdad, y en qué, antes de estar en condiciones de decidir si cambiar ese costo por la carga operativa de todo un centro de datos vale la pena.

Nota de la fuente: Este artículo está adaptado de un video publicado por el canal de YouTube Kai, titulado «What Would It Cost to Run Claude Fable 5 Locally?», reescrito en formato narrativo y no como traducción palabra por palabra. El protagonista de este artículo, «Wen Zixuan», es una figura representativa usada para explicar, no un caso real de cliente; el trasfondo y la situación de su empresa son una reconstrucción ilustrativa. Todas las cifras específicas del artículo (conversiones de memoria, especificaciones de GPU, consumo eléctrico, estimaciones de costo de alquiler) son estimaciones de orden de magnitud que el creador del video fuente calculó a partir de especificaciones públicas, no datos verificados o auditados de forma independiente por este sitio ni por ningún tercero, ni precios oficiales. Los lectores deben basarse en especificaciones reales de hardware y cotizaciones de proveedores al evaluar su propia situación.

Empieza ahora

Ya sea que sigas usando la API o empieces a considerar el autoalojamiento, lo primero que realmente necesitas averiguar no es «cuántas GPU comprar», sino «cuánto estamos usando de verdad ahora mismo». En lugar de adivinar remedios para un dolor de cabeza que no has diagnosticado, primero despliega el uso real de tokens de cada modelo y cada tarea. Prueba AI Token King gratis hoy mismo, y déjanos ayudar a tu equipo a desplegar su uso real, para que decidan con datos si cambiarlo todo por un centro de datos entero — no con una frase como «la empresa de al lado ya lo está haciendo».