Modela tu factura mensual de API LLM en 20 modelos actuales: caché de prompts, descuentos por lotes y recargos por prompt largo con precios oficiales.
Divide el prompt en la parte que se repite en cada llamada y la parte que cambia. Solo la parte repetida se puede almacenar en caché.
La caché es una decisión de arquitectura; los lotes son una proporción de tu tráfico. Ambas se calculan con la documentación de los proveedores.
Los precios están transcritos de la documentación de los proveedores consultada el 22 de agosto de 2026 y cambian sin aviso. El comportamiento de la caché y de los lotes depende de tu patrón de tráfico; tómalo como una estimación de planificación, no como un presupuesto.
También podrías encontrar útiles estas calculadoras
Calcula el costo de una llamada de API y compárala entre modelos
Convierte palabras, páginas o código a tokens; exacto en OpenAI
Comprueba si tu prompt cabe en la ventana de contexto
Compara GPU autoalojada frente a API de inferencia
Multiplicar tokens por una tarifa publicada te da el precio de una llamada, no el tamaño de tu factura. Tres mecanismos deciden la factura, y los tres están publicados: la caché de prompts, que cobra un prefijo repetido a una fracción del precio de uno nuevo; el procesamiento por lotes, que reduce la tarifa a la mitad para todo lo que puede ejecutarse de forma asíncrona; y el recargo por prompt largo, que vuelve a tarificar una solicitud entera cuando la entrada supera un umbral. Esta calculadora calcula los tres con la documentación de los proveedores, y te dirá cuándo la caché es la opción equivocada.
Cada solicitud cobra los tokens de entrada y los de salida a tarifas distintas. Si una parte del prompt es idéntica cada vez —un prompt de sistema, esquemas de herramientas, un documento fijo— la caché puede servirla a 0,1x la tarifa de entrada en OpenAI, Anthropic y Google, 0,25x en xAI y unos 0,03x en DeepSeek. Pero escribir la caché cuesta 1,25x un token nuevo, y la entrada caduca: 30 minutos en los modelos actuales de OpenAI, 5 minutos por defecto en Anthropic. Por debajo de aproximadamente una solicitud por ventana de caducidad pagas una escritura cada vez, y la caché sale más cara que no usarla.
Factura mensual
Convertir un volumen de solicitudes previsto y la forma del prompt en una cifra mensual que puedas poner en un plan, antes de tener tráfico.
Encontrar el ritmo de solicitudes al que una caché de prompts empieza a compensar en tu modelo, en lugar de suponer un ahorro plano del 90 %.
Calcular el costo de un trabajo nocturno de clasificación o enriquecimiento con la tarifa de lotes del 50 % frente a ejecutarlo de forma sincrónica.
Comparar la carga de trabajo idéntica —mismos tokens, mismo volumen, mismas palancas— en todos los modelos actuales en lugar de comparar tarifas de portada.
Un bot de soporte que envía un prompt de sistema de 2.400 tokens con 250 tokens nuevos por turno gasta cerca del 90 % de su presupuesto de entrada en reenviar el mismo texto. Almacenar ese prefijo en caché suele ser el mayor ahorro disponible, y no exige cambiar de modelo.
Por debajo del punto de equilibrio la caché caduca entre solicitudes, así que cada llamada paga la escritura de 1,25x en lugar de la lectura de 0,1x. Esta calculadora calcula el punto de equilibrio en solicitudes por día para tu modelo y dice claramente cuándo desactivar la caché.
OpenAI, Anthropic y Google publican un descuento por lotes del 50 %. La clasificación, el enriquecimiento y los resúmenes retroactivos rara vez necesitan una respuesta sincrónica, así que la proporción de tráfico que puedes diferir es un multiplicador directo sobre la factura.
Por encima de 272.000 tokens de entrada OpenAI cobra 2x la entrada y 1,5x la salida, y sigue haciéndolo durante el resto de la sesión. Google y xAI suben a partir de 200.000 solo para la solicitud sobredimensionada. Una estimación plana por token se equivoca justo en el trabajo de contexto largo que la gente planifica por adelantado.
La calculadora de costo de prompt calcula una llamada. Esta calcula un mes, que es un cálculo distinto porque tiene que tener en cuenta un prefijo que se repite entre llamadas, una proporción de tráfico que puede diferirse a un endpoint por lotes y un umbral que vuelve a tarificar solicitudes completas. Usa aquella para comparar tarifas; usa esta para presupuestar.
Cuando las solicitudes llegan más a menudo de lo que tarda en caducar la caché. Una lectura de caché cuesta alrededor de una décima parte de un token de entrada nuevo, pero escribir la caché cuesta 1,25 veces uno nuevo, y la entrada vive 30 minutos en los modelos actuales de OpenAI o 5 minutos por defecto en Anthropic. Anthropic indica que la caché de 5 minutos compensa tras una sola lectura. Por debajo de aproximadamente una solicitud por ventana, cada llamada paga una escritura y la caché cuesta más que no hacer nada.
Anthropic documenta que sí, y afirma que los multiplicadores se combinan. Los demás proveedores no publican nada al respecto, así que esta calculadora aplica el descuento por lotes a todo el costo por solicitud, incluidas las líneas de caché, y lo indica aquí en lugar de suponerlo en silencio. Si eso afecta a tu presupuesto, pon la proporción por lotes a cero y toma el resultado como la cifra conservadora.
Porque aquí un mes son 365 divididos entre 12, unos 30,4 días, en lugar de 30 días fijos. Usar meses de 30 días para la cifra mensual y 365 días para la anual hace que las dos discrepen en un 1,4 %, y esa es la clase de desajuste que un lector encuentra multiplicando y que le hace dejar de confiar en la página.
No, y deliberadamente no los ofrece. Los embeddings se cobran solo por entrada a una tarifa completamente distinta —unos 0,02 dólares por millón de tokens frente a 0,20 o más en un modelo de chat—, así que calcularlos con una tarifa de chat exagera la factura en un orden de magnitud. El ajuste fino añade el costo de entrenamiento más una tarifa de inferencia más alta. Ambos merecen sus propias páginas.
DeepSeek es el único proveedor aquí que cobra según la hora del día. Sus tarifas publicadas fuera de hora punta son la mitad de las de hora punta, con horas punta de 01:00 a 04:00 y de 06:00 a 10:00 UTC. El catálogo guarda la cifra fuera de punta, así que una fila de DeepSeek es correcta para un trabajo nocturno y la mitad de lo que paga una carga interactiva diurna.