Calcula el costo de una llamada de API con tus tokens de entrada y salida y compara el mismo prompt en cada modelo actual de OpenAI, Anthropic y Google.
La entrada es todo lo que envías: prompt de sistema, historial y contexto recuperado. La salida es solo la respuesta.
Las tarifas son los precios de lista publicados por los propios proveedores, verificados el 22 de agosto de 2026. Aquí no se aplican acuerdos por volumen, caché de prompts ni precios por lotes. Confirma los precios vigentes con tu proveedor antes de comprometer un presupuesto.
También podrías encontrar útiles estas calculadoras
Convierte palabras, páginas o código a tokens; exacto en OpenAI
Factura mensual de API LLM con caché y descuentos por lotes
Comprueba si tu prompt cabe en la ventana de contexto
Compara GPU autoalojada frente a API de inferencia
Todos los proveedores de LLM facturan por token y cobran más por los tokens que escriben que por los que leen. Esta calculadora calcula el precio de una sola llamada a partir de tus tokens de entrada y salida, y después pasa el mismo prompt por cada modelo actual para que veas cuánto cuesta el trabajo idéntico en otro sitio.
Los proveedores publican dos tarifas por modelo, ambas por millón de tokens: una para la entrada (todo lo que envías: prompt de sistema, historial de conversación y contexto recuperado) y otra para la salida (solo la respuesta). La salida es la mitad cara. En los modelos de frontera actuales cuesta entre tres y cinco veces la tarifa de entrada, porque generar un token exige una pasada completa del modelo mientras que los tokens de entrada se procesan en paralelo.
Fórmula de Cálculo de Costo
Un ingeniero calcula una llamada de una función de IA prevista para ver si la economía unitaria sobrevive al tráfico real
Un equipo pasa su forma de prompt real por todos los modelos y elige según la diferencia de precio y no según el marketing
Un analista calcula una tanda de varios miles de clasificaciones como trabajo cerrado, sin dar por supuesto ningún compromiso mensual
Un desarrollador confirma si un prompt de repositorio completo cabe en la ventana de contexto y qué añade el tramo de prompt largo cuando sí cabe
Una respuesta de 300 tokens cuesta más que un prompt de 400 en cualquier modelo de frontera actual, porque la salida se factura entre tres y cinco veces más cara que la entrada. Recortar un prompt de sistema verboso ahorra menos que limitar max_tokens.
Pasa un prompt por la tabla de comparación y la diferencia entre el modelo más barato y el más caro suele ser de cincuenta veces o más. Es una decisión que conviene tomar a conciencia y no por defecto.
La línea GPT-5.x de OpenAI vuelve a tarificar una solicitud cuya entrada supera los 272.000 tokens al doble en entrada y una vez y media en salida, y mantiene la tarifa alta el resto de la sesión. xAI duplica ambas tarifas por encima de 200.000. El recargo se aplica a toda la solicitud, no solo a los tokens que pasan del límite.
La entrada más la salida tienen que caber en la ventana publicada. Un prompt que se pasa no es caro: es rechazado, así que la comparación marca esos modelos en lugar de darte un precio que nunca podrías pagar.
Los tokens de salida se generan de uno en uno y cada uno exige una pasada completa por el modelo. Los tokens de entrada se procesan en paralelo en una sola pasada. La diferencia de costo es cómputo real, y por eso todos los proveedores tarifican ambos por separado: hoy, entre tres y cinco veces la tarifa de entrada en los modelos de frontera.
No. Son precios de lista para una llamada sin caché. Además, el descuento por lectura de caché no es el noventa por ciento uniforme que suele citarse: verificado contra la documentación de cada proveedor va desde una treintava parte de la tarifa de entrada en DeepSeek hasta una cuarta parte en Grok 4.6, y la mayoría cobra un sobreprecio por escribir la caché. La Calculadora de Costo API LLM lo modela correctamente, incluido el punto de equilibrio por debajo del cual la caché cuesta más de lo que ahorra.
Tampoco se aplican aquí. Solo tres de los cinco proveedores de este catálogo publican un descuento por lotes, y donde existe reduce ambas tarifas a la mitad a cambio de una respuesta diferida. Si tu carga de trabajo admite esa espera, modélalo en la Calculadora de Costo API LLM en vez de dar el descuento por supuesto.
La tokenización depende del modelo, así que no existe una proporción universal de palabras a tokens. Como estimación de trabajo, la prosa en inglés ronda tres cuartos de token por palabra y el código es más denso. La Calculadora de Conteo de Tokens convierte palabras, páginas o código a tokens usando la familia de tokenizador de cada modelo.
No. Es un recuento simple: cuántas llamadas idénticas quieres calcular como una sola pieza de trabajo. Esta calculadora no deduce ningún periodo de tiempo a partir de él. Para una tasa diaria que se convierta en factura mensual, usa la Calculadora de Costo API LLM, que pide solicitudes por día y aplica un mes de 30,44 días.
No. Esta calculadora tarifica la inferencia sobre un modelo base. El fine-tuning se factura aparte: un cargo de entrenamiento por millón de tokens de entrenamiento y, en la mayoría de casos, una tarifa de inferencia más alta después para el modelo resultante. Son tarifas distintas y no entran en esta comparación.