Calcula el costo de un ajuste fino con tarifas publicadas: Vertex AI, Together y Fireworks por 1M de tokens, u horas-GPU en hardware rentado.
Escenarios
Cada tarifa se lee de la página de precios del propio proveedor.
Los proveedores facturan el conjunto de entrenamiento una vez por época, y el de evaluación una vez por evaluación.
Proveedores que no publican tarifa por token
Tarifas leídas de la página de precios de cada proveedor el 23 de agosto de 2026. Los precios de ajuste fino cambian; verifica con el proveedor antes de comprometer presupuesto.
También podrías encontrar útiles estas calculadoras
Estima el tiempo y costo de entrenamiento de modelos de aprendizaje automático
Elige tu GPU y descubre qué LLM caben de verdad
Compara GPU autoalojada frente a API de inferencia
Parámetros, VRAM y encaje en GPU según la arquitectura real
El ajuste fino se factura por tokens, no por tiempo, y el número de tokens no es el tamaño de tu conjunto de datos. Todos los proveedores importantes multiplican el conjunto de entrenamiento por el número de épocas, así que un conjunto de 2 millones de tokens entrenado en tres pasadas se factura como seis millones. Esta calculadora aplica la tarifa publicada de cada proveedor a ese número, y cubre también la otra vía: rentar GPU y correr el trabajo por tu cuenta, donde la cuenta es horas-GPU × tarjetas × tarifa por hora.
Google, Together y Fireworks enuncian la misma regla: pagas por los tokens que procesa el entrenador, es decir tu conjunto de entrenamiento multiplicado por el número de épocas. El conjunto de evaluación se factura aparte y —esta es la parte que casi todas las estimaciones equivocan— se multiplica por el número de evaluaciones, no por el de épocas. Together además aplica un cargo mínimo por trabajo, así que un experimento muy pequeño cuesta el piso y no la aritmética. Autoalojarse cambia el modelo por completo: rentas aceleradores por hora y pagas cada tarjeta que ocupa el trabajo, durante todo el trabajo, se saturen o no.
Tokens facturados
Convierte un tamaño de conjunto de datos y un número de épocas en una cifra que puedes poner en un plan, con tarifas leídas de la página del proveedor.
El mismo trabajo cotizado en cada proveedor que publica una tarifa para él, para que la diferencia se vea en lugar de suponerse.
Los proveedores alojados cobran distinto por cada uno, y autoalojarse cambia la huella de memoria lo suficiente para cambiar el número de tarjetas.
Cotiza la misma corrida por ambas vías: por token en una plataforma administrada, o por horas-GPU en aceleradores rentados.
Si la cifra de un proveedor difiere de la tarifa publicada aplicada a tus tokens facturados, tienes una pregunta que hacer.
El modo autoalojado deriva cuántas tarjetas necesita el modelo con tu precisión, que es lo que realmente multiplica la tarifa por hora.
Los proveedores cotizan un precio por millón de tokens de entrenamiento y la gente lo aplica al conjunto de datos. Tres épocas triplican la cuenta antes de cualquier otra cosa.
Cobrar el conjunto de evaluación una vez por época lo sobrestima en casi cualquier corrida real. Together enuncia la regla explícitamente: tamaño del conjunto de validación × número de evaluaciones.
Together aplica un mínimo de 4,00 US$ por trabajo, con pisos más altos en sus modelos especializados. Por debajo de ese umbral, más datos salen gratis.
En Vertex AI, ajustar Gemini 2.5 Flash cuesta 0,005 US$ por millón de tokens; ajustar Qwen 3 14B en la misma plataforma cuesta 8,46 US$. Es un factor de unas 1.700 veces para la misma operación.
Google cobra 1,5× el precio base por los endpoints ajustados de Gemini 3, y el mismo precio para Gemini 2.5 y anteriores. Fireworks sirve los modelos ajustados al precio base. No existe un multiplicador único.
No como usuario nuevo. La página de precios de OpenAI indica que está cerrando su plataforma de ajuste fino y que ya no admite usuarios nuevos; los usuarios existentes pueden crear trabajos de entrenamiento durante los próximos meses, y los modelos ajustados siguen disponibles para inferencia hasta que sus modelos base queden obsoletos. El único precio de entrenamiento que sigue publicado es de 100 US$ por hora para el ajuste fino por refuerzo de o4-mini, que es una tarifa por hora y no por token.
Anthropic no publica ningún precio de ajuste fino por token. En lugar de inventar uno, esta calculadora lista los proveedores que sí publican tarifas y dice con claridad cuáles no. Cohere y Mistral están en la misma situación: ninguna de sus páginas de precios incluye una tarifa de ajuste fino.
Alrededor de 1.000 tokens por cada 750 palabras en inglés sirve como primera aproximación, pero los tokenizadores difieren bastante entre familias de modelos. La calculadora de conteo de tokens aplica la proporción de caracteres por token publicada por cada proveedor, que es el número con el que realmente se calcula tu cuenta.
De dos a cuatro es el rango habitual para el ajuste supervisado, y el costo escala linealmente con la cuenta. Más épocas aumentan el riesgo de sobreajuste, así que lo sensato suele ser vigilar la pérdida de validación en lugar de comprar más pasadas.
Puede serlo, porque un modelo ajustado necesita menos instrucciones en cada petición, y ese ahorro se repite en cada llamada. Que se recupere la inversión depende del volumen de peticiones y de lo que cueste servir el modelo ajustado, que varía según el proveedor, así que revisa el multiplicador de servicio junto con el costo de entrenamiento.
Depende del modelo, del conjunto de datos y de qué tan bien satura el trabajo el hardware, así que esta calculadora lo toma como dato de entrada en lugar de adivinarlo. El estimador de tiempo de entrenamiento lo calcula a partir del número de parámetros, el tamaño del conjunto de datos y el rendimiento de la GPU; trae esa cifra aquí para convertir horas en dinero.
El ajuste fino completo mantiene el estado del optimizador y los gradientes junto con los pesos, lo que ocupa varias veces la memoria de la inferencia. Cuando ese total supera una tarjeta, el trabajo se reparte y pagas cada tarjeta durante todo el trabajo. LoRA evita casi todo esto al congelar los pesos base.