Convierte tokens a palabras, páginas, caracteres o líneas de código para GPT-5, Claude y Gemini. Conteo exacto con tiktoken en OpenAI.
Escribe un número e indica qué cuenta. Las demás unidades se rellenan solas, así que funciona en ambos sentidos.
Los conteos de tokens para Claude, Gemini y otros modelos que no son de OpenAI son estimaciones: esos proveedores no publican sus tokenizadores, así que las cifras provienen de su propia documentación de caracteres por token. Usa la API del proveedor para conteos exactos de facturación.
También podrías encontrar útiles estas calculadoras
Comprueba si tu prompt cabe en la ventana de contexto
Calcula el costo de una llamada de API y compárala entre modelos
Factura mensual de API LLM con caché y descuentos por lotes
Parámetros, VRAM y encaje en GPU según la arquitectura real
Sabes que tu documento tiene 2000 palabras, o 300 páginas, o 5000 líneas de código. Lo que necesitas es el número de tokens, porque una ventana de contexto se mide en tokens y una API factura en tokens. Esta calculadora convierte en ambos sentidos entre tokens y palabras, caracteres, páginas y líneas de código; y cuando pegas texto con un modelo de OpenAI, cuenta con el tokenizador real en lugar de estimar.
Un token es la unidad que lee un modelo de lenguaje. Los tokenizadores se entrenan con texto, así que las palabras frecuentes suelen ser un único token mientras que las raras, los números largos, la puntuación del código y los caracteres no ingleses se dividen en varios. Por eso ninguna cifra única de caracteres por token sirve para todo: la prosa en inglés ronda entre 4,4 y 5,6 caracteres por token, el código fuente real unos 4,1 y el chino entre 1,4 y 2,0. Los proveedores publican un promedio, y esta calculadora usa la cifra de cada proveedor en lugar de una sola regla para todos.
La conversión
Convierte un número de páginas a tokens antes de pegar un informe, un contrato o un manuscrito en un modelo con una ventana de contexto fija.
Se cobra por tokens. Convertir tu volumen mensual previsto de palabras a tokens es el primer paso de cualquier estimación de coste.
Las líneas de código se convierten a tokens con una proporción mucho peor que la prosa. Compruébalo antes de intentar pasarle un repositorio a un modelo.
El mismo prompt son distintos tokens en cada proveedor. Comparar precios por token sin comparar el número de tokens da una respuesta equivocada.
Anthropic indica que su tokenizador actual produce alrededor de un 30 % más de tokens para el mismo texto que los modelos Claude anteriores. Un prompt dimensionado con la cifra antigua de 3,4 caracteres por token resulta cerca de un 36 % más grande en un modelo actual.
El código es más denso de lo que sugiere su número de caracteres. Medido sobre 1067 líneas de TypeScript real de este sitio (52 750 caracteres), el tokenizador de OpenAI promedió 4,1 caracteres por token y unos 12 tokens por línea: la puntuación, la indentación y los identificadores poco habituales cuestan más que una palabra inglesa corriente.
Los mismos doce caracteres chinos son 6 tokens con o200k_base de OpenAI y 11 con el anterior cl100k_base. Un multiplicador no puede capturar eso, porque los dos tokenizadores difieren 1,8 veces con la misma entrada.
Casi todas las herramientas cuentan tokens de un texto que ya tienes. La pregunta más habitual es la contraria: sabes que la ventana es de 200 000 tokens y quieres saber cuántas páginas caben.
Unas 750 000 palabras en los modelos de OpenAI, que publican 0,75 palabras por token. En Claude 4.7 y posteriores son unas 555 000 palabras, porque el tokenizador actual de Anthropic es más denso: la misma ventana de un millón de tokens contiene aproximadamente una cuarta parte menos de palabras.
Tomando una página como 500 palabras, un libro de 300 páginas son unas 150 000 palabras: exactamente 200 000 tokens en un modelo de OpenAI y unos 270 000 en Claude 4.7. Ese es el caso incómodo: llena una ventana de 200 000 tokens al milímetro, sin dejar espacio para la respuesta del modelo, y en Claude actual la desborda directamente.
Tomando una línea como 40 caracteres con su indentación, unos 10 tokens según la cifra de 4 caracteres por token que publica OpenAI. Medido sobre 1067 líneas de TypeScript real, el promedio efectivo fue de unos 12 tokens por línea, así que toma la cifra convertida como un mínimo y no como un máximo: el código lleva más puntuación e identificadores menos habituales que la prosa.
Es un promedio razonable para la prosa en inglés y falla en casi todo lo demás. Medido con el tokenizador de OpenAI, la prosa inglesa sencilla ronda entre 4,4 y 5,6 caracteres por token, el código fuente unos 2,7 y el chino unos 2,0. Úsala como comprobación aproximada, no para dimensionar una ventana de contexto que no puedes superar.
OpenAI publica el vocabulario de su tokenizador, así que el conteo se puede calcular en tu navegador y es exacto. Anthropic y Google no lo publican: sus contadores de tokens son endpoints de API que requieren una clave. Para esos modelos, esta calculadora usa la documentación de caracteres por token de cada proveedor y etiqueta el resultado como estimación en lugar de aparentar una precisión que no puede dar.
No: los cuenta el mismo tokenizador. Lo que cambia es el precio, porque los proveedores cobran más por token de salida que de entrada. Usa esta calculadora para los conteos y una calculadora de costes para las tarifas.