Valoramos Tu Privacidad

Usamos cookies para mejorar tu experiencia de navegación y analizar el tráfico del sitio. Todos los cálculos ocurren localmente en tu navegador - nunca vemos ni almacenamos tus datos. Más información en nuestra Política de Privacidad

/
/
CalculateYogi
  1. Inicio
  2. Tecnología
  3. Calculadora de Tamaño de Modelo
Tecnología

Calculadora de Tamaño de Modelo

Cuenta los parámetros de un transformer y la memoria de GPU desde su arquitectura real. Tiene en cuenta GQA, SwiGLU y mezcla de expertos.

Escenarios habituales
¿Con qué partes?

Modelo

Los valores de arquitectura se leen del archivo de configuración de cada modelo, así que el número de parámetros se deriva en lugar de consultarse.

Ejecución

Caso de uso
tokens
¿Esta calculadora resolvió tu problema hoy?

Colaborador

Revisado por

Última actualización: 23 de agosto de 2026
ApoyarConstruyo estas herramientas gratuitas con amor, noches largas y demasiado café. Si esta calculadora te ayudó, una pequeña donación significaría el mundo para mí y ayudaría a mantener este sitio funcionando. ¡Gracias por tu amabilidad!

Calculadoras Relacionadas

También podrías encontrar útiles estas calculadoras

Calculadora de Memoria GPU

Elige tu GPU y descubre qué LLM caben de verdad

Calculadora de Costo de Inferencia IA

Compara GPU autoalojada frente a API de inferencia

Calculadora de Ventana de Contexto

Comprueba si tu prompt cabe en la ventana de contexto

Calculadora de Almacenamiento Vectorial

Calcula requisitos de almacenamiento para bases de datos vectoriales

¿Qué tamaño tiene este modelo y podrá ejecutarse?

Detrás de casi toda búsqueda de una calculadora de tamaño de modelo hay dos preguntas: cuántos parámetros tiene realmente y si cabrá en el hardware disponible. Esta herramienta responde a ambas partiendo de la arquitectura real del modelo y no del número que lleva en el nombre. Si eliges un modelo, el número de capas, el tamaño oculto, el reparto de cabezas de atención y la configuración de expertos salen de su propio archivo de configuración. También puedes introducir una arquitectura y ver cómo se deduce el número de parámetros. En ambos casos obtienes la memoria de los pesos, la caché KV para tu longitud de contexto y un veredicto por tarjeta sobre si cabe.

¿Qué determina el número de parámetros de un modelo?

Casi todo está en el bloque transformer que se repite. Cada bloque contiene las proyecciones de atención y una red feed-forward, y se repite una vez por capa. Encima está el embedding de tokens y, si no está atado a él, la cabeza de salida. Lo que ha cambiado desde los primeros GPT es la forma de esas piezas. La atención de consulta agrupada hace que las proyecciones de clave y valor sean mucho más estrechas que la de consulta, así que la atención pesa menos que con la vieja estimación de cuatro matrices cuadradas. Los bloques feed-forward con compuerta, como SwiGLU, usan tres matrices donde el diseño original usaba dos, así que la red feed-forward pesa más. Los embeddings de posición rotatorios sustituyeron las tablas posicionales aprendidas y eliminaron ese término por completo. Una fórmula escrita para arquitecturas de 2019 se equivoca en las tres cosas, y los errores no se cancelan.

Parámetros

Cómo usar esta calculadora

1

2

3

4

5

6

7

Cuándo se usa

Decidir qué se ejecuta en la tarjeta que tienes

El caso más común: una cantidad fija de VRAM y la duda de qué modelos y cuantizaciones caben dentro.

Dimensionar un ajuste fino

El estado del optimizador a 12 bytes por parámetro y los gradientes encima hacen que entrenar necesite varias veces la memoria de inferir, antes incluso de las activaciones.

Comparar densa contra mezcla de expertos

Un modelo MoE con los mismos parámetros activos que uno denso necesita mucha más memoria, y aquí la diferencia se ve explícita.

Planificar contexto largo

Ver crecer la caché KV con la longitud de secuencia explica por qué un modelo que va bien con prompts cortos se cae con los largos.

Comprobar un número de parámetros a mano

Introduce una arquitectura y verás cada término por separado, útil cuando un recuento publicado y tus propias cuentas no coinciden.

Por qué importa más la arquitectura que el nombre

El nombre está redondeado; la arquitectura es exacta

Un modelo llamado 8B puede tener 7.600 o 8.200 millones de parámetros. Cuando decides si algo cabe en 24 GB con una caché KV encima, esa diferencia es la que separa ejecutarlo de no poder hacerlo.

La atención de consulta agrupada cambió las cuentas

Un modelo con 32 cabezas de consulta y 8 de clave/valor tiene mucho menos peso en atención que uno con 32 de cada. Tratarlos igual sobreestima la atención y sobreestima la caché KV en la proporción entre ambas.

Los bloques con compuerta pesan la mitad más

SwiGLU añade una matriz de compuerta junto a las de subida y bajada. Como la red feed-forward suele ser la parte más grande de una capa, olvidar esa tercera matriz infravalora el modelo entero.

La mezcla de expertos rompe la respuesta única

Un modelo MoE debe mantener todos los expertos en memoria pero solo enruta unos pocos por token. Los parámetros totales deciden si carga; los activos deciden a qué velocidad va. Un solo número no puede responder a las dos cosas.

La caché KV suele decidir el resultado

Con contexto corto dominan los pesos. Con contexto largo la caché puede superarlos, y por eso el mismo modelo cabe con 4k y falla con 128k en el mismo hardware.

Preguntas frecuentes

Suma la memoria de los pesos, la caché KV para tu longitud de contexto y algo de espacio de trabajo, y compáralo con tu tarjeta. Esta calculadora hace las tres cosas y marca cada acelerador como apto o no. El paso que se suele olvidar es la caché KV: con contexto largo puede pesar más que los pesos, así que un modelo que sobre el papel cabe sin problema termina sin cargar.

Normalmente no ocho mil millones exactos. Los nombres están redondeados y la cifra exacta depende del tamaño del vocabulario, de si la cabeza de salida está atada al embedding y del reparto de cabezas. Derivarla de la arquitectura da el número real, que en los modelos de esta lista queda a pocos puntos porcentuales del nombre.

Un modelo de mezcla de expertos contiene muchos bloques feed-forward expertos pero enruta cada token solo por unos pocos. Todos los expertos deben estar residentes en memoria, así que los parámetros totales deciden si el modelo carga, mientras que los activos deciden el rendimiento. Un modelo de 30B con 3B activos necesita memoria para 30B y va aproximadamente a la velocidad de uno de 3B.

En el diseño original las proyecciones de consulta, clave, valor y salida tienen el mismo ancho, lo que da cuatro matrices cuadradas por capa. La atención de consulta agrupada estrecha las de clave y valor para que varias cabezas de consulta compartan una de clave/valor. Un modelo con 32 cabezas de consulta y 8 de clave/valor tiene por tanto bastante menos peso en atención, y una caché KV cuatro veces menor, de lo que sugiere la vieja estimación.

No, y tratarla como si lo hiciera es un error frecuente. Los embeddings de posición rotatorios no añaden ningún parámetro, y los modelos que sí usan tablas posicionales aprendidas las dimensionan por la longitud con la que se entrenaron, no por la que uses al ejecutarlos. El contexto afecta a la caché KV, no a los pesos.

Aproximadamente la cuarta parte de lo que necesita el mismo modelo a 16 bits, más la caché KV, que suele mantenerse a mayor precisión. Eso es lo que pone un modelo de 32B al alcance de una sola tarjeta de consumo. Los pesos se reducen; la caché no se reduce con ellos.

Porque 4 bits es un mínimo, no un formato de archivo. Los esquemas de cuantización reales guardan escalas y puntos cero por bloque junto a los pesos, y a menudo dejan algunos tensores con más precisión, así que el archivo queda por encima de cuatro bits por peso. Esta calculadora informa del mínimo teórico y lo advierte, en lugar de inventar un multiplicador que ningún proveedor publica.

Varias veces más. AdamW mantiene una copia de 32 bits de los pesos más el momento y la varianza, lo que son doce bytes por parámetro, y los gradientes añaden más. Las activaciones escalan además con la longitud de secuencia y el tamaño de lote. En un modelo de 8B, el estado del optimizador por sí solo pesa más que los pesos a 16 bits.

Del archivo de configuración de cada modelo, con la URL y la fecha de lectura registradas junto al dato. Nada se toma de un resumen ni de una tabla comparativa. Después la derivación se contrasta con el tamaño que figura en el nombre del modelo, que es precisamente cómo se descubrió que la versión anterior de esta página se quedaba corta.

Las diferencias pequeñas vienen de los términos que esta calculadora aproxima, sobre todo los pesos de normalización y los sesgos, que están muy por debajo del uno por ciento en cualquier modelo moderno. Las diferencias grandes suelen indicar que hay una característica arquitectónica sin modelar, como la atención latente comprimida de algunos modelos de frontera. Esas se señalan en lugar de estimarse.

CalculateYogi

La aplicación web de calculadoras más completa. Calculadoras gratuitas, rápidas y precisas para todos.

Categorías de Calculadoras

  • Matemáticas
  • Finanzas
  • Salud
  • Conversión
  • Fecha y Hora
  • Estadística
  • Ciencia
  • Ingeniería
  • Negocios
  • Cotidiano
  • Construcción
  • Educación
  • Tecnología
  • Comida y Cocina
  • Deportes
  • Clima y Medio Ambiente
  • Agricultura y Ecología
  • Redes Sociales
  • Otros

Empresa

  • Acerca de
  • Contacto
  • Colaboradores

Legal

  • Política de Privacidad
  • Términos de Servicio
  • Política Editorial

© 2026 CalculateYogi. Todos los derechos reservados.

Mapa del Sitio

Hecho con por el equipo de AppsYogi