Valoramos Tu Privacidad

Usamos cookies para mejorar tu experiencia de navegación y analizar el tráfico del sitio. Todos los cálculos ocurren localmente en tu navegador - nunca vemos ni almacenamos tus datos. Más información en nuestra Política de Privacidad

/
/
CalculateYogi
  1. Inicio
  2. Tecnología
  3. Calculadora de Memoria GPU
Tecnología

Calculadora de Memoria GPU

Elige tu GPU y descubre qué LLM de pesos abiertos caben en su VRAM con tu contexto, cuáles necesitan cuantización y cuántas tarjetas piden.

Equipos habituales

Tu hardware

La memoria procede de la página de producto de cada fabricante. Elige la tarjeta que tienes, o introduce una cifra de memoria para cualquiera que no aparezca.

Cómo lo vas a ejecutar

tokens
¿Esta calculadora resolvió tu problema hoy?

Colaborador

Revisado por

Última actualización: 23 de agosto de 2026
ApoyarConstruyo estas herramientas gratuitas con amor, noches largas y demasiado café. Si esta calculadora te ayudó, una pequeña donación significaría el mundo para mí y ayudaría a mantener este sitio funcionando. ¡Gracias por tu amabilidad!

Calculadoras Relacionadas

También podrías encontrar útiles estas calculadoras

Calculadora de Tamaño de Modelo

Parámetros, VRAM y encaje en GPU según la arquitectura real

Calculadora de Costo de Inferencia IA

Compara GPU autoalojada frente a API de inferencia

Calculadora de Ventana de Contexto

Comprueba si tu prompt cabe en la ventana de contexto

Calculadora de Costo de Ajuste Fino

Calcula un ajuste fino con tarifas publicadas

¿Qué modelos funcionarán de verdad en tu GPU?

Casi todas las calculadoras de VRAM parten de un modelo y te dicen cuánta memoria pide. Esta parte de la tarjeta que tienes en la máquina. Elígela, indica qué contexto necesitas y obtienes todo el catálogo de pesos abiertos ordenado en lo que funciona, lo que funciona una vez cuantizado y lo que exigiría más tarjetas de las que tienes. La memoria procede de la página de producto de cada fabricante y cada arquitectura se lee del archivo de configuración del propio modelo, así que el número de parámetros se deriva en lugar de consultarse.

Qué determina si un modelo cabe

Tres cosas se reparten tu VRAM. Los pesos quedan fijos en cuanto eliges una precisión: parámetros por bytes por peso. La caché KV crece con la longitud del contexto, y es el término que la gente subestima, porque escala con las cabezas de clave y valor, no con las de consulta. La atención por grupos la reduce muchísimo, así que un modelo moderno con 32K tokens suele necesitar menos caché que uno antiguo con 8K. Queda el espacio de trabajo que el runtime necesita para los tensores en vivo. Sobre los tres, reserva alrededor de una quinta parte más para fragmentación y kernels, que es lo que impide cargar un modelo que sobre el papel cabía justo.

Lo que tiene que caber en la VRAM

Cómo usar esta calculadora

1

2

3

4

5

Casos de uso habituales

Decidir entre dos tarjetas

Quien compara una tarjeta de 16 GB con una de 24 GB pasa las dos por aquí y ve exactamente qué modelos cruzan la frontera, en vez de adivinar con una regla de parámetros por gigabyte.

Comprobar el equipo antes de descargar

Un desarrollador a punto de bajar un checkpoint de 40 GB por una conexión lenta comprueba antes si va a cargar siquiera, y con qué precisión.

Dimensionar una instancia alquilada

Un ingeniero que elige entre una L40S y una A100 80GB compara qué aguanta cada una con la longitud de contexto que el producto necesita de verdad.

Encontrar el techo de contexto

Un equipo que choca con errores de memoria en contextos largos lee el contexto máximo que su tarjeta aguanta para ese modelo y decide si cuantizar o acortar la ventana.

Por qué partir de la tarjeta

Comprar y alquilar son decisiones que empiezan por la tarjeta

Nadie elige un modelo y luego se va de compras. Tienes una tarjeta, o estás eligiendo entre dos, y la pregunta real es qué desbloquea cada una. En la práctica, una tarjeta de 12 GB y una de 24 GB se separan por un escalón de cuantización, no por el doble de capacidad.

La escalera de cuantización es la respuesta más veces de lo que parece

Un modelo que se desborda en BF16 suele caber en INT8, y casi siempre en INT4. En lugar de obligarte a probar cada ajuste, la tabla nombra la precisión más amplia que cabe en el hardware que has descrito.

El contexto es el coste que se olvida

Los pesos son una cifra fija que se puede consultar. La caché no lo es, y con contextos largos puede superar a los pesos. La columna de contexto más largo te dice dónde se queda sin sitio tu tarjeta para cada modelo.

La mezcla de expertos rompe las reglas generales

Un modelo de mezcla de expertos de 235B mantiene los 235 mil millones de pesos en memoria pero solo lee unos 22 mil millones por token. Eso lo hace enorme de cargar y rápido de ejecutar, y ninguna regla por mil millones captura las dos cosas.

Preguntas frecuentes

En INT4, una tarjeta de 24 GB aguanta con holgura un modelo denso de 32B con un contexto moderado, y la mayoría de modelos de 7B a 14B con sitio de sobra para una ventana larga. En BF16 esa misma tarjeta se queda alrededor de 8B a 12B. Elige RTX 4090 arriba y la tabla te da la lista exacta en lugar de una regla general, porque la caché con tu longitud de contexto mueve la frontera.

El techo de velocidad necesita una cifra de ancho de banda de memoria, y NVIDIA la publica para todas las piezas de centro de datos y para toda la serie GeForce 50, pero para nada de las series 30 o 40. La página de producto de la RTX 4090 indica el ancho de bus y el tipo de memoria y ahí se queda. Hay webs de terceros que dan una cifra; no es un dato del fabricante, así que esta calculadora prescinde de la columna en vez de presentar la aritmética de otro como si fuera una especificación.

La memoria de las tarjetas se vende en gigabytes decimales: una tarjeta de 24 GB guarda 24 mil millones de bytes. Todas las cifras de esta página usan ese mismo gigabyte decimal, así que el requisito y la capacidad se pueden restar directamente. La mayoría de las herramientas de modelos informan en gibibytes, que son en torno a un siete por ciento mayores, así que un modelo que aquí aparece como 20,4 GB sale como 19,0 GiB en llama.cpp o en una página de Hugging Face. Los mismos bytes, otra unidad, y mezclar las dos es justo lo que hace que un modelo que parecía caber se niegue a cargar.

Todos los expertos tienen que estar residentes en la VRAM, así que la cifra de memoria usa el número total de parámetros. Durante la generación solo se leen los expertos enrutados a cada token, así que el techo de velocidad usa el número activo. Por eso un modelo de 235B con 22B activos es a la vez difícil de encajar y rápido en cuanto encaja.

Solo de forma aproximada. El número de tarjetas multiplica la memoria disponible, lo cual es correcto para un modelo repartido limpiamente entre tarjetas, y la columna de veredicto indica cuántas tarjetas necesita un modelo. No modela la sobrecarga de interconexión, ni la duplicación de la caché por tarjeta, ni la memoria extra que retiene un runtime con paralelismo de tensores, y todo eso empeora un poco los montajes reales de varias tarjetas frente a la aritmética.

Cada arquitectura está transcrita del archivo de configuración del propio modelo, o del artículo técnico del propio modelo cuando el repositorio exige aceptar una licencia, y el número de parámetros se deriva de esa arquitectura en lugar de tomarse del nombre. Una prueba comprueba cada derivación contra el tamaño que el modelo lleva en el nombre. La memoria y el ancho de banda de las tarjetas vienen de la página de producto del fabricante.

CalculateYogi

La aplicación web de calculadoras más completa. Calculadoras gratuitas, rápidas y precisas para todos.

Categorías de Calculadoras

  • Matemáticas
  • Finanzas
  • Salud
  • Conversión
  • Fecha y Hora
  • Estadística
  • Ciencia
  • Ingeniería
  • Negocios
  • Cotidiano
  • Construcción
  • Educación
  • Tecnología
  • Comida y Cocina
  • Deportes
  • Clima y Medio Ambiente
  • Agricultura y Ecología
  • Redes Sociales
  • Otros

Empresa

  • Acerca de
  • Contacto
  • Colaboradores

Legal

  • Política de Privacidad
  • Términos de Servicio
  • Política Editorial

© 2026 CalculateYogi. Todos los derechos reservados.

Mapa del Sitio

Hecho con por el equipo de AppsYogi