Cuánta VRAM necesitas para ejecutar LLMs localmente

La pregunta principal al ejecutar un LLM local es sencilla: ¿cabe en tu GPU? La respuesta depende del tamaño del modelo, la cuantización y la longitud del contexto. Esta guía te ofrece un punto de partida práctico para elegir la cantidad adecuada de VRAM.

Cómo afecta la cuantización a la VRAM

La cuantización reduce la precisión utilizada para almacenar los pesos del modelo. La cuantización de menor número de bits hace que el modelo sea más pequeño y use menos VRAM, con una pérdida de calidad.

Cuantización Bits por peso Uso típico
Q8_0 8 Muy alta calidad
Q6_K ~6.6 Muy buena calidad
Q5_K_M ~5.5 Buena calidad y tamaño
Q4_K_M ~4.5 Buen equilibrio entre tamaño y calidad
Q3_K_M ~3.5 Menos VRAM, mayor pérdida de calidad

Q4_K_M es una elección común cuando la VRAM es limitada. Si tienes más VRAM disponible, Q5 o Q6 te permite ejecutar el mismo modelo con menos cuantización.

VRAM aproximada según el tamaño del modelo

Estas son estimaciones aproximadas para los pesos del modelo. La cantidad real de VRAM necesaria es mayor porque el tiempo de ejecución, la caché KV y el contexto también utilizan memoria.

Tamaño del modelo Q8_0 Q6_K Q4_K_M Q3_K_M
4B ~5 GB ~4 GB ~3 GB ~2.5 GB
8B ~9 GB ~7 GB ~5.5 GB ~4.5 GB
12B ~13 GB ~10 GB ~8 GB ~6.5 GB
14B ~16 GB ~12 GB ~9 GB ~7.5 GB
27B ~30 GB ~22 GB ~17 GB ~13 GB
32B ~36 GB ~27 GB ~20 GB ~16 GB
70B ~80 GB ~60 GB ~42 GB ~34 GB

Estas son estimaciones, no límites estrictos. Diferentes arquitecturas de modelos y formatos de cuantización pueden cambiar el tamaño real.

Qué puede ejecutar con diferentes cantidades de VRAM

VRAM Rango práctico Ejemplos actuales
8 GB Modelos pequeños de aproximadamente 4B a 9B Gemma 4 E4B, Qwen3.5 9B
12 GB Modelos pequeños y medianos de aproximadamente 9B a 14B Gemma 4 12B, Qwen3.5 9B
16 GB 12B a 27B con menor cuantización Gemma 4 26B-A4B, Qwen3.6 27B en Q4
24 GB 27B a 35B en Q4 a Q6 Qwen3.8 27B, Gemma 4 31B
32 GB 27B a 35B con mayor cuantización Qwen3.8 27B, Gemma 4 31B
48 GB Modelos densos grandes con menor cuantización Modelos de clase 70B en Q3 a Q4
80 GB Modelos densos grandes con mayor cuantización Modelos de clase 70B en Q4 a Q6

Estos rangos son para modelos cuyos pesos caben en la GPU. Los grandes modelos MoE son diferentes: solo algunos de sus parámetros están activos para cada token, pero el modelo aún debe almacenar su conjunto completo de pesos. Por lo tanto, un modelo con 100B o más parámetros totales no cabe en un presupuesto de VRAM de tamaño 100B simplemente porque tiene menos parámetros activos.

Modelos MoE

Los modelos Mixture-of-Experts (Mezcla de Expertos) contienen múltiples grupos de parámetros llamados expertos. Solo se usan algunos expertos para cada token, lo que puede hacer que la inferencia sea más eficiente que un modelo denso con la misma cantidad total de parámetros.

Sin embargo, los expertos inactivos siguen siendo parte del modelo. Por lo tanto, los grandes modelos MoE pueden requerir mucha más memoria de lo que sugiere su cantidad de parámetros activos. Los modelos muy grandes pueden necesitar múltiples GPUs o la descarga de memoria a la RAM del sistema.

La longitud del contexto también usa VRAM

Los pesos del modelo son solo parte del requisito de memoria. La caché KV crece a medida que el contexto se hace más largo, por lo que ejecutar el mismo modelo con un contexto de 64K puede requerir considerablemente más VRAM que ejecutarlo con 4K.

  • Un contexto más largo requiere más VRAM.
  • La precisión de la caché KV afecta el uso de memoria.
  • El tamaño del lote y los usuarios concurrentes también aumentan el uso de memoria.
  • Deja algo de VRAM disponible para el tiempo de ejecución en lugar de llenar completamente la GPU con pesos del modelo.

Consejos prácticos

  • Verifica el tamaño real del modelo cuantizado que deseas ejecutar.
  • No uses el tamaño del archivo del modelo como el requisito exacto de VRAM. Deja espacio para la caché KV y el tiempo de ejecución.
  • Si un modelo no cabe por completo en la VRAM, una parte de él puede ser descargada a la RAM del sistema, pero la inferencia suele ser más lenta.
  • Para cargas de trabajo de contexto largo o agentes autónomos, reserva más VRAM de la que requieren solo los pesos del modelo.
  • Múltiples GPUs pueden dividir un modelo cuando una sola GPU no tiene suficiente VRAM.

Ejecútalo en DaDesktop

No necesitas comprar una GPU para ejecutar un LLM local. DaDesktop te ofrece un escritorio en la nube con la VRAM que necesitas, por lo que puedes ejecutar el modelo directamente sin poseer el hardware.

Elige el nivel de VRAM que se adapte a tu modelo, cárgalo y comienza a usarlo. Sin configuración, sin compra de hardware, sin problemas de controladores. Consulta las GPUs disponibles para las opciones.