Cuánta VRAM necesitas para ejecutar LLMs localmente
La pregunta principal al ejecutar un LLM local es sencilla: ¿cabe en tu GPU? La respuesta depende del tamaño del modelo, la cuantización y la longitud del contexto. Esta guía te ofrece un punto de partida práctico para elegir la cantidad adecuada de VRAM.
Cómo afecta la cuantización a la VRAM
La cuantización reduce la precisión utilizada para almacenar los pesos del modelo. La cuantización de menor número de bits hace que el modelo sea más pequeño y use menos VRAM, con una pérdida de calidad.
| Cuantización | Bits por peso | Uso típico |
|---|---|---|
| Q8_0 | 8 | Muy alta calidad |
| Q6_K | ~6.6 | Muy buena calidad |
| Q5_K_M | ~5.5 | Buena calidad y tamaño |
| Q4_K_M | ~4.5 | Buen equilibrio entre tamaño y calidad |
| Q3_K_M | ~3.5 | Menos VRAM, mayor pérdida de calidad |
Q4_K_M es una elección común cuando la VRAM es limitada. Si tienes más VRAM disponible, Q5 o Q6 te permite ejecutar el mismo modelo con menos cuantización.
VRAM aproximada según el tamaño del modelo
Estas son estimaciones aproximadas para los pesos del modelo. La cantidad real de VRAM necesaria es mayor porque el tiempo de ejecución, la caché KV y el contexto también utilizan memoria.
| Tamaño del modelo | Q8_0 | Q6_K | Q4_K_M | Q3_K_M |
|---|---|---|---|---|
| 4B | ~5 GB | ~4 GB | ~3 GB | ~2.5 GB |
| 8B | ~9 GB | ~7 GB | ~5.5 GB | ~4.5 GB |
| 12B | ~13 GB | ~10 GB | ~8 GB | ~6.5 GB |
| 14B | ~16 GB | ~12 GB | ~9 GB | ~7.5 GB |
| 27B | ~30 GB | ~22 GB | ~17 GB | ~13 GB |
| 32B | ~36 GB | ~27 GB | ~20 GB | ~16 GB |
| 70B | ~80 GB | ~60 GB | ~42 GB | ~34 GB |
Estas son estimaciones, no límites estrictos. Diferentes arquitecturas de modelos y formatos de cuantización pueden cambiar el tamaño real.
Qué puede ejecutar con diferentes cantidades de VRAM
| VRAM | Rango práctico | Ejemplos actuales |
|---|---|---|
| 8 GB | Modelos pequeños de aproximadamente 4B a 9B | Gemma 4 E4B, Qwen3.5 9B |
| 12 GB | Modelos pequeños y medianos de aproximadamente 9B a 14B | Gemma 4 12B, Qwen3.5 9B |
| 16 GB | 12B a 27B con menor cuantización | Gemma 4 26B-A4B, Qwen3.6 27B en Q4 |
| 24 GB | 27B a 35B en Q4 a Q6 | Qwen3.8 27B, Gemma 4 31B |
| 32 GB | 27B a 35B con mayor cuantización | Qwen3.8 27B, Gemma 4 31B |
| 48 GB | Modelos densos grandes con menor cuantización | Modelos de clase 70B en Q3 a Q4 |
| 80 GB | Modelos densos grandes con mayor cuantización | Modelos de clase 70B en Q4 a Q6 |
Estos rangos son para modelos cuyos pesos caben en la GPU. Los grandes modelos MoE son diferentes: solo algunos de sus parámetros están activos para cada token, pero el modelo aún debe almacenar su conjunto completo de pesos. Por lo tanto, un modelo con 100B o más parámetros totales no cabe en un presupuesto de VRAM de tamaño 100B simplemente porque tiene menos parámetros activos.
Modelos MoE
Los modelos Mixture-of-Experts (Mezcla de Expertos) contienen múltiples grupos de parámetros llamados expertos. Solo se usan algunos expertos para cada token, lo que puede hacer que la inferencia sea más eficiente que un modelo denso con la misma cantidad total de parámetros.
Sin embargo, los expertos inactivos siguen siendo parte del modelo. Por lo tanto, los grandes modelos MoE pueden requerir mucha más memoria de lo que sugiere su cantidad de parámetros activos. Los modelos muy grandes pueden necesitar múltiples GPUs o la descarga de memoria a la RAM del sistema.
La longitud del contexto también usa VRAM
Los pesos del modelo son solo parte del requisito de memoria. La caché KV crece a medida que el contexto se hace más largo, por lo que ejecutar el mismo modelo con un contexto de 64K puede requerir considerablemente más VRAM que ejecutarlo con 4K.
- Un contexto más largo requiere más VRAM.
- La precisión de la caché KV afecta el uso de memoria.
- El tamaño del lote y los usuarios concurrentes también aumentan el uso de memoria.
- Deja algo de VRAM disponible para el tiempo de ejecución en lugar de llenar completamente la GPU con pesos del modelo.
Consejos prácticos
- Verifica el tamaño real del modelo cuantizado que deseas ejecutar.
- No uses el tamaño del archivo del modelo como el requisito exacto de VRAM. Deja espacio para la caché KV y el tiempo de ejecución.
- Si un modelo no cabe por completo en la VRAM, una parte de él puede ser descargada a la RAM del sistema, pero la inferencia suele ser más lenta.
- Para cargas de trabajo de contexto largo o agentes autónomos, reserva más VRAM de la que requieren solo los pesos del modelo.
- Múltiples GPUs pueden dividir un modelo cuando una sola GPU no tiene suficiente VRAM.
Ejecútalo en DaDesktop
No necesitas comprar una GPU para ejecutar un LLM local. DaDesktop te ofrece un escritorio en la nube con la VRAM que necesitas, por lo que puedes ejecutar el modelo directamente sin poseer el hardware.
Elige el nivel de VRAM que se adapte a tu modelo, cárgalo y comienza a usarlo. Sin configuración, sin compra de hardware, sin problemas de controladores. Consulta las GPUs disponibles para las opciones.