Gorilla LLM Local 16
Para asistentes privados, chat con documentos, estudio y programación local.
Cinco formas de elegir tu próximo equipo.
Equipos diseñados desde la VRAM hacia afuera. Elige por el tamaño de modelo que quieres ejecutar, no por una etiqueta gamer que no explica nada.
Estas configuraciones son una base técnica para cotizar. Confirmamos disponibilidad, consumo, refrigeración y software antes de fijar el precio final.
Define qué tamaño de modelo puede permanecer acelerado dentro de la GPU.
Dentro de la misma capacidad, una GPU superior entrega respuestas más rápidas.
Sostiene modelos, contexto y offload cuando la carga supera la memoria de video.
Equipos convencionales de una GPU, silenciosos y pensados para escritorio.
Para asistentes privados, chat con documentos, estudio y programación local.
Más velocidad para agentes, código y uso frecuente sin subir de clase de VRAM.
Para desarrollo, análisis complejo y modelos más capaces trabajando completamente en local.
Plataformas WRX90 de ingeniería a medida. Requieren validar software, líneas PCIe, energía, espacio físico y refrigeración.
La entrada al laboratorio multi‑GPU para modelos grandes, investigación y cargas compartidas.
Nodo de IA para modelos de hasta tres cifras, mayor contexto y varias cargas en paralelo.
La configuración GeForce extrema: cuatro GPU, 128 GB combinados y plataforma de laboratorio.
Una tarjeta más rápida no siempre permite cargar un modelo mayor. Por eso mostramos VRAM y modalidad de ejecución por separado.
| Build | VRAM | 7–8B | 14B Q4 | 32B Q4 | 70–72B Q4 | 120B Q4 | 200B Q4 |
|---|---|---|---|---|---|---|---|
| LLM Local 16 | 16 GB | GPU | GPU* | RAM / offload | — | — | — |
| LLM Performance 16 | 16 GB | GPU más rápida | GPU* | RAM / offload | — | — | — |
| LLM Pro 32 | 32 GB | GPU | GPU | GPU* | RAM / offload | — | — |
| LLM Lab 64 | 64 GB combinados | GPU | GPU | GPU | Multi‑GPU* | Según cuantización | — |
| LLM Lab 96 | 96 GB combinados | GPU | GPU | GPU | Multi‑GPU | Multi‑GPU* | Según cuantización |
| LLM Lab 128 | 128 GB combinados | GPU | GPU | GPU | Multi‑GPU | Multi‑GPU | Multi‑GPU* |
Modelo, cuantización, contexto, documentos, agentes y cantidad de usuarios simultáneos.
Priorizamos que la carga importante permanezca en GPU y dejamos margen para el sistema.
Validamos espacio, fuente, líneas PCIe, temperaturas y posibilidades de expansión.
Es una referencia a la cantidad de parámetros del modelo. En general, un modelo más grande necesita más memoria y puede resolver tareas más complejas, aunque el resultado también depende del modelo, su cuantización y el contexto utilizado.
La VRAM determina cuánto del modelo puede permanecer dentro de la GPU. Cuando el modelo no cabe, parte del trabajo pasa a la memoria RAM y normalmente responde más lento.
No necesariamente. La RTX 5080 puede responder más rápido, pero ambas pertenecen a la misma clase de capacidad de 16 GB. Por eso separamos capacidad y velocidad al recomendar un equipo.
No. La RTX 5090 no incorpora NVLink y la distribución depende del motor utilizado. Ollama, llama.cpp y otras herramientas pueden repartir modelos entre GPU, pero cada flujo debe validarse antes de definir el equipo.
La configuración final puede incluir instalación, drivers y pruebas con Ollama o LM Studio. Antes de cerrar la cotización confirmamos el modelo, el contexto y el flujo de trabajo que necesitas.
Dinos qué modelo quieres correr, cuánto contexto necesitas y cuál es tu presupuesto. Diseñamos la configuración alrededor de eso.