Saltar al contenido
Inicio / PC por uso / IA local
IA privada · ejecutada en tu PC

Tu modelo, tus datos, tu propia máquina.

Equipos diseñados desde la VRAM hacia afuera. Elige por el tamaño de modelo que quieres ejecutar, no por una etiqueta gamer que no explica nada.

Memoria del modelo · referencia Q4
> seleccionar_equipo --por-modelo
Analizando VRAM, RAM y contexto…
7B~4,7 GB
14B~9 GB
32B~20 GB
72B~47 GB
Builds dedicadas a LLM

Desde tu escritorio hasta 4 GPU.

Estas configuraciones son una base técnica para cotizar. Confirmamos disponibilidad, consumo, refrigeración y software antes de fijar el precio final.

VRAM = capacidad

Define qué tamaño de modelo puede permanecer acelerado dentro de la GPU.

GPU = velocidad

Dentro de la misma capacidad, una GPU superior entrega respuestas más rápidas.

RAM = margen

Sostiene modelos, contexto y offload cuando la carga supera la memoria de video.

Workstations personales

Equipos convencionales de una GPU, silenciosos y pensados para escritorio.

7–8B
Entrada seria

Gorilla LLM Local 16

Render referencial de Gorilla LLM Local 16, configuración GeForce RTX 5060 Ti
Render referencial

Para asistentes privados, chat con documentos, estudio y programación local.

Modelo completo en GPU
GPUGeForce RTX 5060 Ti
VRAM16 GB
ProcesadorAMD Ryzen 5 7600
Memoria32 GB DDR5
AlmacenamientoSSD NVMe 1 TB
Fuente850 W 80 PLUS Gold
Modelos de referencia: Llama 3.1 8B · Qwen2.5 7B · Mistral 7B
Equipo publicadoPrecio y disponibilidad en la ficha
Ver equipos 7–8B
Recomendada
14B
Equilibrio recomendado

Gorilla LLM Performance 16

Render referencial de Gorilla LLM Performance 16, configuración GeForce RTX 5070 Ti
Render referencial

Más velocidad para agentes, código y uso frecuente sin subir de clase de VRAM.

Modelo cuantizado en GPU
GPUGeForce RTX 5070 Ti
VRAM16 GB
ProcesadorAMD Ryzen 9 7900X
Memoria64 GB DDR5
AlmacenamientoSSD NVMe 2 TB
Fuente850 W 80 PLUS Gold
Modelos de referencia: Qwen2.5 14B · modelos 12B–14B cuantizados
Equipo publicadoPrecio y disponibilidad en la ficha
Ver equipos 14B
32B
Profesional

Gorilla LLM Pro 32

Render referencial de Gorilla LLM Pro 32, configuración GeForce RTX 5090
Render referencial

Para desarrollo, análisis complejo y modelos más capaces trabajando completamente en local.

32B cuantizado en GPU
GPUGeForce RTX 5090
VRAM32 GB
ProcesadorAMD Ryzen 9 9950X3D
Memoria128 GB DDR5
AlmacenamientoSSD NVMe 4 TB
Fuente1600 W 80 PLUS Platinum
Modelos de referencia: Qwen2.5 32B · modelos de código 32B
Equipo publicadoPrecio y disponibilidad en la ficha
Ver equipos 32B

Sistemas multi‑GPU · 2× a 4× RTX 5090

Plataformas WRX90 de ingeniería a medida. Requieren validar software, líneas PCIe, energía, espacio físico y refrigeración.

70B
2× RTX 5090

Gorilla LLM Lab 64

Render referencial de Gorilla LLM Lab 64, configuración 2× GeForce RTX 5090
Render referencial

La entrada al laboratorio multi‑GPU para modelos grandes, investigación y cargas compartidas.

Sharding multi‑GPU por software
GPU2× GeForce RTX 5090
VRAM64 GB combinados
ProcesadorThreadripper PRO 9965WX
Memoria256 GB DDR5 ECC RDIMM
AlmacenamientoSSD NVMe PCIe 5.0 · 8 TB
Fuente2200 W Platinum · 200–240 V dedicado
PlataformaWRX90 · 2 enlaces PCIe x16
Chasis y refrigeraciónCooler Master HAF 700 EVO · SSI-EEB
Modelos de referencia: Llama 70B · Qwen2.5 72B cuantizados
Cotización técnicaDesde $25.850.000
Ver equipos 70B
120B
3× RTX 5090

Gorilla LLM Lab 96

Render referencial de Gorilla LLM Lab 96, configuración 3× GeForce RTX 5090
Render referencial

Nodo de IA para modelos de hasta tres cifras, mayor contexto y varias cargas en paralelo.

Nodo multi‑GPU especializado
GPU3× GeForce RTX 5090
VRAM96 GB combinados
ProcesadorThreadripper PRO 9965WX
Memoria512 GB DDR5 ECC RDIMM
AlmacenamientoSSD NVMe 8 TB
Fuente2× 2200 W Platinum · 200–240 V dedicado
PlataformaWRX90 · 3 enlaces PCIe x16
Chasis y refrigeraciónOpen-frame/rack con separación y risers PCIe 5.0
Modelos de referencia: Modelos 100–120B cuantizados · cargas concurrentes
Cotización técnicaDesde $37.500.000
Ver equipos 120B
200B+
4× RTX 5090

Gorilla LLM Lab 128

Render referencial de Gorilla LLM Lab 128, configuración 4× GeForce RTX 5090
Render referencial

La configuración GeForce extrema: cuatro GPU, 128 GB combinados y plataforma de laboratorio.

Estación multi‑GPU extrema
GPU4× GeForce RTX 5090
VRAM128 GB combinados
ProcesadorThreadripper PRO 9965WX
Memoria512 GB DDR5 ECC RDIMM
AlmacenamientoSSD NVMe PCIe 5.0 · 8 TB
Fuente2× 2200 W Platinum · 200–240 V dedicado
PlataformaWRX90 · 4 enlaces PCIe x16
Chasis y refrigeraciónOpen-frame/rack para 4 GPU y risers PCIe 5.0
Modelos de referencia: Modelos densos ~200B Q4 · múltiples modelos simultáneos
Cotización técnicaDesde $44.240.000
Ver equipos 200B+
La memoria indicada es una referencia basada en versiones cuantizadas. La RTX 5090 no posee NVLink: la VRAM combinada solo se aprovecha cuando el motor distribuye el modelo entre las GPU. Los sistemas de 3× y 4× GPU requieren circuito eléctrico y solución térmica dedicados.
Comparación rápida

Capacidad antes que marketing.

Una tarjeta más rápida no siempre permite cargar un modelo mayor. Por eso mostramos VRAM y modalidad de ejecución por separado.

BuildVRAM7–8B14B Q432B Q470–72B Q4120B Q4200B Q4
LLM Local 1616 GBGPUGPU*RAM / offload
LLM Performance 1616 GBGPU más rápidaGPU*RAM / offload
LLM Pro 3232 GBGPUGPUGPU*RAM / offload
LLM Lab 6464 GB combinadosGPUGPUGPUMulti‑GPU*Según cuantización
LLM Lab 9696 GB combinadosGPUGPUGPUMulti‑GPUMulti‑GPU*Según cuantización
LLM Lab 128128 GB combinadosGPUGPUGPUMulti‑GPUMulti‑GPUMulti‑GPU*
* Sujeto a cuantización, contexto y memoria adicional del runtime. La validación final se realiza con el modelo concreto del cliente.
Cómo elegimos

Partimos por tu carga real.

01 — MODELO

Definimos qué vas a ejecutar

Modelo, cuantización, contexto, documentos, agentes y cantidad de usuarios simultáneos.

02 — MEMORIA

Dimensionamos VRAM y RAM

Priorizamos que la carga importante permanezca en GPU y dejamos margen para el sistema.

03 — PLATAFORMA

Cerramos energía y refrigeración

Validamos espacio, fuente, líneas PCIe, temperaturas y posibilidades de expansión.

Antes de cotizar

Preguntas frecuentes.

¿Qué significa 7B, 14B o 32B?

Es una referencia a la cantidad de parámetros del modelo. En general, un modelo más grande necesita más memoria y puede resolver tareas más complejas, aunque el resultado también depende del modelo, su cuantización y el contexto utilizado.

¿Por qué se prioriza la VRAM?

La VRAM determina cuánto del modelo puede permanecer dentro de la GPU. Cuando el modelo no cabe, parte del trabajo pasa a la memoria RAM y normalmente responde más lento.

¿Una RTX 5080 de 16 GB ejecuta modelos mayores que una RTX 5060 Ti de 16 GB?

No necesariamente. La RTX 5080 puede responder más rápido, pero ambas pertenecen a la misma clase de capacidad de 16 GB. Por eso separamos capacidad y velocidad al recomendar un equipo.

¿La VRAM de varias RTX 5090 se suma automáticamente?

No. La RTX 5090 no incorpora NVLink y la distribución depende del motor utilizado. Ollama, llama.cpp y otras herramientas pueden repartir modelos entre GPU, pero cada flujo debe validarse antes de definir el equipo.

¿Los equipos vienen listos para usar?

La configuración final puede incluir instalación, drivers y pruebas con Ollama o LM Studio. Antes de cerrar la cotización confirmamos el modelo, el contexto y el flujo de trabajo que necesitas.

No necesitas adivinar la GPU.

Dinos qué modelo quieres correr, cuánto contexto necesitas y cuál es tu presupuesto. Diseñamos la configuración alrededor de eso.

Diseñar mi equipo
¿Confirmar?
Mensaje