Saltar a contenido

Evaluación de hardware para inferencia LLM local — junio 2026

Nota para el equipo

Sale de un informe interno sobre cómo escalar nuestra arquitectura LangGraph multi-agente, que corremos en local sobre Gemma 4 con Ollama. La conclusión no es "hay un hardware ganador", sino que depende de qué prime: la velocidad del pipeline encadenado, o la capacidad y la resiliencia con varios nodos. Sirve también para valorar si podemos ofrecer inferencia LLM de bajo coste a clientes. Precios sin IVA, España, junio de 2026.

Versión de junio de 2026

Refleja precios y benchmarks de esa fecha. Cuando se publique una versión nueva, esta pasará a versiones anteriores (por ahora, ninguna).

Los precios se mueven más rápido que este informe. Para el dato actual, mira el Panorama de hardware y modelos, que se refresca cada mes — a julio de 2026 ya recoge que la RTX PRO 5000 72 GB ha bajado y el DGX Spark ha subido respecto a las cifras que se usan aquí.

TL;DR

Evaluamos 7 escenarios de hardware (presupuesto de referencia ~7.000–9.000 €) para escalar de nuestra única GPU actual a varios modelos especializados corriendo en paralelo. No hay una opción que gane en todo: el caso de uso decide.

Decisión según prioridad

  • Si prima la velocidad del pipelineRTX Pro 5000 Blackwell 72 GB (~7.165 €). ~100 tok/s en 27B densos; pipeline de 6 nodos en ~9 s, el doble de rápido que el hardware actual. Va en la workstation existente.

  • Si prima capacidad + resiliencia al mejor precio3× Mac Mini M4 Pro 48 GB (~6.210 €). 6 modelos 27B simultáneos, menor consumo y la única opción con tolerancia real a caída de nodo.

  • Si priman modelos grandes (70B+) con CUDADGX Spark (4.350 €). 128 GB y CUDA Blackwell al menor precio, pero decode lento (~3,7–11 tok/s) en 27B densos.

El factor que inclina la balanza: la resiliencia

Las opciones de una sola máquina —incluidas la RTX Pro 5000 y el DGX Spark— son un punto único de fallo: cualquier caída tumba el servicio entero. Solo los escenarios con varias máquinas independientes (Mac Mini / Mac Studio) degradan con elegancia. Los 2× DGX Spark vinculados no cuentan como redundancia: la memoria unificada los convierte en un único sistema con el doble de piezas que pueden fallar.

Situación actual

Infraestructura y stack

El desarrollo de agentes IA se realiza sobre una workstation con GPU RTX 5000 Ada (32 GB GDDR6, 576 GB/s de ancho de banda, arquitectura Ada Lovelace). La máquina ejecuta de forma local modelos Gemma 4 gestionados a través de Ollama, con LiteLLM Proxy como capa de enrutamiento y Langfuse para observabilidad y modelado de costes, ambos auto-alojados. El desarrollo en portátil se realiza sobre un Mac Air M5 (16 GB), que complementa el flujo de trabajo sin ejecutar modelos grandes.

Arquitectura de agentes

Los agentes están construidos con LangGraph en una arquitectura ReAct con nodos especializados: plan (propone herramientas, hasta 4 iteraciones) y synthesize (redacta la respuesta final). La estrategia de modelos es mixta por nodo: modelos más ligeros para routing y selección de herramientas, modelos más capaces para razonamiento y síntesis.

Limitaciones del hardware actual

  • La RTX 5000 Ada tiene 32 GB de VRAM, lo que permite cargar simultáneamente hasta 4 modelos Gemma 4 12B o 1 modelo de 27B con poco margen.
  • El ancho de banda de 576 GB/s limita el decode a ~48 tok/s en modelos 27B, lo que en pipelines encadenados de 6 nodos supone ~18 segundos de latencia acumulada.
  • No hay redundancia: si la workstation cae, el servicio se interrumpe completamente.
  • El fine-tuning con CUDA funciona para modelos hasta 7B con LoRA; modelos más grandes no caben en 32 GB.

Objetivo

El objetivo es escalar la arquitectura para soportar múltiples modelos especializados funcionando simultáneamente: nodos de descripción, selección de herramientas, razonamiento, generación de código, síntesis, routing y guardrails. La arquitectura responde a un patrón de especialización por nodo, donde cada paso del pipeline puede usar un modelo distinto, optimizado para esa tarea concreta.

El caso habitual son modelos de 12B a 27B corriendo en paralelo. Los modelos por encima de 70B son un requisito ocasional, no la norma. El presupuesto de referencia para la evaluación se sitúa en torno a 7.000–9.000 € sin IVA.

Escenarios evaluados

Se han evaluado 7 escenarios de hardware. El precio incluye todas las unidades necesarias para cada configuración.

Escenario Unidades Memoria total BW/nodo CUDA Precio sin IVA
Actual · RTX 5000 Ada 1 workstation 32 GB VRAM 576 GB/s
2× Mac Mini M4 Pro 48GB 2 independientes 48 GB/nodo 273 GB/s ~4.140 €
3× Mac Mini M4 Pro 48GB 3 independientes 48 GB/nodo 273 GB/s ~6.210 €
RTX Pro 5000 BW 72GB GPU en workstation 72 GB VRAM 1.344 GB/s ~7.165 €
2× Mac Studio M3 Ultra 2 independientes 96 GB/nodo 819 GB/s ~8.346 €
1× DGX Spark 1 máquina 128 GB 273 GB/s 4.350 €
2× DGX Spark (vinculados) 2 vinculadas 256 GB unificados 273 GB/s ~8.750 €

Memoria unificada: solo en un caso

Solo los 2× DGX Spark tienen memoria genuinamente unificada entre nodos vía NVLink-C2C. El cable QSFP (aprox. 50 €) no está incluido en el precio de cada unidad y debe adquirirse por separado. El resto de escenarios con múltiples máquinas son nodos físicamente independientes: LangGraph enruta peticiones entre ellos, pero no comparten memoria para un mismo modelo.

Rendimiento

No todas las cifras de esta sección tienen el mismo respaldo, y conviene dejarlo claro de entrada:

  • Mediciones publicadas: el DGX Spark (Gemma 4 31B dense, varias fuentes) y el Mac Studio M3 Ultra (Gemma 3 27B, generación equivalente). Ver Fuentes.
  • Estimaciones por ancho de banda: la RTX 5000 Ada, la RTX Pro 5000 BW 72GB y los Mac Mini M4 Pro. No hay benchmarks públicos de Gemma 4 en estas máquinas; las cifras se calculan como ancho de banda disponible ÷ tamaño del modelo activo en memoria, la misma metodología que las fuentes aplican al DGX Spark.

La cuantización base es Q4_K_M.

Estimaciones vs. mediciones

Donde no hay benchmark público, la cifra se marca como estimación por BW y no debe leerse como dato medido. El orden relativo entre escenarios es fiable; los valores absolutos de las máquinas estimadas son orientativos.

Prefill y decode

Prefill es el procesamiento del prompt de entrada (limitado por cómputo); decode es la generación token a token de la respuesta (limitada por el ancho de banda de memoria). En pipelines de agentes encadenados, donde cada nodo genera texto, manda el decode: por eso el ancho de banda pesa más que la potencia bruta de CUDA.

Gemma 4 12B Q4 — nodos ligeros

Routing, guardrails, descripción de entidad, selección de herramientas. Ocupa ~7 GB en memoria.

Escenario Tok/s por modelo Modelos 12B cargados Notas
Actual (32 GB VRAM) ~95 4 4 modelos en VRAM; sin margen para 27B simultáneo
2× Mac Mini M4 Pro 48GB ~80 12 total 6 por nodo × 2 nodos, independientes
3× Mac Mini M4 Pro 48GB ~80 18 total 6 por nodo × 3 nodos, independientes
RTX Pro 5000 BW 72GB ~220 10 BW 1.344 GB/s; mayor velocidad de decode de la lista
2× Mac Studio M3 Ultra ~130 24 total 12 por nodo × 2 nodos; BW 819 GB/s por nodo
1× DGX Spark ~70 12 BW 273 GB/s; CUDA Blackwell compensa en prefill
2× DGX Spark (vinculados) ~70 24 total Memoria unificada real entre nodos

Sin benchmark público de Gemma 4 12B

No hemos encontrado mediciones publicadas de Gemma 4 12B en ninguno de estos dispositivos. Todas las cifras de esta tabla son estimaciones por ancho de banda: el orden relativo entre escenarios es fiable, los valores absolutos son orientativos.

Gemma 4 27B Q4 — nodos de razonamiento

Razonamiento complejo, síntesis, generación de código. Ocupa ~17 GB en memoria.

Escenario Tok/s por modelo Modelos 27B cargados Notas
Actual (32 GB VRAM) ~48 1 (justo) Casi sin margen; estimación por BW
2× Mac Mini M4 Pro 48GB ~25 4 total 2 por nodo × 2; estimación por BW
3× Mac Mini M4 Pro 48GB ~25 6 total 2 por nodo × 3; estimación por BW
RTX Pro 5000 BW 72GB ~100 4 BW 1.344 GB/s; estimación por BW (sin benchmark público)
2× Mac Studio M3 Ultra ~25–33 10 total 5 por nodo × 2; Gemma 3 27B medido en M3 Ultra
1× DGX Spark ~3,7–11 6 Gemma 4 31B medido; rango según cuantización (BF16 → Q4)
2× DGX Spark (vinculados) ~3,7–11 12 total Mismo decode por instancia

El dato del DGX Spark es un rango, no un número

Las fuentes dan valores muy distintos para Gemma 4 31B dense en DGX Spark según cuantización y método de medida: ~3,7 tok/s en BF16, ~6,9 tok/s por cálculo de ancho de banda y ~10,65 tok/s en Q4_K_M medido, llegando a ~16 tok/s con decodificación multi-token. El extremo alto (~11 tok/s, Q4_K_M) es el relevante para nuestro despliegue, que usa Q4 como base. Detalle en Fuentes.

Latencia acumulada de pipeline

En un pipeline LangGraph de 6 nodos encadenados, cada nodo genera ~150 tokens. La latencia total es la suma de todos los nodos. Esta tabla ilustra por qué la velocidad de decode por modelo importa más que la capacidad total de memoria cuando el caso de uso es principalmente encadenamiento de agentes.

Escenario Tok/s (27B) Tiempo/nodo (150 tok) Pipeline 6 nodos Comparativa vs actual
Actual ~48 ~3,1 s ~18 s
2× Mac Mini M4 Pro 48GB ~25 ~6 s ~36 s 2× más lento
3× Mac Mini M4 Pro 48GB ~25 ~6 s ~36 s 2× más lento
RTX Pro 5000 BW 72GB ~100 ~1,5 s ~9 s 2× más rápido
2× Mac Studio M3 Ultra ~25–33 ~4,5–6 s ~27–36 s 1,5–2× más lento
1× DGX Spark ~3,7–11 ~13,6–40 s ~82–243 s 4,5–13× más lento
2× DGX Spark (vinculados) ~3,7–11 ~13,6–40 s ~82–243 s 4,5–13× más lento

Velocidad de decode en Gemma 4 27B por escenario, coloreada por resiliencia ante caída de nodo

El DGX Spark engaña con sus 128 GB

A pesar de tener 128 GB de memoria y CUDA Blackwell completo, en modelos 27B densos genera entre ~3,7 tok/s (BF16) y ~11 tok/s (Q4_K_M) por el cuello de botella de su memoria LPDDR5X (273 GB/s) —un pipeline de 6 nodos va de ~82 s en el mejor caso a más de 240 s en el peor. En batch o en modelos MoE (Qwen3-235B, GPT-OSS 120B) su rendimiento es muy superior, pero para pipelines de modelos densos encadenados este es el dato relevante.

Comparativa consolidada

Actual 2× Mini M4P 3× Mini M4P RTX Pro 5000 72G 2× Studio M3U 1× DGX Spark 2× DGX Spark
Precio sin IVA ~4.140 € ~6.210 € ~7.165 € ~8.346 € 4.350 € ~8.750 €
Tok/s Gemma 4 27B ~48 ~25 ~25 ~100 ~25–33 ~3,7–11 ~3,7–11
Modelos 27B simultáneos 1 4 6 4 10 6 12
Pipeline 6 nodos 27B ~18 s ~36 s ~36 s ~9 s ~27–36 s ~82–243 s ~82–243 s
Modelos >70B ocasionales ✓ 1×70B Q4 ✓ 1×70B/nodo ✓ hasta 200B ✓ hasta 405B
Fine-tuning CUDA básico ✓ avanzado ✓ avanzado ✓ máximo
Consumo activo ~350 W ~70 W ~105 W ~400 W ~360 W ~120 W ~240 W
Nuevas máquinas 2 3 ninguna 2 1 2

El coste de cada configuración, con el color de cada barra indicando la resiliencia ante caída de nodo:

Coste total sin IVA de cada configuración, coloreada por resiliencia ante caída de nodo

Fiabilidad ante caída de nodo

En entornos productivos o de cliente, la caída de un nodo no debe equivaler a la caída del servicio completo. Esta sección evalúa cada escenario desde la perspectiva de la tolerancia a fallos.

SPOF (Single Point Of Failure)

Punto único de fallo: un componente cuyo fallo, por sí solo, tumba todo el servicio. Un sistema sin redundancia es un SPOF por definición.

Escenario ¿Qué cae? Impacto en servicio Recuperación Resiliencia global
🔴 Actual · RTX 5000 Ada La única máquina Caída total del servicio Reinicio manual; sin redundancia Nula — SPOF completo
🟠 2× Mac Mini M4 Pro 48GB 1 de 2 nodos 50% de agentes no disponibles; pipeline puede degradarse LangGraph redirige peticiones al nodo vivo; manual o automático Parcial — servicio degradado pero no caído
🟢 3× Mac Mini M4 Pro 48GB 1 de 3 nodos 33% de agentes no disponibles; otros nodos absorben carga LangGraph redistribuye; capacidad total reduce un tercio Buena — 2 nodos activos mantienen servicio esencial
🔴 RTX Pro 5000 BW 72GB La única máquina Caída total del servicio Reinicio manual; sin redundancia Nula — SPOF completo
🟠 2× Mac Studio M3 Ultra 1 de 2 nodos 50% de capacidad perdida; pipeline puede continuar con un nodo LangGraph redistribuye entre nodo vivo; manual o automático Parcial — buen margen por la capacidad de cada nodo (96 GB)
🔴 1× DGX Spark La única máquina Caída total del servicio Reinicio manual; sin redundancia Nula — SPOF completo
🔴 2× DGX Spark (vinculados) 1 de 2 unidades Caída total: la memoria unificada requiere ambas unidades activas Hay que reiniciar el par; no hay fallback parcial Peor que 2 máquinas independientes: fallo de una tumba las dos

Cómo leer los colores

🟢 Verde: resiliencia buena — un nodo caído no interrumpe el servicio esencial.

🟠 Naranja: resiliencia parcial — servicio degradado pero no caído.

🔴 Rojo: sin resiliencia — cualquier fallo implica interrupción total.

Sobre los 2× DGX Spark: la interconexión NVLink-C2C que les da 256 GB de memoria unificada es también su mayor punto de fragilidad en términos de disponibilidad. Al operar como un único sistema lógico, la caída de cualquiera de las dos unidades —o del cable de interconexión— interrumpe el servicio por completo, exactamente igual que una máquina única pero con el doble de componentes que pueden fallar.

Veredicto

Si la prioridad es velocidad de pipeline

La RTX Pro 5000 Blackwell 72 GB es la opción más eficaz para el caso de uso central. Con ~100 tok/s en modelos 27B densos y un ancho de banda de 1.344 GB/s, un pipeline de 6 nodos tarda ~9 segundos —el doble de rápido que el hardware actual y entre 9 y 27 veces más rápido que el DGX Spark en el mismo escenario. Permite cargar 4 modelos 27B o 10 modelos 12B simultáneamente en VRAM, con CUDA Blackwell completo para fine-tuning hasta 34B. Va en la workstation existente, sin añadir infraestructura ni máquinas nuevas a gestionar. Su punto débil es que es un SPOF: sin redundancia ante caída.

¿9 o 27 veces?

El margen depende de la cuantización del DGX Spark: con Q4_K_M (~11 tok/s) el pipeline va ~9× más lento que la RTX; con el modelo sin cuantizar (BF16, ~3,7 tok/s), hasta ~27×. Nuestro despliegue usa Q4, así que el extremo de ~9× es el realista.

Si la prioridad es capacidad + resiliencia con buena relación precio

Los 3× Mac Mini M4 Pro 48 GB (~6.210 €) ofrecen 6 modelos 27B activos distribuidos entre tres nodos, al mejor precio de la lista y con el menor consumo (~105 W activo). El pipeline es más lento (~36 s en escenario 27B encadenado), pero si los agentes trabajan más en paralelo que en cadena, o si el tiempo de respuesta por pipeline no es crítico, este escenario compensa ampliamente. Además, es el único con buena resiliencia real: si cae un nodo, los otros dos mantienen el servicio con capacidad reducida pero sin interrupción total.

Si la prioridad es CUDA + modelos grandes ocasionales

El DGX Spark (4.350 €) es la opción más económica con CUDA Blackwell y 128 GB. Es ideal si los modelos grandes (70B–200B) son el caso de uso habitual, no la excepción. Para pipelines de agentes encadenados con modelos 27B densos, su decode lento (entre 3,7 y 11 tok/s según fuente y cuantización) acumula latencia significativa. Es también un SPOF sin redundancia.

La resiliencia como factor diferencial

Desde la perspectiva de disponibilidad del servicio, los escenarios de una única máquina —Actual, RTX Pro 5000 BW 72GB, 1× DGX Spark— son equivalentes: cualquier fallo implica interrupción total. Los 2× DGX Spark vinculados no mejoran esto; al contrario, aumentan los puntos de fallo con la misma consecuencia. Los escenarios con múltiples máquinas independientes —Mac Mini y Mac Studio— son los únicos que ofrecen degradación graceful ante un fallo de nodo, siendo los 3× Mac Mini los que mejor combinan resiliencia, precio y gestión sencilla.

Fuentes

Cifras agrupadas por hardware. Los valores varían según el motor de inferencia, el contexto y la cuantización (ver la nota final).

DGX Spark (GB10) — Gemma 4 31B dense

  1. nabe2030/dense-27b-31b-dgx-spark — Benchmark real de Qwen 3.5/3.6-27B y Gemma 4-31B dense en NVIDIA DGX Spark (GB10) con llama.cpp b8922. Mide Gemma 4-31B BF16 a 3,82 tok/s (87% del teórico) y Q4_K_M a 10,65 tok/s (67% del teórico).
  2. We Hit 120 Tokens Per Second With 1 Million Token Context on a Single Desktop AI Computer — Flowtivity, mayo 2026. Reporta Gemma 4 31B a 3,7 tok/s en BF16, hasta 16 tok/s con decodificación multi-token.
  3. Gemma 4 26B-A4B on DGX Spark: 52 tok/s with NVFP4, skip the 31B — ai-muninn.com, abril 2026. Reporta el 31B dense a 6,9 tok/s (cálculo por ancho de banda) frente a 52 tok/s del 26B-A4B MoE equivalente.
  4. I Benchmarked Google's Gemma 4 on NVIDIA DGX Spark — Here's What 128GB of Unified Memory Can Do — Yasar Kocyigit, Medium, abril 2026. Benchmark de Gemma 4 31B en BF16 y Q8_0.

Mac Studio M3 Ultra — Gemma 3 27B (referencia más cercana a Gemma 4 27B)

  1. Gemma 3 Performance: Tokens Per Second in LM Studio vs. Ollama on Mac Studio M3 Ultra — Rif Kiamil, Medium/Google Cloud Community. Mide gemma3:27b a 24 tok/s (Ollama) y 33 tok/s (LM Studio).
  2. Apple's M3 Ultra Mac Studio Misses the Mark for LLM Inference — Billy Newport, Medium. Cita una medición de Alex Ziskind (YouTube) de Gemma 3 27B Q4 a ~41 tok/s con prompts cortos, con caída notable en contextos largos.
  3. Local AI Hardware Performance Benchmarking — Olares Blog, abril 2026. Mide Gemma3-27B en M3 Ultra entre 27,51 y 4,64 tok/s según el nivel de concurrencia (vLLM).

Mac Mini M4 Pro / ancho de banda general

  1. Best Mac for Local AI 2026: Every Apple Silicon Chip Ranked (M1–M5) — Local AI Master, actualizado junio 2026. Confirma el Mac Mini M4 Pro 48GB como mejor relación calidad-precio en este tier, con BW de 273 GB/s.
  2. What to Buy for Local LLMs (April 2026) — Julien Simon, Medium. Datos de ancho de banda M3 Ultra (819 GB/s) y M4 Max (546 GB/s) usados para contextualizar la posición del M4 Pro.

RTX 5000 Ada y RTX Pro 5000 BW 72GB

No se han localizado benchmarks públicos de Gemma 4 12B/27B en estas GPUs. Las cifras de Gemma 4 12B y Gemma 4 27B para estos escenarios son estimaciones por ancho de banda (BW disponible ÷ tamaño del modelo activo en memoria), siguiendo la misma metodología que la fuente 1 aplica de forma explícita para calcular el rendimiento teórico del DGX Spark. No deben tratarse como mediciones confirmadas.

Las cifras de inferencia local no son un valor único

Los benchmarks varían sustancialmente según el motor de inferencia (Ollama, LM Studio, vLLM, llama.cpp), la longitud de contexto, el nivel de concurrencia y la versión del software. Las cifras citadas reflejan rangos observados en fuentes públicas, no un valor único definitivo. Se recomienda validar con benchmarks propios antes de tomar la decisión de compra final.