Saltar a contenido

Panorama de hardware y modelos para inferencia local

Nota para el equipo

Es una foto del mercado, no una recomendación de compra: qué hardware y qué modelos open-weight existen hoy para inferencia local, con precio, licencia y fuente. Quien busque qué elegiríamos nosotros y por qué, eso está en la evaluación de hardware, que compara escenarios concretos y da un veredicto.

Se refresca periódicamente, así que es el sitio donde mirar el dato actual. Datos verificados a 1 de agosto de 2026. Los precios de GPU se mueven en semanas: comprueba la fecha antes de usar una cifra.

TL;DR

Lo que marca el panorama a agosto de 2026:

Lo que marca el mercado hoy

  • Tres candidatos open-weight para hardware modesto: Qwen3.6 (27B dense y 35B-A3B MoE, Apache 2.0), GPT-OSS-20B (Apache 2.0) y GLM-4.7-Flash (30B-A3B MoE, MIT). Los tres caben en hardware que ya existe y tienen licencia permisiva de verdad.

  • El AMD Ryzen AI Max+ 395 ("Strix Halo") ofrece 128 GB de memoria unificada por 2.600–4.000 USD, sensiblemente menos que el DGX Spark (128 GB, 4.699 USD), aunque sin CUDA (usa ROCm/Vulkan) y con algo menos de ancho de banda medido.

  • El RTX Spark Superchip tiene lanzamiento confirmado para otoño de 2026, con más de 30 portátiles y 10 sobremesas anunciados por ASUS, Dell, HP, Lenovo, MSI y Microsoft Surface. Precio todavía estimado, no oficial.

  • No hay Gemma 5. Gemma 4 (Google, lanzado el 2 de abril de 2026) sigue siendo la versión vigente, sin sucesor anunciado.

  • El estado del arte open-weight de gran escala está en Kimi K3 (2,8T parámetros, Moonshot AI) y en el anuncio de Qwen3.8-Max (2,4T, Alibaba, aún sin pesos publicados). Ninguno de los dos sirve para hardware modesto: quedan muy por encima del rango que cabe en un equipo de gama media.

Apple no tiene cifras firmes, y el Mac Studio se ha retrasado

Mac mini M5 Pro y Mac Studio M5 Ultra no tienen fecha ni precio confirmados. El Mac Studio M5 Ultra, esperado a inicios de 2026, se ha retrasado a ~octubre de 2026 por escasez de DRAM. Todo lo que se publica sobre ambos son rumores de prensa especializada. No construyas un plan sobre esas cifras.

Hardware

Se marca (nuevo) lo lanzado o anunciado en los últimos ~6 meses. El estado distingue disponible (se puede comprar hoy) de anunciado y de rumor.

La tabla da el dato escueto; el matiz de cada fila (qué precio es real, qué es estimación, dónde está la trampa) va justo debajo, en "Qué mirar de cada uno".

Producto Memoria Ancho de banda CUDA/acel. Precio aprox. Estado Fuente
RTX PRO 6000 Blackwell · NVIDIA (96 GB) 96 GB GDDR7 ECC 1.792 GB/s 24.064 CUDA, Tensor 5ª gen 13.250 USD MSRP · mercado 7.999–14.499 Disponible Tom's HW · VideoCardz
RTX PRO 5000 Blackwell · NVIDIA (48/72 GB) 48 o 72 GB GDDR7 ~1.344 GB/s (72 GB) Blackwell, Tensor 5ª gen ~5.633–7.057 USD · confianza media Disponible GPU Poet · PriceHistory
DGX Spark (GB10) · NVIDIA 128 GB LPDDR5X 273 GB/s Grace Blackwell, CUDA 4.699 USD MSRP Disponible Tom's HW
Ryzen AI Max+ 395 "Strix Halo" · AMD (mini-PC) hasta 128 GB unificada (96 GB a VRAM) 256 GB/s teórico · ~215 medido NPU XDNA2 ~50 TOPS; RDNA 3.5; sin CUDA 3.999 USD kit oficial · 2.600–5.000 terceros Disponible AMD · TweakTown
Ryzen AI Max+ PRO 495 · AMD (nuevo) hasta 192 GB unificada n/d XDNA2, sucesor del 395 sin confirmar Anunciado · 3T 2026 Compute Market
RTX Spark Superchip · NVIDIA (OEM Windows ARM) (nuevo) 128 GB unificada ~300 GB/s ARM 20 núcleos + 6.144 CUDA 2.500–3.000 USD estimado Anunciado · otoño 2026 TweakTown
Radeon AI PRO R9700 · AMD 32 GB GDDR6 n/d (ver nota) RDNA4, ROCm 6.4 / Vulkan, 300 W 1.299 USD MSRP Disponible TechPowerUp · llama.cpp
Snapdragon X2 Elite · Qualcomm (mini-PC) unificada, según configuración n/d Hexagon NPU 80 TOPS ~600–900 USD estimado Disponible Deccan Herald
Mac mini M5 Pro · Apple 24 GB base estimada ~307 GB/s estimado GPU integrada, sin CUDA ~599–899 USD (rumor) Rumor · sin fecha Macworld
Mac Studio M5 Ultra · Apple 96 GB base estimada · 768 GB máx. teórico ~1.100 GB/s estimado GPU ~80 cores, sin CUDA sin precio oficial Rumor · ~oct. 2026 Macworld
Apple M6 (solo MacBook Pro) 16–48 GB estimado n/d GPU integrada, sin CUDA; 2 nm n/d Rumor · finales 2026 MacRumors
Vera Rubin · NVIDIA (datacenter) n/d n/d Rubin GPU, NVLink 6 no se vende por unidad En producción NVIDIA

Qué mirar de cada uno

  • RTX PRO 6000 Blackwell: el precio de mercado tiene una horquilla muy ancha, desde los 7.999 USD de una promoción puntual de Newegg a 14.499 USD en otros canales; el MSRP oficial (13.250 USD) no siempre refleja lo que se paga realmente. Trata el extremo bajo como oferta puntual, no como precio de mercado. Hay escasez de GDDR7, que es lo que empuja el precio arriba. Solo entra si se sube de rango de presupuesto.

  • RTX PRO 5000 (48/72 GB): buena relación precio/rendimiento, pero ninguna cifra de precio es definitiva aquí (confianza media): el dato más limpio es una media de junio de 2026 para la variante de 72 GB (~5.633 USD) y no hemos encontrado un tracker actualizado a julio o agosto que separe las variantes. Comprueba siempre qué configuración de memoria estás mirando — 48 GB y 72 GB cotizan por separado y es fácil confundirlas.

  • DGX Spark: memoria unificada de 128 GB con CUDA, pero decode notablemente lento en modelos densos de 27B, y tiene un competidor directo en memoria y precio (ver Strix Halo).

  • AMD Ryzen AI Max+ 395 (Strix Halo): mismo orden de magnitud de memoria unificada que el DGX Spark (128 GB) por 1.000–2.000 USD menos, con NPU y GPU integrada decentes. El punto débil es la falta de CUDA — el ecosistema ROCm/Vulkan es menos maduro para inferencia LLM que CUDA en flujos con Ollama/LiteLLM.

  • RTX Spark Superchip: tiene fecha de lanzamiento (otoño 2026) y una decena de fabricantes confirmados —más de 30 portátiles y ~10 sobremesas entre ASUS, Dell, HP, Lenovo, MSI y Microsoft Surface, con Acer y Gigabyte después—, pero todavía no hay unidades a la venta ni precio oficial: confianza media en precio, alta en especificaciones y calendario.

  • AMD Radeon AI PRO R9700: alternativa barata para nodos de 32 GB, con precio confirmado y benchmark propio de la comunidad: 183 tok/s de decode medidos en Qwen3-30B-A3B Q4 con backend Vulkan, aproximadamente el 86% de su ancho de banda teórico. Ojo con eso: no hemos encontrado publicado el ancho de banda de la tarjeta —de ahí el n/d de la tabla—, así que ese porcentaje viene de la fuente, no de un cálculo nuestro. La incógnita sigue siendo la madurez de ROCm/Vulkan frente a CUDA en un flujo real con Ollama/LiteLLM.

  • Mac mini M5 Pro / Mac Studio M5 Ultra: sin fecha ni precio confirmados. El Mac Studio se ha retrasado a octubre de 2026; el riesgo sigue siendo que salga con menos memoria máxima de la teórica (768 GB) por escasez de componentes. En el Mac mini, el almacenamiento mínimo ha subido a 512 GB desde que Apple descontinuó el nivel de 256 GB en mayo de 2026, lo que sube el precio de entrada real.

  • Apple M6: solo MacBook Pro, sin relevancia para uso como nodo de servidor este año. No se esperan variantes Pro, Max ni Ultra hasta el M7, en 2027.

  • Qualcomm y NPU en general: no compiten en el rango 12B–70B. El orden de lo que manda para inferencia local sigue siendo memoria > ancho de banda > GPU integrada > NPU.

  • Vera Rubin: plataforma de datacenter a escala de fábrica de IA (multi-chip, multi-nodo). Fuera del alcance de la inferencia local de bajo coste; se registra por si en el futuro derivan variantes de estación de trabajo.

Modelos open-weight

El criterio es el mismo que usa la evaluación: que quepan en equipos modestos (aprox. 12B–70B, cuantizables) y que la licencia sea open weight de verdad.

Modelo Tamaño / arquitectura ¿Equipo modesto? Licencia En qué mejora a Gemma 4 Fuente
Qwen3.6-27B 27B dense · Q4_K_M ~16,8 GB Apache 2.0 78,8 en SWE-bench Verified; supera a Gemma 4 31B en coding con menos parámetros Unsloth
Qwen3.6-35B-A3B 35B total / 3B activos (MoE) · Q4_K_M ~21 GB Apache 2.0 ~240 tok/s en RTX 6000 (MTP); +21 pts en coding y en tool-use frente a Gemma 4 26B MoE Hugging Face
GLM-4.7-Flash (Z.ai) 30B total / ~3B activos (MoE) · 24 GB, o 60–80 tok/s en Apple Silicon MIT SWE-bench Verified 59,2% frente al 22,0% de Qwen3-30B-A3B; τ²-Bench 79,5% frente a 49,0% LM Studio
GPT-OSS-20B (OpenAI) 21B total / 3,6B activos (MoE) · 16 GB Apache 2.0 Calidad ~o3-mini; nativo MXFP4, integración directa con Ollama/llama.cpp/vLLM OpenAI
Ministral 3 (14B/8B/3B) dense, 3 tamaños , sobradamente Apache 2.0 El 14B razonador saca 85% en AIME 2025; alternativa ligera a Gemma 4 12B para routing Mistral AI
GPT-OSS-120B (OpenAI) 117B total / 5,1B activos (MoE) Parcial · 1 GPU de 80 GB Apache 2.0 Calidad ~o4-mini OpenAI
Qwen3 72B 72B dense Difícil · ~40–45 GB INT4 Apache 2.0 SOTA en razonamiento/MMLU entre open-weight <100B VRLA Tech
Llama 4 Scout / Maverick Scout 109B/17B · Maverick 400B (MoE) Parcial (Scout) · ~55 GB INT4 Llama Community (ver nota) Contexto de 10M tokens en Scout, útil para RAG largo Meta
DeepSeek V4 (Pro/Flash) Pro 1,6T/49B · Flash 284B/13B (MoE) No · cientos de GB MIT 1M de contexto; 80,6 SWE-bench Verified (V4-Pro-Max) DeepSeek
Mistral Large 3 675B total / 41B activos (MoE) No · 690 GB en disco Apache 2.0 SOTA open-weight multilingüe Mistral AI
GLM-5 / 5.1 / 5.2 (Z.ai) 744B total / ~40B activos (MoE) No · >1 TB en FP16 MIT Contexto 1M; agentic coding SOTA open-weight vLLM
GLM-5.5 (Z.ai) >1T estimado, sin confirmar No aplica · sin pesos sin confirmar Sucesor reportado de GLM-5.2, no confirmado por Zhipu (ver nota) Geeky Gadgets
Kimi K2.6 / K2.7-Code 1T total / 32B activos (MoE) No · 594 GB en INT4 MIT modificada Contexto 256K; K2.7-Code saca 62,0 en Kimi Code Bench v2 Hugging Face
Kimi K3 (Moonshot AI) 2,8T total / 104B activos (MoE) No · ~1,4 TB en INT4 propia (ver nota) Contexto 1M multimodal; 2º de 47 modelos en un ranking independiente citado por CNBC Hugging Face
MiniMax M2.7 230B total / 10B activos (MoE) No por tamaño propietaria (ver nota) Fuerte en agentes, pero fuera de la categoría open weight BigGo
MiniMax M3 428B total / ~23B activos (MoE) No por tamaño comunitaria (ver nota) 1M de contexto y multimodal nativo MiniMax
Qwen3.8-Max (Alibaba) ~2,4T, "sistema en evolución continua" No aplica · sin pesos prometida open weight, sin concretar Sucesor de la línea Qwen; aun si se abre, muy por encima del rango modesto MarkTechPost

Las licencias con letra pequeña

Cuatro de la tabla no son permisivas del todo, y la diferencia importa si el modelo va a dar servicio a un cliente:

  • Llama 4 (Llama Community License): restricciones para productos con más de 700 millones de usuarios.
  • Kimi K3 ("Kimi K3 License"): gratis salvo que el servicio de pago que lo use supere los 20 millones de USD anuales de ingresos, y entonces exige acuerdo con Moonshot.
  • MiniMax M2.7: propietaria — uso comercial prohibido sin autorización. M2 y M2.5 sí eran Apache/MIT, así que el cambio se produjo entre versiones.
  • MiniMax M3 (licencia comunitaria): gratis para uso no comercial; el uso comercial exige acuerdo aparte.

Qué mirar de cada uno

Los tres candidatos reales para hardware modesto son Qwen3.6 (27B dense y 35B-A3B MoE), GPT-OSS-20B y GLM-4.7-Flash. Tienen licencia permisiva de verdad, benchmarks públicos y caben en hardware que ya existe, así que se pueden validar con un benchmark propio sin comprar nada.

Qwen3 72B y Llama 4 Scout exigen ampliar el hardware a 72 GB+. Solo entran en la conversación si sube el presupuesto.

Todo lo de ≥230B parámetros totales —DeepSeek V4, Mistral Large 3, GLM-5.x, Kimi K2.6/K2.7-Code/K3, MiniMax M2.7/M3, y el anunciado Qwen3.8-Max— queda fuera de alcance para local modesto. Se listan porque son los lanzamientos que marcan el estado del arte open-weight, no porque sean candidatos: lo que importa aquí es que pocos parámetros activos no significan poca memoria en disco.

Dense vs MoE, y por qué la memoria no baja

Un modelo MoE (mixture of experts) solo activa una fracción de sus parámetros por token —104B de 2,8T en Kimi K3, por ejemplo—, lo que lo hace rápido. Pero hay que cargar todos los parámetros en memoria, porque cualquier experto puede activarse en el siguiente token. De ahí que Kimi K3 ocupe del orden de 1,4 TB en INT4 pese a "solo" 104B activos. Los parámetros activos predicen la velocidad; los totales, la memoria que necesitas.

No hay Gemma 5. Gemma 4 (Google, lanzado el 2 de abril de 2026) sigue siendo la versión vigente, sin anuncio de sucesor a agosto de 2026.

Fuentes y fiabilidad

La confianza no es igual para todos los datos

Confianza alta — los MSRP oficiales (RTX PRO 6000 a 13.250 USD, DGX Spark a 4.699 USD, R9700 a 1.299 USD), el precio del kit oficial de Strix Halo y los benchmarks con cifras concretas (Qwen3.6, GPT-OSS, GLM-4.7-Flash, Kimi K3, R9700 en llama.cpp): son mediciones, precios de venta reales o anuncios de fuente primaria, con fecha.

Confianza media — el precio de la RTX PRO 5000, porque no hay tracker actualizado que separe las variantes de 48 y 72 GB, y el extremo bajo de la horquilla de la RTX PRO 6000 (7.999 USD), que es una promoción puntual de un retailer y no un precio de mercado.

Confianza media o baja — todo lo referente a Mac mini M5 Pro, Mac Studio M5 Ultra, Apple M6, el precio del RTX Spark Superchip, y la fecha del rumor de GLM-5.5: son rumores o estimaciones de prensa especializada, sin confirmación oficial de Apple, NVIDIA o Zhipu.

Cómo usar este documento

  1. Para un dato puntual (precio, memoria, licencia), mira la tabla y comprueba la fecha de verificación de arriba. Los precios de GPU se mueven en semanas.

  2. Para decidir una compra, no te bases en este documento: ve a la evaluación de hardware, que convierte estas cifras en escenarios comparables con cálculo de rendimiento del pipeline.

  3. Antes de citar una cifra, comprueba si es medición o estimación. Las filas de Apple, el precio del RTX Spark Superchip y la fecha de GLM-5.5 son rumores o estimaciones; el resto de precios son de venta real o anuncios de fuente primaria.

Las fotos anteriores de este panorama están en versiones anteriores —la más reciente es la de julio de 2026—. Solo se archiva copia cuando hay un cambio de fondo, así que esa lista sirve para ver cómo se ha movido el mercado, no para llevar la cuenta de los refrescos.