Saltar a contenido

Panorama de inferencia local — foto de julio de 2026

Foto archivada — no uses estos datos como actuales

Esta es una copia archivada del panorama, con los datos verificados a 2 de julio de 2026. Se guarda para poder ver cómo se ha movido el mercado, no para consultar precios: los de GPU se mueven en semanas. El dato vigente está en el panorama actual.

Lo que cambió después de esta foto: entró el AMD Ryzen AI Max+ 395 (Strix Halo), que faltaba pese a llevar más de un año disponible; el RTX Spark Superchip pasó de estimación a lanzamiento confirmado con precio revisado al alza; el Mac Studio M5 Ultra se retrasó a ~octubre de 2026; y se corrigió la fecha de lanzamiento de Gemma 4 (2 de abril de 2026, no abril de 2025, como figura más abajo en esta copia).

Qué era este documento

Una foto del mercado, no una recomendación de compra: qué hardware y qué modelos open-weight existían en esa fecha para inferencia local, con precio, licencia y fuente. Qué elegiríamos nosotros y por qué está en la evaluación de hardware, que compara escenarios concretos y da un veredicto.

TL;DR

Lo que marca el panorama a julio de 2026:

Lo que ha cambiado de verdad

  • Los precios NVIDIA se han movido en direcciones opuestas. La RTX PRO 5000 Blackwell 72 GB ha bajado a ~5.633 USD de media, mientras el DGX Spark ha subido de 3.999 a 4.699 USD de MSRP por escasez de memoria.

  • La RTX PRO 6000 Blackwell (96 GB) se aleja: 13.250 USD de MSRP oficial, un +55% en un año.

  • Tres candidatos open-weight sólidos en el tramo 20B–35B: Qwen3.6 (27B dense y 35B-A3B MoE, Apache 2.0), GPT-OSS-20B (Apache 2.0) y GLM-4.7-Flash (30B-A3B MoE, MIT). Los tres caben en hardware que ya existe.

  • No hay Gemma 5. Gemma 4 (abril 2025) sigue siendo la versión vigente de Google, sin sucesor anunciado.

Apple sigue sin cifras firmes

Mac mini M5 Pro y Mac Studio M5 Ultra no tienen fecha ni precio confirmados, y se esperan para la segunda mitad de 2026. Todo lo que se publica sobre ellos son rumores de prensa especializada. No construyas un plan sobre esas cifras.

Hardware

Se marca (nuevo) lo lanzado o anunciado en los últimos ~6 meses. El estado distingue disponible (se puede comprar hoy) de anunciado y de rumor.

Producto Fabricante Memoria Ancho de banda CUDA/acel. Precio aprox. Estado Fuente
RTX PRO 6000 Blackwell (Workstation Ed.) NVIDIA 96 GB GDDR7 ECC 1.792 GB/s 24.064 CUDA, Tensor 5ª gen 13.250 USD oficial NVIDIA; terceros 11.360–14.499 USD; en su lanzamiento (mar. 2025) ~8.435–8.565 USD, +55% en un año Disponible, con escasez y precio al alza Tom's Hardware · MLQ News · NVIDIA
RTX PRO 5000 Blackwell 72 GB NVIDIA 72 GB GDDR7 1.344 GB/s Blackwell, Tensor 5ª gen ~5.633 USD de media en jun. 2026 (rango 5.466–5.767 USD). La variante de 48 GB cotiza aparte, ~4.200 USD — no confundir ambas configuraciones Disponible GPU Poet
DGX Spark (GB10) NVIDIA 128 GB LPDDR5X 273 GB/s Grace Blackwell, CUDA 4.699 USD MSRP oficial (subió desde 3.999 USD por escasez de memoria); algunos retailers aún ofrecen 3.999 USD Disponible, precio al alza WCCFTech · Tom's Hardware
RTX Spark Superchip (nuevo) — OEM laptops/mini-PC Windows ARM NVIDIA 128 GB LPDDR5X unificada ~300 GB/s Grace-Blackwell: CPU ARM 20 núcleos + GPU 6.144 CUDA Estimado no oficial: ~1.799 USD (N1) a ~2.899 USD (N1X) Anunciado (Computex jun. 2026); a la venta otoño 2026, +30 portátiles y ~10 sobremesas (ASUS, Dell, HP, Lenovo, MS Surface, MSI) Tom's Hardware · NVIDIA Newsroom
Mac mini M5 Pro (nuevo) Apple 24 GB base (configuraciones superiores sin confirmar) ~307 GB/s (sube desde 273 GB/s del M4 Pro) GPU integrada, no CUDA Rumor: 899–999 USD base (24 GB); memoria adicional +200–300 USD Rumor; no llegó en WWDC (8 jun.), previsión ahora en 2ª mitad de 2026 Macworld
Mac Studio M5 Ultra (nuevo) Apple hasta 768 GB unificada en teoría; la escasez de componentes apunta a ~256 GB real al lanzamiento ~1.100 GB/s (est.), ~190 W pico GPU ~80 cores, no CUDA Sin precio oficial; riesgo de subida desde los 1.999 USD base actuales por escasez de DRAM Rumor, esperado ~oct. 2026; riesgo de retraso reconocido por Apple MacRumors · AppleInsider
Apple M6 (nuevo) — solo MacBook Pro Apple 16–48 GB est. n/d GPU integrada, no CUDA n/d Rumor (Q4 2026); sin M6 Pro/Max/Ultra hasta M7 (2027) 9to5Mac
AMD Radeon AI PRO R9700 AMD 32 GB GDDR6 183 tok/s decode medido en Qwen3-30B-A3B Q4, ~86% del ancho de banda teórico RDNA4, ROCm 6.4 / Vulkan, 300 W 1.299 USD MSRP confirmado Disponible TechPowerUp · ggml-org/llama.cpp #21043
Qualcomm Snapdragon X2 Elite (mini-PC, p. ej. ASUS Ascent QN10) Qualcomm RAM unificada (según configuración) n/d Hexagon NPU 80 TOPS ~600–900 USD est. Disponible Local AI Master
Vera Rubin (nuevo) — Rubin GPU + Vera CPU + Groq 3 LPU NVIDIA n/d (escala datacenter) n/d Rubin GPU, NVLink 6, ConnectX-9 n/d (infraestructura, no venta unitaria) Anunciado, producción iniciada; despliegue en nube (AWS, Google Cloud, Azure, OCI) 2ª mitad 2026 NVIDIA Newsroom

Qué mirar de cada uno

  • RTX PRO 6000 Blackwell: 6–7× más tok/s que el DGX Spark en cargas memory-bound, a más del doble de precio de la RTX PRO 5000 72 GB. Solo entra si se sube de rango de presupuesto.

  • RTX PRO 5000 72 GB: mejora su relación precio/rendimiento respecto a principios de año, porque ha bajado de precio mientras el resto subía.

  • DGX Spark: empeora su posición frente a la RTX PRO 5000 — misma familia, más caro que antes, y con un decode notablemente lento en modelos densos de 27B.

  • RTX Spark Superchip: la novedad más interesante como "nodo barato con CUDA" — misma memoria unificada que el DGX Spark y ~300 GB/s, con un precio estimado muy inferior. Pero no hay unidades reales ni precio oficial: confianza media.

  • Mac mini M5 Pro / Mac Studio M5 Ultra: sin fecha ni precio confirmados. El dato más relevante es el riesgo de que el M5 Ultra salga con ~256 GB en vez de los 768 GB teóricos por escasez de componentes.

  • Apple M6: solo MacBook Pro, sin relevancia para uso como nodo de servidor este año.

  • AMD Radeon AI PRO R9700: alternativa barata para nodos de 32 GB, con precio y benchmark ya confirmados. La incógnita no es el hardware, es la madurez de ROCm/Vulkan frente a CUDA en un flujo real con Ollama/LiteLLM.

  • Qualcomm y NPU en general: no compiten en el rango 12B–70B. El orden de lo que manda para inferencia local sigue siendo memoria > ancho de banda > GPU integrada > NPU.

  • Vera Rubin: plataforma de datacenter a escala de fábrica de IA (multi-chip, multi-nodo). Fuera del alcance de la inferencia local de bajo coste; se registra por si en el futuro derivan variantes de estación de trabajo.

Modelos open-weight

El criterio es el mismo que usa la evaluación: que quepan en equipos modestos (aprox. 12B–70B, cuantizables) y que la licencia sea open weight de verdad.

Modelo Tamaño / arquitectura ¿Corre en equipo modesto? Licencia En qué mejora a Gemma 4 Fuente
Qwen3.6-27B (dense) 27B dense — Q4_K_M ~16,8 GB, cabe en una RTX 5000 Ada de 32 GB Apache 2.0 78,8 en SWE-bench Verified; supera a Gemma 4 31B en coding con menos parámetros Unsloth · BuildFastWithAI
Qwen3.6-35B-A3B (MoE, 3B activos) 35B total / 3B activos — Q4_K_M ~21 GB, cabe en 24 GB Apache 2.0 ~240 tok/s en RTX 6000 (MTP); supera a Gemma 4 26B MoE en coding (+21 pts) y en tool-use Hugging Face · Towards AI
GLM-4.7-Flash (Z.ai) (nuevo) 30B total / ~3B activos (MoE) — misma clase que Qwen3.6-35B-A3B, cuantizable para hardware modesto MIT Modelo de coding de coste bajo; buena relación rendimiento/tamaño frente a Gemma 4 26B MoE. En producción desde enero de 2026, ya validado por la comunidad Hugging Face · TokenMix
GPT-OSS-20B (OpenAI) 21B total / 3,6B activos (MoE) — corre con 16 GB, pensado para edge/local Apache 2.0 Primera entrada de OpenAI en open-weight local; calidad ~o3-mini; nativo MXFP4, integración directa con Ollama/llama.cpp/vLLM OpenAI · Hugging Face
GPT-OSS-120B (OpenAI) 117B total / 5,1B activos (MoE) Parcial — pensado para 1 GPU de 80 GB Apache 2.0 Calidad ~o4-mini; interesante solo con hardware de 80 GB+ OpenAI
Ministral 3 (14B / 8B / 3B dense) Dense, 3 tamaños , sobradamente Apache 2.0 Alternativa ligera a Gemma 4 12B para nodos de routing/guardrails; variantes con razonamiento y visión Mistral AI
Qwen3 72B (dense) 72B dense Difícil — ~40–45 GB INT4; necesita RTX PRO 5000 72 GB o similar Apache 2.0 SOTA en razonamiento/MMLU entre open-weight <100B; supera a Gemma 4 31B VRLA Tech
Llama 4 Scout 109B total / 17B activos (MoE) Parcial — ~55 GB INT4 Llama Community License (restricciones >700M usuarios) Contexto de 10M tokens, útil para RAG largo Meta
DeepSeek V4 (Pro/Flash) Pro: 1,6T / 49B activos · Flash: 284B / 13B activos (MoE) No — sigue exigiendo cientos de GB pese a los pocos activos MIT 1M de contexto; 80,6 SWE-bench Verified (V4-Pro-Max) MorphLLM
Mistral Large 3 675B total / 41B activos (MoE) No — 690 GB en disco Apache 2.0 SOTA open-weight multilingüe Mistral AI
GLM-5.2 (Z.ai) 744B total / ~40B activos (MoE) No — >1 TB en FP16, requiere multi-GPU MIT Contexto 1M; agentic coding SOTA open-weight vLLM recipes
Kimi K2.6 (Moonshot AI) 1T total / 32B activos (MoE) No — 594 GB en INT4 MIT modificada Contexto 256K; líder open-weight en coding y agentes Hugging Face
Kimi K2.7-Code (Moonshot AI) (nuevo) 1T total / 32B activos (MoE) No — misma escala que K2.6 MIT modificada Sucesor de coding de K2.6 (62,0 en Kimi Code Bench v2) prensa especializada, jun. 2026
MiniMax M2.7 230B total / 10B activos (MoE) No por tamaño Propietaria desde M2.7 — uso comercial prohibido sin autorización (M2/M2.5 sí eran Apache/MIT) Rendimiento fuerte en agentes, pero el cambio de licencia lo saca de la categoría open weight BigGo Finance
MiniMax M3 (nuevo) ~230–428B total / 10–23B activos (MoE); las fuentes discrepan en el total No por tamaño Licencia propia de MiniMax, repositorio gated; permisividad real por confirmar 1M de contexto y multimodal nativo MiniMax

Qué mirar de cada uno

Los tres candidatos reales para hardware modesto son Qwen3.6 (27B dense y 35B-A3B MoE), GPT-OSS-20B y GLM-4.7-Flash. Tienen licencia permisiva de verdad, benchmarks públicos y caben en hardware que ya existe, así que se pueden validar con un benchmark propio sin comprar nada. GLM-4.7-Flash es el menos obvio de los tres y el que llevaba más tiempo disponible sin que le prestáramos atención: MIT, en producción desde enero de 2026.

Qwen3 72B y Llama 4 Scout exigen ampliar el hardware a 72 GB+. Solo entran en la conversación si sube el presupuesto.

Todo lo de ≥230B parámetros totales —DeepSeek V4, Mistral Large 3, GLM-5.2, Kimi K2.6/K2.7-Code, MiniMax M2.7/M3— queda fuera de alcance para local modesto. Se listan porque son los lanzamientos que marcan el estado del arte open-weight, no porque sean candidatos: lo que importa aquí es que pocos parámetros activos no significan poca memoria en disco.

Dense vs MoE, y por qué la memoria no baja

Un modelo MoE (mixture of experts) solo activa una fracción de sus parámetros por token —3B de 35B, por ejemplo—, lo que lo hace rápido. Pero hay que cargar todos los parámetros en memoria, porque cualquier experto puede activarse en el siguiente token. De ahí que Kimi K2.6 ocupe 594 GB con "solo" 32B activos. Los parámetros activos predicen la velocidad; los totales, la memoria que necesitas.

No hay Gemma 5. Gemma 4 (abril 2025) sigue siendo la versión vigente de Google, sin anuncio de sucesor a julio de 2026.

Fuentes y fiabilidad

La confianza no es igual para todos los datos

Confianza alta — precios de mercado (RTX PRO 5000/6000, DGX Spark, R9700) y benchmarks con cifras concretas (Qwen3.6, GPT-OSS, GLM-4.7-Flash, R9700 en llama.cpp): son mediciones o precios de venta reales, con fecha.

Confianza media o baja — todo lo referente a Mac mini M5 Pro, Mac Studio M5 Ultra, Apple M6 y el precio del RTX Spark Superchip: son rumores o estimaciones de prensa especializada, sin confirmación oficial de Apple ni de NVIDIA.

Cómo usar este documento

Al ser una foto archivada, sirve para comparar con el presente, no para citar cifras:

  1. Para un dato de hoy, ve al panorama actual. Todo lo que hay aquí está congelado al 2 de julio de 2026.

  2. Para decidir una compra, ve a la evaluación de hardware, que convierte estas cifras en escenarios comparables con cálculo de rendimiento del pipeline.

  3. Si comparas con el panorama vigente, ten en cuenta que las marcas (nuevo) de esta copia se referían a los ~6 meses anteriores a julio de 2026, no a lo que sea reciente hoy.

El resto de fotos archivadas está en el índice de versiones anteriores.