Panorama de inferencia local — foto de julio de 2026
Foto archivada — no uses estos datos como actuales
Esta es una copia archivada del panorama, con los datos verificados a 2 de julio de 2026. Se guarda para poder ver cómo se ha movido el mercado, no para consultar precios: los de GPU se mueven en semanas. El dato vigente está en el panorama actual.
Lo que cambió después de esta foto: entró el AMD Ryzen AI Max+ 395 (Strix Halo), que faltaba pese a llevar más de un año disponible; el RTX Spark Superchip pasó de estimación a lanzamiento confirmado con precio revisado al alza; el Mac Studio M5 Ultra se retrasó a ~octubre de 2026; y se corrigió la fecha de lanzamiento de Gemma 4 (2 de abril de 2026, no abril de 2025, como figura más abajo en esta copia).
Qué era este documento
Una foto del mercado, no una recomendación de compra: qué hardware y qué modelos open-weight existían en esa fecha para inferencia local, con precio, licencia y fuente. Qué elegiríamos nosotros y por qué está en la evaluación de hardware, que compara escenarios concretos y da un veredicto.
TL;DR
Lo que marca el panorama a julio de 2026:
Lo que ha cambiado de verdad
-
Los precios NVIDIA se han movido en direcciones opuestas. La RTX PRO 5000 Blackwell 72 GB ha bajado a ~5.633 USD de media, mientras el DGX Spark ha subido de 3.999 a 4.699 USD de MSRP por escasez de memoria.
-
La RTX PRO 6000 Blackwell (96 GB) se aleja: 13.250 USD de MSRP oficial, un +55% en un año.
-
Tres candidatos open-weight sólidos en el tramo 20B–35B: Qwen3.6 (27B dense y 35B-A3B MoE, Apache 2.0), GPT-OSS-20B (Apache 2.0) y GLM-4.7-Flash (30B-A3B MoE, MIT). Los tres caben en hardware que ya existe.
-
No hay Gemma 5. Gemma 4 (abril 2025) sigue siendo la versión vigente de Google, sin sucesor anunciado.
Apple sigue sin cifras firmes
Mac mini M5 Pro y Mac Studio M5 Ultra no tienen fecha ni precio confirmados, y se esperan para la segunda mitad de 2026. Todo lo que se publica sobre ellos son rumores de prensa especializada. No construyas un plan sobre esas cifras.
Hardware
Se marca (nuevo) lo lanzado o anunciado en los últimos ~6 meses. El estado distingue disponible (se puede comprar hoy) de anunciado y de rumor.
| Producto | Fabricante | Memoria | Ancho de banda | CUDA/acel. | Precio aprox. | Estado | Fuente |
|---|---|---|---|---|---|---|---|
| RTX PRO 6000 Blackwell (Workstation Ed.) | NVIDIA | 96 GB GDDR7 ECC | 1.792 GB/s | 24.064 CUDA, Tensor 5ª gen | 13.250 USD oficial NVIDIA; terceros 11.360–14.499 USD; en su lanzamiento (mar. 2025) ~8.435–8.565 USD, +55% en un año | Disponible, con escasez y precio al alza | Tom's Hardware · MLQ News · NVIDIA |
| RTX PRO 5000 Blackwell 72 GB | NVIDIA | 72 GB GDDR7 | 1.344 GB/s | Blackwell, Tensor 5ª gen | ~5.633 USD de media en jun. 2026 (rango 5.466–5.767 USD). La variante de 48 GB cotiza aparte, ~4.200 USD — no confundir ambas configuraciones | Disponible | GPU Poet |
| DGX Spark (GB10) | NVIDIA | 128 GB LPDDR5X | 273 GB/s | Grace Blackwell, CUDA | 4.699 USD MSRP oficial (subió desde 3.999 USD por escasez de memoria); algunos retailers aún ofrecen 3.999 USD | Disponible, precio al alza | WCCFTech · Tom's Hardware |
| RTX Spark Superchip (nuevo) — OEM laptops/mini-PC Windows ARM | NVIDIA | 128 GB LPDDR5X unificada | ~300 GB/s | Grace-Blackwell: CPU ARM 20 núcleos + GPU 6.144 CUDA | Estimado no oficial: ~1.799 USD (N1) a ~2.899 USD (N1X) | Anunciado (Computex jun. 2026); a la venta otoño 2026, +30 portátiles y ~10 sobremesas (ASUS, Dell, HP, Lenovo, MS Surface, MSI) | Tom's Hardware · NVIDIA Newsroom |
| Mac mini M5 Pro (nuevo) | Apple | 24 GB base (configuraciones superiores sin confirmar) | ~307 GB/s (sube desde 273 GB/s del M4 Pro) | GPU integrada, no CUDA | Rumor: 899–999 USD base (24 GB); memoria adicional +200–300 USD | Rumor; no llegó en WWDC (8 jun.), previsión ahora en 2ª mitad de 2026 | Macworld |
| Mac Studio M5 Ultra (nuevo) | Apple | hasta 768 GB unificada en teoría; la escasez de componentes apunta a ~256 GB real al lanzamiento | ~1.100 GB/s (est.), ~190 W pico | GPU ~80 cores, no CUDA | Sin precio oficial; riesgo de subida desde los 1.999 USD base actuales por escasez de DRAM | Rumor, esperado ~oct. 2026; riesgo de retraso reconocido por Apple | MacRumors · AppleInsider |
| Apple M6 (nuevo) — solo MacBook Pro | Apple | 16–48 GB est. | n/d | GPU integrada, no CUDA | n/d | Rumor (Q4 2026); sin M6 Pro/Max/Ultra hasta M7 (2027) | 9to5Mac |
| AMD Radeon AI PRO R9700 | AMD | 32 GB GDDR6 | 183 tok/s decode medido en Qwen3-30B-A3B Q4, ~86% del ancho de banda teórico | RDNA4, ROCm 6.4 / Vulkan, 300 W | 1.299 USD MSRP confirmado | Disponible | TechPowerUp · ggml-org/llama.cpp #21043 |
| Qualcomm Snapdragon X2 Elite (mini-PC, p. ej. ASUS Ascent QN10) | Qualcomm | RAM unificada (según configuración) | n/d | Hexagon NPU 80 TOPS | ~600–900 USD est. | Disponible | Local AI Master |
| Vera Rubin (nuevo) — Rubin GPU + Vera CPU + Groq 3 LPU | NVIDIA | n/d (escala datacenter) | n/d | Rubin GPU, NVLink 6, ConnectX-9 | n/d (infraestructura, no venta unitaria) | Anunciado, producción iniciada; despliegue en nube (AWS, Google Cloud, Azure, OCI) 2ª mitad 2026 | NVIDIA Newsroom |
Qué mirar de cada uno
-
RTX PRO 6000 Blackwell: 6–7× más tok/s que el DGX Spark en cargas memory-bound, a más del doble de precio de la RTX PRO 5000 72 GB. Solo entra si se sube de rango de presupuesto.
-
RTX PRO 5000 72 GB: mejora su relación precio/rendimiento respecto a principios de año, porque ha bajado de precio mientras el resto subía.
-
DGX Spark: empeora su posición frente a la RTX PRO 5000 — misma familia, más caro que antes, y con un decode notablemente lento en modelos densos de 27B.
-
RTX Spark Superchip: la novedad más interesante como "nodo barato con CUDA" — misma memoria unificada que el DGX Spark y ~300 GB/s, con un precio estimado muy inferior. Pero no hay unidades reales ni precio oficial: confianza media.
-
Mac mini M5 Pro / Mac Studio M5 Ultra: sin fecha ni precio confirmados. El dato más relevante es el riesgo de que el M5 Ultra salga con ~256 GB en vez de los 768 GB teóricos por escasez de componentes.
-
Apple M6: solo MacBook Pro, sin relevancia para uso como nodo de servidor este año.
-
AMD Radeon AI PRO R9700: alternativa barata para nodos de 32 GB, con precio y benchmark ya confirmados. La incógnita no es el hardware, es la madurez de ROCm/Vulkan frente a CUDA en un flujo real con Ollama/LiteLLM.
-
Qualcomm y NPU en general: no compiten en el rango 12B–70B. El orden de lo que manda para inferencia local sigue siendo memoria > ancho de banda > GPU integrada > NPU.
-
Vera Rubin: plataforma de datacenter a escala de fábrica de IA (multi-chip, multi-nodo). Fuera del alcance de la inferencia local de bajo coste; se registra por si en el futuro derivan variantes de estación de trabajo.
Modelos open-weight
El criterio es el mismo que usa la evaluación: que quepan en equipos modestos (aprox. 12B–70B, cuantizables) y que la licencia sea open weight de verdad.
| Modelo | Tamaño / arquitectura | ¿Corre en equipo modesto? | Licencia | En qué mejora a Gemma 4 | Fuente |
|---|---|---|---|---|---|
| Qwen3.6-27B (dense) | 27B dense | Sí — Q4_K_M ~16,8 GB, cabe en una RTX 5000 Ada de 32 GB | Apache 2.0 | 78,8 en SWE-bench Verified; supera a Gemma 4 31B en coding con menos parámetros | Unsloth · BuildFastWithAI |
| Qwen3.6-35B-A3B (MoE, 3B activos) | 35B total / 3B activos | Sí — Q4_K_M ~21 GB, cabe en 24 GB | Apache 2.0 | ~240 tok/s en RTX 6000 (MTP); supera a Gemma 4 26B MoE en coding (+21 pts) y en tool-use | Hugging Face · Towards AI |
| GLM-4.7-Flash (Z.ai) (nuevo) | 30B total / ~3B activos (MoE) | Sí — misma clase que Qwen3.6-35B-A3B, cuantizable para hardware modesto | MIT | Modelo de coding de coste bajo; buena relación rendimiento/tamaño frente a Gemma 4 26B MoE. En producción desde enero de 2026, ya validado por la comunidad | Hugging Face · TokenMix |
| GPT-OSS-20B (OpenAI) | 21B total / 3,6B activos (MoE) | Sí — corre con 16 GB, pensado para edge/local | Apache 2.0 | Primera entrada de OpenAI en open-weight local; calidad ~o3-mini; nativo MXFP4, integración directa con Ollama/llama.cpp/vLLM | OpenAI · Hugging Face |
| GPT-OSS-120B (OpenAI) | 117B total / 5,1B activos (MoE) | Parcial — pensado para 1 GPU de 80 GB | Apache 2.0 | Calidad ~o4-mini; interesante solo con hardware de 80 GB+ | OpenAI |
| Ministral 3 (14B / 8B / 3B dense) | Dense, 3 tamaños | Sí, sobradamente | Apache 2.0 | Alternativa ligera a Gemma 4 12B para nodos de routing/guardrails; variantes con razonamiento y visión | Mistral AI |
| Qwen3 72B (dense) | 72B dense | Difícil — ~40–45 GB INT4; necesita RTX PRO 5000 72 GB o similar | Apache 2.0 | SOTA en razonamiento/MMLU entre open-weight <100B; supera a Gemma 4 31B | VRLA Tech |
| Llama 4 Scout | 109B total / 17B activos (MoE) | Parcial — ~55 GB INT4 | Llama Community License (restricciones >700M usuarios) | Contexto de 10M tokens, útil para RAG largo | Meta |
| DeepSeek V4 (Pro/Flash) | Pro: 1,6T / 49B activos · Flash: 284B / 13B activos (MoE) | No — sigue exigiendo cientos de GB pese a los pocos activos | MIT | 1M de contexto; 80,6 SWE-bench Verified (V4-Pro-Max) | MorphLLM |
| Mistral Large 3 | 675B total / 41B activos (MoE) | No — 690 GB en disco | Apache 2.0 | SOTA open-weight multilingüe | Mistral AI |
| GLM-5.2 (Z.ai) | 744B total / ~40B activos (MoE) | No — >1 TB en FP16, requiere multi-GPU | MIT | Contexto 1M; agentic coding SOTA open-weight | vLLM recipes |
| Kimi K2.6 (Moonshot AI) | 1T total / 32B activos (MoE) | No — 594 GB en INT4 | MIT modificada | Contexto 256K; líder open-weight en coding y agentes | Hugging Face |
| Kimi K2.7-Code (Moonshot AI) (nuevo) | 1T total / 32B activos (MoE) | No — misma escala que K2.6 | MIT modificada | Sucesor de coding de K2.6 (62,0 en Kimi Code Bench v2) | prensa especializada, jun. 2026 |
| MiniMax M2.7 | 230B total / 10B activos (MoE) | No por tamaño | Propietaria desde M2.7 — uso comercial prohibido sin autorización (M2/M2.5 sí eran Apache/MIT) | Rendimiento fuerte en agentes, pero el cambio de licencia lo saca de la categoría open weight | BigGo Finance |
| MiniMax M3 (nuevo) | ~230–428B total / 10–23B activos (MoE); las fuentes discrepan en el total | No por tamaño | Licencia propia de MiniMax, repositorio gated; permisividad real por confirmar | 1M de contexto y multimodal nativo | MiniMax |
Qué mirar de cada uno
Los tres candidatos reales para hardware modesto son Qwen3.6 (27B dense y 35B-A3B MoE), GPT-OSS-20B y GLM-4.7-Flash. Tienen licencia permisiva de verdad, benchmarks públicos y caben en hardware que ya existe, así que se pueden validar con un benchmark propio sin comprar nada. GLM-4.7-Flash es el menos obvio de los tres y el que llevaba más tiempo disponible sin que le prestáramos atención: MIT, en producción desde enero de 2026.
Qwen3 72B y Llama 4 Scout exigen ampliar el hardware a 72 GB+. Solo entran en la conversación si sube el presupuesto.
Todo lo de ≥230B parámetros totales —DeepSeek V4, Mistral Large 3, GLM-5.2, Kimi K2.6/K2.7-Code, MiniMax M2.7/M3— queda fuera de alcance para local modesto. Se listan porque son los lanzamientos que marcan el estado del arte open-weight, no porque sean candidatos: lo que importa aquí es que pocos parámetros activos no significan poca memoria en disco.
Dense vs MoE, y por qué la memoria no baja
Un modelo MoE (mixture of experts) solo activa una fracción de sus parámetros por token —3B de 35B, por ejemplo—, lo que lo hace rápido. Pero hay que cargar todos los parámetros en memoria, porque cualquier experto puede activarse en el siguiente token. De ahí que Kimi K2.6 ocupe 594 GB con "solo" 32B activos. Los parámetros activos predicen la velocidad; los totales, la memoria que necesitas.
No hay Gemma 5. Gemma 4 (abril 2025) sigue siendo la versión vigente de Google, sin anuncio de sucesor a julio de 2026.
Fuentes y fiabilidad
La confianza no es igual para todos los datos
Confianza alta — precios de mercado (RTX PRO 5000/6000, DGX Spark, R9700) y benchmarks con cifras concretas (Qwen3.6, GPT-OSS, GLM-4.7-Flash, R9700 en llama.cpp): son mediciones o precios de venta reales, con fecha.
Confianza media o baja — todo lo referente a Mac mini M5 Pro, Mac Studio M5 Ultra, Apple M6 y el precio del RTX Spark Superchip: son rumores o estimaciones de prensa especializada, sin confirmación oficial de Apple ni de NVIDIA.
- Tom's Hardware — Nvidia raises RTX Pro 6000 Blackwell pricing to $13,250 — jun. 2026. Mide: precio oficial e histórico desde el lanzamiento. Fiabilidad alta.
- GPU Poet — RTX PRO 5000 Blackwell price tracker — jun. 2026. Mide: precio medio de mercado por día (variante 72 GB). Fiabilidad alta.
- WCCFTech · Tom's Hardware — DGX Spark price hike — 2026. Mide: cambio de MSRP oficial (3.999 → 4.699 USD). Fiabilidad alta.
- ggml-org/llama.cpp Discussion #21043 — RDNA4 R9700 benchmarks — 2026. Mide: tok/s decode y prefill en Qwen3-30B-A3B Q4_K_M, backend Vulkan. Fiabilidad media-alta.
- TechPowerUp — AMD Radeon AI PRO R9700 launch pricing — 2026. Mide: MSRP confirmado (1.299 USD). Fiabilidad alta.
- Unsloth Docs — Qwen3.6 local hardware guide — 2026. Mide: tamaño GGUF por cuantización (Q4_K_M a Q8_0) para 27B y 35B-A3B. Fiabilidad alta.
- OpenAI — Introducing gpt-oss — vigente en 2026. Mide: parámetros activos, requisitos de memoria, licencia. Fiabilidad alta (fuente primaria).
- Hugging Face — GLM-4.7-Flash · TokenMix — GLM-4.7-Flash review — ene. 2026. Mide: tamaño (30B-A3B), licencia MIT, benchmarks de coding. Fiabilidad media-alta.
- Local AI Master — NPU Comparison 2026 — jun. 2026. Mide: TOPS por NPU y prioridad real de memoria frente a NPU. Fiabilidad media-alta.
- NVIDIA Newsroom — Vera Rubin platform — 2026. Documenta: arquitectura y calendario de despliegue en nube. Fiabilidad alta (fuente primaria).
- NVIDIA Newsroom — RTX Spark Superchip · Tom's Hardware — jun. 2026. Documenta: especificaciones y ventana de lanzamiento. Fiabilidad alta en especificaciones, baja en precio (estimación no oficial).
- Macworld — Mac mini M5 Pro rumors — 2026. Estima: ancho de banda (307 GB/s) y ventana de lanzamiento. Fiabilidad media.
- MacRumors · AppleInsider — M5 Ultra Mac Studio — jun. 2026. Estima: memoria máxima teórica (768 GB), riesgo de recorte por escasez, ventana ~oct. 2026. Fiabilidad media.
- 9to5Mac — Apple M6 — jun. 2026. Estima: gama de producto y ventana (Q4 2026). Fiabilidad media.
- BigGo Finance — MiniMax M2.7 license change — 2026. Documenta: cambio de licencia Apache/MIT → propietaria entre M2.5 y M2.7. Fiabilidad media-alta.
- MiniMax — Introducing M3 — 1 jun. 2026. Documenta: parámetros, contexto (1M), multimodalidad. Fiabilidad alta (fuente primaria), con discrepancia entre fuentes en el recuento total de parámetros (230B vs. 428B).
Cómo usar este documento
Al ser una foto archivada, sirve para comparar con el presente, no para citar cifras:
-
Para un dato de hoy, ve al panorama actual. Todo lo que hay aquí está congelado al 2 de julio de 2026.
-
Para decidir una compra, ve a la evaluación de hardware, que convierte estas cifras en escenarios comparables con cálculo de rendimiento del pipeline.
-
Si comparas con el panorama vigente, ten en cuenta que las marcas (nuevo) de esta copia se referían a los ~6 meses anteriores a julio de 2026, no a lo que sea reciente hoy.
El resto de fotos archivadas está en el índice de versiones anteriores.