Apple renovó el Mac Studio el 25 de agosto de 2026 con los chips M5 Max y M5 Ultra, y ha vuelto la cifra que más importa a quienes buscan una máquina para LLM en local: el M5 Ultra puede configurarse con 512 GB de memoria unificada y 1,2 TB/s de ancho de banda de memoria. Así termina una etapa de recortes en la que, según MacRumors, la escasez de memoria había reducido el Mac Studio con M3 Ultra a una única configuración de 96 GB. Pero la capacidad de memoria solo decide qué modelos caben. La velocidad a la que se ejecutan, y si una sola máquina puede dar servicio a un equipo, son cuestiones distintas, y los datos publicados de tokens por segundo son más confusos de lo que admiten la mayoría de las comparativas.
View the data behind this chart
| M2 Ultra por sí solo | M2 Ultra + DGX Spark (RPC) | |
|---|---|---|
| tok/s de prompt | tok/s28.2 | tok/s29.5 |
| tok/s de generación | tok/s11.1 | tok/s5.9 |
Mac Studio para LLM: el veredicto de 2026
La lectura honesta sobre el Mac Studio es más acotada de lo que sugiere el debate en internet. Su punto fuerte es la capacidad: un único bloque de memoria unificada lo bastante grande como para alojar un modelo cuantizado grande sin repartirlo entre varias tarjetas GPU. Ahora que el M5 Ultra puede configurarse con 256 GB o 512 GB, ese argumento es más sólido que en cualquier otro momento del año. Lo que los benchmarks publicados aún no muestran es a qué velocidad ejecutan los nuevos chips los modelos de clase 70B. Los modelos M5 no llegan a los clientes hasta el 22 de septiembre, y ninguna de las fuentes que hemos consultado incluye un resultado de 70B con el M5 Ultra.
Los datos anteriores sirven para ajustar las expectativas. En una prueba de generación con 70B Q4_K_M de mayo de 2024, una Nvidia H100 PCIe 80 GB produjo 25,01 tok/s frente a los 12,13 tok/s de un M2 Ultra con GPU de 76 núcleos. Es aproximadamente el doble de velocidad de generación con la misma clase de modelo, así que, en velocidad bruta, Apple no tiene ninguna ventaja que defender. Una prueba de marzo de 2026 que combinó un Mac Studio M2 Ultra de 128 GB con una Nvidia DGX Spark mediante Ethernet de 10 Gbps aporta una segunda lección: repartir un modelo entre las dos máquinas aceleró el procesamiento del prompt, pero ralentizó la generación. El argumento a favor del Mac se basa en poder alojar modelos grandes de forma privada en una sola máquina de escritorio, no en superar en velocidad a las GPU de servidor.

Apple Silicon frente a Nvidia: el compromiso arquitectónico
El argumento de Apple es la capacidad de la memoria unificada: un único bloque de RAM compartido por la CPU y la GPU permite que un modelo cuantizado grande simplemente quepa. Según la página de especificaciones actual de Apple para el Reino Unido, el Mac Studio M5 Max parte de 36 GB y puede configurarse con 48 GB, 64 GB o 128 GB; el M5 Ultra parte de 96 GB y puede configurarse con 256 GB o 512 GB, y Apple indica que la configuración de 512 GB llegará a finales de octubre. Si quieres entender por qué esto importa antes de que un modelo genere un solo token, merece la pena informarse sobre cuánta VRAM necesita realmente un LLM y dedicar tiempo a entender la diferencia entre VRAM y RAM para empezar.
La capacidad decide qué cabe; el ancho de banda de memoria determina en gran medida la velocidad de generación, porque cada token que genera un modelo denso implica leer sus pesos. Apple indica 460 GB/s para el M5 Max con GPU de 32 núcleos, 614 GB/s para el M5 Max con GPU de 40 núcleos y 1,2 TB/s para el M5 Ultra, lo que según Apple supone un 50 por ciento más que antes; para el M3 Ultra, Apple indicaba 819 GB/s. Un cálculo aproximado del techo lo hace más concreto: divide el ancho de banda entre el tamaño del modelo. El archivo Qwen2.5-72B Q4_K_M de 44,2 GB da un techo teórico de unos 18 tok/s en el M2 Ultra de 800 GB/s, que en la práctica registró 11,1 tok/s, y de unos 27 tok/s en el M5 Ultra de 1,2 TB/s. Tómalo como un límite superior para la generación de flujo único, no como un benchmark: las ejecuciones reales quedan por debajo.
Tokens por segundo a fondo: lo que muestran realmente los benchmarks
Los datos más detallados sobre la combinación de Mac y Nvidia proceden de un benchmark publicado en GitHub en marzo de 2026 sobre el backend RPC de llama.cpp. Se ejecutó en un Mac Studio con M2 Ultra y 128 GB de memoria unificada, conectado punto a punto mediante Ethernet de 10 Gbps a una DGX Spark con el chip GB10 Blackwell de Nvidia. Con Qwen2.5-72B-Instruct en Q4_K_M, el Mac por sí solo procesó prompts a 28,2 tok/s y generó a 11,1 tok/s. Repartir el modelo (30,7 GB en Metal, 13,8 GB en CUDA) elevó ligeramente el rendimiento del prompt hasta 29,5 tok/s, pero redujo la generación a 5,9 tok/s.
La prueba con un modelo pequeño del mismo repositorio arrojó las cifras más llamativas, y es fácil malinterpretarlas. Con Qwen2.5-7B-Instruct Q4_K_M, un modelo de 4,4 GB y no uno de 70B, el Mac por sí solo registró 76,1 tok/s de prompt y 91,8 tok/s de generación, mientras que la división RPC elevó el rendimiento del prompt a 317,7 tok/s y redujo la generación a 52,7 tok/s. El patrón se mantiene con ambos tamaños: a través de un enlace de red, la inferencia dividida sacrifica velocidad de generación a cambio de velocidad de prompt. La propia conclusión del repositorio es que el valor de RPC está en la capacidad, es decir, en modelos demasiado grandes para cualquiera de las dos máquinas por separado, y no en la velocidad.
La veterana tabla de resultados de llama.cpp para Apple Silicon añade una comparación entre chips con el mucho más pequeño Llama 2 7B en Q4_0. El M3 Ultra de 60 núcleos registró 1073,09 tok/s de procesamiento del prompt y 88,40 tok/s de generación; el M4 Max de 40 núcleos, 885,68 y 83,06, y el M5 Max de 40 núcleos, una opción de chip que Apple también vende en el nuevo Mac Studio, 3219,99 y 119,92. Con un modelo tan pequeño, la capacidad de cómputo importa además del ancho de banda, y por eso aquí el M5 Max genera más que el M3 Ultra, que tiene más ancho de banda. Interprétalas únicamente como capacidad relativa de los chips; un resultado de 7B dice poco sobre las velocidades absolutas con 70B.
Cómo elegir tu Mac Studio: configuraciones y relación calidad-precio para compradores del Reino Unido
El anuncio de lanzamiento de Apple y el resumen del Mac Studio de MacRumors sitúan los precios de partida en EE. UU. en 2499 $ para el modelo M5 Max y 5499 $ para el M5 Ultra, con los pedidos anticipados ya abiertos y disponibilidad a partir del 22 de septiembre. No hemos verificado el precio en libras esterlinas para el Reino Unido en este artículo, así que consulta directamente la tienda de Apple del Reino Unido antes de presupuestar: el precio local, el tratamiento del IVA y la disponibilidad de configuraciones varían con independencia de las cifras estadounidenses.
Para modelos de clase 70B, el nivel de memoria importa más que la denominación del chip. El archivo Qwen2.5-72B Q4_K_M del benchmark anterior ocupa 44,2 GB antes de cargar ningún contexto, así que un M5 Max de 64 GB deja un margen limitado para macOS, los prompts largos y la caché KV. El M5 Max de 128 GB y el M5 Ultra, desde 96 GB, son los puntos de partida realistas, y el ancho de banda de 1,2 TB/s del M5 Ultra debería darle ventaja en velocidad de generación con el mismo modelo. Los niveles de 256 GB y 512 GB del M5 Ultra son para modelos que directamente no caben en máquinas más pequeñas. Ese techo de 512 GB es el que Apple utilizó en marzo de 2025 para afirmar que un Mac Studio con M3 Ultra podía ejecutar LLM de más de 600 mil millones de parámetros íntegramente en memoria. La disponibilidad es la salvedad práctica: la configuración de 512 GB no llegará hasta finales de octubre, y la escasez de memoria ya ha hecho desaparecer una vez este año los niveles de memoria más altos, así que confirma los plazos de entrega antes de planificar en torno a ellos.
Ejemplo práctico: poner en marcha un modelo de 70B y la pila de software que importa
Para un modelo de clase 70B con cuantización Q4_K_M en un Mac Studio de 96 GB o más, los pasos prácticos son: elegir un runtime, descargar un checkpoint precuantizado en formato GGUF o MLX, cargarlo y dejar suficiente margen de memoria unificada por encima de los pesos del modelo para el contexto y la sobrecarga del sistema antes de empezar a introducir prompts largos.
El runtime que elijas cambia de verdad el resultado, pero la mejor comparación de runtimes publicada que hemos encontrado no es una prueba de 70B. El análisis de Famstack de marzo de 2026 ejecutó Qwen3 30B-A3B, un modelo de mezcla de expertos, con una carga de trabajo de agente de operaciones de ocho turnos en un MacBook Pro con M1 Max y 64 GB, midiendo los tok/s efectivos, que tienen en cuenta tanto el procesamiento del prompt como la generación. Con pesos GGUF sobre el motor llama.cpp, LM Studio logró 41,7, llama.cpp compilado desde el código fuente 41,4 y Ollama 26,0, es decir, un 37 % más lento que LM Studio con el mismo motor. Con el motor MLX, oMLX fue el primero con 38,0, mientras que el modo MLX de LM Studio logró 17,0. La lección práctica para un comprador del Reino Unido es que la aplicación que envuelve el motor puede importar tanto como el propio motor, así que mide tu propio modelo, tu cuantización y tu carga de trabajo en tu propia máquina antes de estandarizar en una.
View the data behind this chart
| LM Studio | llama.cpp | oMLX | Ollama | |
|---|---|---|---|---|
| tok/s efectivos | tok/s41.7 | tok/s41.4 | tok/s38 | tok/s26 |
Consumo, ruido y la brecha de TCO que nadie publica todavía
Aquí la honestidad importa más que una cifra que suene convincente. En los datos actuales no hay ninguna cifra verificada de consumo en vatios, coste eléctrico o ruido de ventiladores ni para el Mac Studio ni para una estación de trabajo GPU de Nvidia comparable ejecutando inferencia de LLM de forma continua. Cualquier hoja de cálculo de TCO construida sobre cifras de consumo inventadas es peor que no tener ninguna.
Lo que sí pueden hacer los equipos del Reino Unido es estructurar bien la comparación antes de pedir cifras a un proveedor: precio de compra, valor de reventa previsto y coste de funcionamiento son tres partidas separadas, y la del coste de funcionamiento necesita un consumo sostenido bajo carga de LLM facilitado por el proveedor (no una cifra de ficha técnica en reposo o de pico) multiplicado por tu tarifa eléctrica real en el Reino Unido. Antes de comprometer presupuesto, merece la pena revisar el último índice de costes de servidores de IA para obtener referencias de coste de servidores GPU con las que contrastar, partida por partida, un presupuesto de Mac Studio.
Mac Studio frente a servidor GPU: cuándo tiene sentido realmente lo local
Los argumentos a favor de un Mac Studio son limitados pero reales: un único usuario que ejecuta un modelo cuantizado grande de forma privada, sin necesidad de usuarios concurrentes, batching ni herramientas específicas de CUDA. Los niveles de 256 GB y 512 GB del M5 Ultra permiten que una sola máquina de escritorio aloje modelos que de otro modo necesitarían varias tarjetas GPU discretas, y los datos publicados muestran que incluso el antiguo M2 Ultra genera entre 11,1 y 12,13 tok/s con modelos de clase 70B, lo que resulta viable para una persona que lee y escribe mientras trabaja con él.
Los argumentos en contra son todo lo que escala más allá de un usuario. Los datos de inferencia dividida por RPC muestran que la generación se ralentiza cuando se combina hardware de Mac y de Nvidia para ganar capacidad, y la comparación entre H100 y M2 Ultra muestra que una GPU de servidor genera aproximadamente el doble de tokens por segundo con la misma clase de modelo de 70B. Si tu carga de trabajo necesita batching, fine-tuning o varios flujos de inferencia concurrentes, haz bien la comparación: compara el coste de alojar LLM en local con el de las GPU en la nube y usa nuestra calculadora de GPU para IA para dimensionar la alternativa antes de comprometerte con cualquiera de las dos vías.
Preparación para el futuro: qué tener en cuenta antes de comprar en 2026
Los vaivenes del suministro de este año son la lección de cara al futuro. En mayo de 2026, MacRumors informó de que Apple había reducido el Mac Studio con M3 Ultra a una única configuración de 96 GB a medida que se agravaba la escasez de memoria; la renovación del 25 de agosto recuperó las opciones de 256 GB y 512 GB con el M5 Ultra. Los niveles de memoria pueden desaparecer y volver en función del suministro, así que, si tu plan depende del M5 Ultra de 512 GB, que según Apple llegará a finales de octubre, trata la disponibilidad como un riesgo que hay que gestionar y no como algo garantizado.
Para los equipos del Reino Unido que prevean que sus necesidades de modelos crecerán (ventanas de contexto más amplias, más parámetros, servicios multiusuario), la vía CUDA sigue siendo la más ampliable, sencillamente porque la agregación de VRAM, el batching y las herramientas de fine-tuning están construidos en torno a ella y no adaptados a posteriori. Antes de dar por hecho que la vía Mac, aparentemente más barata, seguirá siéndolo cuando cambien tus requisitos, consulta nuestra comparativa de servidores GPU para IA de 2026.
Fuentes
Todas las cifras de este artículo proceden de las fuentes siguientes.
- •Apple — Mac Studio technical specifications (UK): memoria y ancho de banda del M5 Max y el M5 Ultra
- •Apple Newsroom — Apple introduces new Mac Studio with M5 Max and M5 Ultra (25 ago. 2026)
- •MacRumors — Mac Studio roundup: fecha de lanzamiento, calendario de la configuración de 512 GB y precios en EE. UU. (ago. 2026)
- •MacRumors — Apple cuts more Mac Studio and Mac mini RAM options as memory shortage worsens (5 may. 2026)
- •Apple Newsroom — Mac Studio with M3 Ultra launch: afirmaciones sobre 512 GB y 600B+ parámetros (mar. 2025)
- •Apple Newsroom — Apple introduces M2 Ultra: ancho de banda de memoria de 800 GB/s (jun. 2023)
- •GitHub — llama.cpp distributed inference benchmarks: Mac Studio M2 Ultra + DGX Spark mediante 10GbE (mar. 2026)
- •GitHub — GPU benchmarks on LLM inference: H100 y M2 Ultra con Llama 3 70B (instantánea de mayo de 2024)
- •GitHub — Performance of llama.cpp on Apple Silicon M-series: tabla de resultados de Llama 2 7B
- •Famstack — GGUF vs MLX on Apple Silicon, part 2: comparativa de runtimes (mar. 2026)
- •eCorpIT — Local LLM on Apple Silicon vs cloud API break-even: ancho de banda del M3 Ultra (ago. 2026)
View the data behind this chart
| M4 Max, GPU de 40 núcleos | M3 Ultra, GPU de 60 núcleos | M5 Max, GPU de 40 núcleos | |
|---|---|---|---|
| tok/s de generación | tok/s83.06 | tok/s88.4 | tok/s119.92 |
