UK’s trusted IT infrastructure partner since 2003
Servnet
FinanceToolsConfiguratorGet in Touch
Infraestructura de IA

Mac Studio LLM: rendimiento real vs servidor GPU en 2026

Servnet Editorial · Análisis de infraestructura TI8 min de lectura
Traducción del artículo original en inglés de Servnet (Reino Unido). English · Deutsch · Français
Share

Apple renovó el Mac Studio el 25 de agosto de 2026 con los chips M5 Max y M5 Ultra, y ha vuelto la cifra que más importa a quienes buscan una máquina para LLM en local: el M5 Ultra puede configurarse con 512 GB de memoria unificada y 1,2 TB/s de ancho de banda de memoria. Así termina una etapa de recortes en la que, según MacRumors, la escasez de memoria había reducido el Mac Studio con M3 Ultra a una única configuración de 96 GB. Pero la capacidad de memoria solo decide qué modelos caben. La velocidad a la que se ejecutan, y si una sola máquina puede dar servicio a un equipo, son cuestiones distintas, y los datos publicados de tokens por segundo son más confusos de lo que admiten la mayoría de las comparativas.

Qwen2.5-72B Q4_K_M: inferencia local frente a dividida
30tok/s23tok/s15tok/s8tok/s0tok/s28.2tok/s11.1tok/sM2 Ultra por sí solo29.5tok/s5.9tok/sM2 Ultra + DGX Spark (RPC)tok/s de prompttok/s de generación
View the data behind this chart
Qwen2.5-72B Q4_K_M: inferencia local frente a dividida
M2 Ultra por sí soloM2 Ultra + DGX Spark (RPC)
tok/s de prompttok/s28.2tok/s29.5
tok/s de generacióntok/s11.1tok/s5.9

Mac Studio para LLM: el veredicto de 2026

La lectura honesta sobre el Mac Studio es más acotada de lo que sugiere el debate en internet. Su punto fuerte es la capacidad: un único bloque de memoria unificada lo bastante grande como para alojar un modelo cuantizado grande sin repartirlo entre varias tarjetas GPU. Ahora que el M5 Ultra puede configurarse con 256 GB o 512 GB, ese argumento es más sólido que en cualquier otro momento del año. Lo que los benchmarks publicados aún no muestran es a qué velocidad ejecutan los nuevos chips los modelos de clase 70B. Los modelos M5 no llegan a los clientes hasta el 22 de septiembre, y ninguna de las fuentes que hemos consultado incluye un resultado de 70B con el M5 Ultra.

Los datos anteriores sirven para ajustar las expectativas. En una prueba de generación con 70B Q4_K_M de mayo de 2024, una Nvidia H100 PCIe 80 GB produjo 25,01 tok/s frente a los 12,13 tok/s de un M2 Ultra con GPU de 76 núcleos. Es aproximadamente el doble de velocidad de generación con la misma clase de modelo, así que, en velocidad bruta, Apple no tiene ninguna ventaja que defender. Una prueba de marzo de 2026 que combinó un Mac Studio M2 Ultra de 128 GB con una Nvidia DGX Spark mediante Ethernet de 10 Gbps aporta una segunda lección: repartir un modelo entre las dos máquinas aceleró el procesamiento del prompt, pero ralentizó la generación. El argumento a favor del Mac se basa en poder alojar modelos grandes de forma privada en una sola máquina de escritorio, no en superar en velocidad a las GPU de servidor.

Ilustración: Mac Studio LLM: rendimiento real vs servidor GPU en 2026

Apple Silicon frente a Nvidia: el compromiso arquitectónico

El argumento de Apple es la capacidad de la memoria unificada: un único bloque de RAM compartido por la CPU y la GPU permite que un modelo cuantizado grande simplemente quepa. Según la página de especificaciones actual de Apple para el Reino Unido, el Mac Studio M5 Max parte de 36 GB y puede configurarse con 48 GB, 64 GB o 128 GB; el M5 Ultra parte de 96 GB y puede configurarse con 256 GB o 512 GB, y Apple indica que la configuración de 512 GB llegará a finales de octubre. Si quieres entender por qué esto importa antes de que un modelo genere un solo token, merece la pena informarse sobre cuánta VRAM necesita realmente un LLM y dedicar tiempo a entender la diferencia entre VRAM y RAM para empezar.

La capacidad decide qué cabe; el ancho de banda de memoria determina en gran medida la velocidad de generación, porque cada token que genera un modelo denso implica leer sus pesos. Apple indica 460 GB/s para el M5 Max con GPU de 32 núcleos, 614 GB/s para el M5 Max con GPU de 40 núcleos y 1,2 TB/s para el M5 Ultra, lo que según Apple supone un 50 por ciento más que antes; para el M3 Ultra, Apple indicaba 819 GB/s. Un cálculo aproximado del techo lo hace más concreto: divide el ancho de banda entre el tamaño del modelo. El archivo Qwen2.5-72B Q4_K_M de 44,2 GB da un techo teórico de unos 18 tok/s en el M2 Ultra de 800 GB/s, que en la práctica registró 11,1 tok/s, y de unos 27 tok/s en el M5 Ultra de 1,2 TB/s. Tómalo como un límite superior para la generación de flujo único, no como un benchmark: las ejecuciones reales quedan por debajo.

Tokens por segundo a fondo: lo que muestran realmente los benchmarks

Los datos más detallados sobre la combinación de Mac y Nvidia proceden de un benchmark publicado en GitHub en marzo de 2026 sobre el backend RPC de llama.cpp. Se ejecutó en un Mac Studio con M2 Ultra y 128 GB de memoria unificada, conectado punto a punto mediante Ethernet de 10 Gbps a una DGX Spark con el chip GB10 Blackwell de Nvidia. Con Qwen2.5-72B-Instruct en Q4_K_M, el Mac por sí solo procesó prompts a 28,2 tok/s y generó a 11,1 tok/s. Repartir el modelo (30,7 GB en Metal, 13,8 GB en CUDA) elevó ligeramente el rendimiento del prompt hasta 29,5 tok/s, pero redujo la generación a 5,9 tok/s.

La prueba con un modelo pequeño del mismo repositorio arrojó las cifras más llamativas, y es fácil malinterpretarlas. Con Qwen2.5-7B-Instruct Q4_K_M, un modelo de 4,4 GB y no uno de 70B, el Mac por sí solo registró 76,1 tok/s de prompt y 91,8 tok/s de generación, mientras que la división RPC elevó el rendimiento del prompt a 317,7 tok/s y redujo la generación a 52,7 tok/s. El patrón se mantiene con ambos tamaños: a través de un enlace de red, la inferencia dividida sacrifica velocidad de generación a cambio de velocidad de prompt. La propia conclusión del repositorio es que el valor de RPC está en la capacidad, es decir, en modelos demasiado grandes para cualquiera de las dos máquinas por separado, y no en la velocidad.

La veterana tabla de resultados de llama.cpp para Apple Silicon añade una comparación entre chips con el mucho más pequeño Llama 2 7B en Q4_0. El M3 Ultra de 60 núcleos registró 1073,09 tok/s de procesamiento del prompt y 88,40 tok/s de generación; el M4 Max de 40 núcleos, 885,68 y 83,06, y el M5 Max de 40 núcleos, una opción de chip que Apple también vende en el nuevo Mac Studio, 3219,99 y 119,92. Con un modelo tan pequeño, la capacidad de cómputo importa además del ancho de banda, y por eso aquí el M5 Max genera más que el M3 Ultra, que tiene más ancho de banda. Interprétalas únicamente como capacidad relativa de los chips; un resultado de 7B dice poco sobre las velocidades absolutas con 70B.

Cómo elegir tu Mac Studio: configuraciones y relación calidad-precio para compradores del Reino Unido

El anuncio de lanzamiento de Apple y el resumen del Mac Studio de MacRumors sitúan los precios de partida en EE. UU. en 2499 $ para el modelo M5 Max y 5499 $ para el M5 Ultra, con los pedidos anticipados ya abiertos y disponibilidad a partir del 22 de septiembre. No hemos verificado el precio en libras esterlinas para el Reino Unido en este artículo, así que consulta directamente la tienda de Apple del Reino Unido antes de presupuestar: el precio local, el tratamiento del IVA y la disponibilidad de configuraciones varían con independencia de las cifras estadounidenses.

Para modelos de clase 70B, el nivel de memoria importa más que la denominación del chip. El archivo Qwen2.5-72B Q4_K_M del benchmark anterior ocupa 44,2 GB antes de cargar ningún contexto, así que un M5 Max de 64 GB deja un margen limitado para macOS, los prompts largos y la caché KV. El M5 Max de 128 GB y el M5 Ultra, desde 96 GB, son los puntos de partida realistas, y el ancho de banda de 1,2 TB/s del M5 Ultra debería darle ventaja en velocidad de generación con el mismo modelo. Los niveles de 256 GB y 512 GB del M5 Ultra son para modelos que directamente no caben en máquinas más pequeñas. Ese techo de 512 GB es el que Apple utilizó en marzo de 2025 para afirmar que un Mac Studio con M3 Ultra podía ejecutar LLM de más de 600 mil millones de parámetros íntegramente en memoria. La disponibilidad es la salvedad práctica: la configuración de 512 GB no llegará hasta finales de octubre, y la escasez de memoria ya ha hecho desaparecer una vez este año los niveles de memoria más altos, así que confirma los plazos de entrega antes de planificar en torno a ellos.

Ejemplo práctico: poner en marcha un modelo de 70B y la pila de software que importa

Para un modelo de clase 70B con cuantización Q4_K_M en un Mac Studio de 96 GB o más, los pasos prácticos son: elegir un runtime, descargar un checkpoint precuantizado en formato GGUF o MLX, cargarlo y dejar suficiente margen de memoria unificada por encima de los pesos del modelo para el contexto y la sobrecarga del sistema antes de empezar a introducir prompts largos.

El runtime que elijas cambia de verdad el resultado, pero la mejor comparación de runtimes publicada que hemos encontrado no es una prueba de 70B. El análisis de Famstack de marzo de 2026 ejecutó Qwen3 30B-A3B, un modelo de mezcla de expertos, con una carga de trabajo de agente de operaciones de ocho turnos en un MacBook Pro con M1 Max y 64 GB, midiendo los tok/s efectivos, que tienen en cuenta tanto el procesamiento del prompt como la generación. Con pesos GGUF sobre el motor llama.cpp, LM Studio logró 41,7, llama.cpp compilado desde el código fuente 41,4 y Ollama 26,0, es decir, un 37 % más lento que LM Studio con el mismo motor. Con el motor MLX, oMLX fue el primero con 38,0, mientras que el modo MLX de LM Studio logró 17,0. La lección práctica para un comprador del Reino Unido es que la aplicación que envuelve el motor puede importar tanto como el propio motor, así que mide tu propio modelo, tu cuantización y tu carga de trabajo en tu propia máquina antes de estandarizar en una.

tok/s efectivos por runtime: Qwen3 30B-A3B en M1 Max
50tok/s38tok/s25tok/s13tok/s0tok/s41.7tok/sLM Studio41.4tok/sllama.cpp38tok/soMLX26tok/sOllamatok/s efectivos
View the data behind this chart
tok/s efectivos por runtime: Qwen3 30B-A3B en M1 Max
LM Studiollama.cppoMLXOllama
tok/s efectivostok/s41.7tok/s41.4tok/s38tok/s26

Consumo, ruido y la brecha de TCO que nadie publica todavía

Aquí la honestidad importa más que una cifra que suene convincente. En los datos actuales no hay ninguna cifra verificada de consumo en vatios, coste eléctrico o ruido de ventiladores ni para el Mac Studio ni para una estación de trabajo GPU de Nvidia comparable ejecutando inferencia de LLM de forma continua. Cualquier hoja de cálculo de TCO construida sobre cifras de consumo inventadas es peor que no tener ninguna.

Lo que sí pueden hacer los equipos del Reino Unido es estructurar bien la comparación antes de pedir cifras a un proveedor: precio de compra, valor de reventa previsto y coste de funcionamiento son tres partidas separadas, y la del coste de funcionamiento necesita un consumo sostenido bajo carga de LLM facilitado por el proveedor (no una cifra de ficha técnica en reposo o de pico) multiplicado por tu tarifa eléctrica real en el Reino Unido. Antes de comprometer presupuesto, merece la pena revisar el último índice de costes de servidores de IA para obtener referencias de coste de servidores GPU con las que contrastar, partida por partida, un presupuesto de Mac Studio.

Mac Studio frente a servidor GPU: cuándo tiene sentido realmente lo local

Los argumentos a favor de un Mac Studio son limitados pero reales: un único usuario que ejecuta un modelo cuantizado grande de forma privada, sin necesidad de usuarios concurrentes, batching ni herramientas específicas de CUDA. Los niveles de 256 GB y 512 GB del M5 Ultra permiten que una sola máquina de escritorio aloje modelos que de otro modo necesitarían varias tarjetas GPU discretas, y los datos publicados muestran que incluso el antiguo M2 Ultra genera entre 11,1 y 12,13 tok/s con modelos de clase 70B, lo que resulta viable para una persona que lee y escribe mientras trabaja con él.

Los argumentos en contra son todo lo que escala más allá de un usuario. Los datos de inferencia dividida por RPC muestran que la generación se ralentiza cuando se combina hardware de Mac y de Nvidia para ganar capacidad, y la comparación entre H100 y M2 Ultra muestra que una GPU de servidor genera aproximadamente el doble de tokens por segundo con la misma clase de modelo de 70B. Si tu carga de trabajo necesita batching, fine-tuning o varios flujos de inferencia concurrentes, haz bien la comparación: compara el coste de alojar LLM en local con el de las GPU en la nube y usa nuestra calculadora de GPU para IA para dimensionar la alternativa antes de comprometerte con cualquiera de las dos vías.

Preparación para el futuro: qué tener en cuenta antes de comprar en 2026

Los vaivenes del suministro de este año son la lección de cara al futuro. En mayo de 2026, MacRumors informó de que Apple había reducido el Mac Studio con M3 Ultra a una única configuración de 96 GB a medida que se agravaba la escasez de memoria; la renovación del 25 de agosto recuperó las opciones de 256 GB y 512 GB con el M5 Ultra. Los niveles de memoria pueden desaparecer y volver en función del suministro, así que, si tu plan depende del M5 Ultra de 512 GB, que según Apple llegará a finales de octubre, trata la disponibilidad como un riesgo que hay que gestionar y no como algo garantizado.

Para los equipos del Reino Unido que prevean que sus necesidades de modelos crecerán (ventanas de contexto más amplias, más parámetros, servicios multiusuario), la vía CUDA sigue siendo la más ampliable, sencillamente porque la agregación de VRAM, el batching y las herramientas de fine-tuning están construidos en torno a ella y no adaptados a posteriori. Antes de dar por hecho que la vía Mac, aparentemente más barata, seguirá siéndolo cuando cambien tus requisitos, consulta nuestra comparativa de servidores GPU para IA de 2026.

Fuentes

Todas las cifras de este artículo proceden de las fuentes siguientes.

Generación de Llama 2 7B Q4_0 por chip de Apple
120tok/s90tok/s60tok/s30tok/s0tok/s83.06tok/sM4 Max, GPU de 40 núcleos88.4tok/sM3 Ultra, GPU de 60 núcleos119.92tok/sM5 Max, GPU de 40 núcleostok/s de generación
View the data behind this chart
Generación de Llama 2 7B Q4_0 por chip de Apple
M4 Max, GPU de 40 núcleosM3 Ultra, GPU de 60 núcleosM5 Max, GPU de 40 núcleos
tok/s de generacióntok/s83.06tok/s88.4tok/s119.92
Share
Conclusiones clave
  • La renovación de Apple del 25 de agosto de 2026 recuperó las opciones de Mac Studio con mucha memoria: el M5 Max puede configurarse con hasta 128 GB y el M5 Ultra con 256 GB o 512 GB, y la configuración de 512 GB está prevista para finales de octubre.
  • La cifra de generación de 91,8 tok/s del Mac Studio en un benchmark RPC de llama.cpp procede de un modelo de 7B, no de uno de 70B; con Qwen2.5-72B Q4_K_M, el mismo M2 Ultra generó 11,1 tok/s por sí solo y 5,9 tok/s al repartir el modelo con una DGX Spark mediante 10GbE.
  • Nvidia mantiene la ventaja en velocidad bruta: una H100 PCIe 80 GB generó a 25,01 tok/s con Llama 3 70B Q4_K_M, frente a los 12,13 tok/s de un M2 Ultra, aproximadamente el doble de rápido.
  • La elección del runtime importa tanto como el hardware: en una prueba con una carga de trabajo de agente en Apple Silicon, LM Studio y llama.cpp obtuvieron 41,7 y 41,4 tok/s efectivos, oMLX 38,0 y Ollama 26,0, así que mide en tu propia configuración en lugar de fiarte de la reputación de un único runtime.
  • No hemos encontrado ninguna cifra verificada de consumo en vatios ni de ruido para ninguna de las dos plataformas bajo carga continua de LLM, ni tampoco ningún benchmark publicado de 70B para el M5 Ultra por ahora, así que trata cualquier cifra de TCO o de velocidad del M5 que veas citada en otros sitios con el mismo escepticismo que aplicarías a un benchmark sin fuente.
Preguntas frecuentes

Preguntas frecuentesMac Studio LLM

¿Qué configuración de Mac Studio es la mejor para ejecutar LLM de 70B o más parámetros en 2026?

Empieza por la memoria. El archivo Qwen2.5-72B Q4_K_M utilizado en un benchmark publicado ocupa 44,2 GB antes del contexto, así que fíjate en el M5 Max de 128 GB o en el M5 Ultra (desde 96 GB) en lugar de en una máquina de 64 GB. El ancho de banda de memoria de 1,2 TB/s del M5 Ultra, frente a los 614 GB/s del M5 Max más rápido, debería darle ventaja en velocidad de generación; los niveles de 256 GB y 512 GB son para modelos que no caben en configuraciones más pequeñas.

¿Puede un Mac Studio ejecutar de verdad un modelo de 600 mil millones de parámetros?

Apple afirmó en marzo de 2025 que un Mac Studio con M3 Ultra y 512 GB de memoria unificada podía ejecutar LLM de más de 600 mil millones de parámetros íntegramente en memoria. El M5 Ultra recupera ese techo de 512 GB, pero Apple indica que esa configuración no estará disponible hasta finales de octubre de 2026, y que un modelo quepa en memoria no dice nada sobre la velocidad a la que genera.

¿Qué es más rápido para inferencia de LLM de 70B: un Mac Studio o un servidor GPU de Nvidia?

Según los datos publicados, la GPU de servidor de Nvidia. Una H100 PCIe 80 GB generó 25,01 tok/s con Llama 3 70B Q4_K_M frente a los 12,13 tok/s de un M2 Ultra. Todavía no hemos encontrado ningún benchmark publicado de 70B para el M5 Ultra; su ancho de banda de 1,2 TB/s implica un techo teórico de unos 27 tok/s con un modelo de clase 72B de 44,2 GB, y las ejecuciones reales quedan por debajo de esos techos.

¿Qué pila de software rinde mejor en un Mac Studio: Ollama, MLX o llama.cpp?

Depende del modelo y de la carga de trabajo. En la prueba de Famstack de marzo de 2026 con una carga de trabajo de agente, que ejecutó Qwen3 30B-A3B en un M1 Max, LM Studio (41,7 tok/s efectivos) y llama.cpp (41,4) fueron en cabeza, oMLX, basado en MLX, logró 38,0 y Ollama 26,0. Mide tu propio modelo y tu propia cuantización antes de elegir.

¿Sirve de algo repartir la inferencia entre un Mac Studio y una GPU de Nvidia?

Ayuda al procesamiento del prompt, pero perjudica a la generación. En una prueba RPC de llama.cpp de marzo de 2026 que combinó un Mac Studio M2 Ultra con una DGX Spark mediante Ethernet de 10 Gbps, repartir Qwen2.5-7B Q4_K_M elevó el rendimiento del prompt de 76,1 a 317,7 tok/s, pero redujo la generación de 91,8 a 52,7 tok/s; con Qwen2.5-72B, la generación cayó de 11,1 a 5,9 tok/s.

¿Debería una empresa del Reino Unido ejecutar un servicio de LLM compartido en un Mac Studio?

Los datos de benchmarks publicados cubren la inferencia de flujo único, no el rendimiento concurrente multiusuario, el batching ni el fine-tuning, que son precisamente las áreas en las que las GPU de servidor basadas en CUDA están diseñadas para escalar. El Mac Studio encaja mejor en un caso de uso de un solo usuario limitado por la memoria que en un servicio de producción compartido.

Relacionado

¿Tienes una pregunta que este artículo no responde?

Una conversación con un ingeniero que ya lo ha hecho. Sin guion comercial. Ten en cuenta que nuestro equipo solo atiende en inglés.

Contactar en inglés →

Talk to a UK specialist

Get expert advice or a no-obligation quote — servers, storage, networking, maintenance, finance and cloud. We reply the same working day.

or call 0800 987 4111