UK’s trusted IT infrastructure partner since 2003
Servnet
FinanceToolsConfiguratorGet in Touch
Infrastructure IA

Mac Studio et LLM : performances vs serveur GPU en 2026

Servnet Editorial · Analyse d’infrastructure IT8 min de lecture
Traduction de l’article original en anglais de Servnet (Royaume-Uni). English · Deutsch · Español
Share

Apple a renouvelé le Mac Studio le 25 août 2026 avec les puces M5 Max et M5 Ultra, et le chiffre qui compte le plus pour les acheteurs de LLM locaux fait son retour : le M5 Ultra est configurable avec 512GB de mémoire unifiée, pour une bande passante mémoire de 1,2TB/s. Cela met fin à une période de disette durant laquelle, selon MacRumors, les pénuries de mémoire avaient réduit le Mac Studio M3 Ultra à une seule configuration de 96GB. Mais la capacité mémoire ne détermine que les modèles qui tiennent en mémoire. La vitesse à laquelle ils tournent, et la capacité d'une seule machine à servir toute une équipe, sont des questions distinctes, et les données publiées de tokens par seconde sont plus confuses que ne l'admettent la plupart des comparatifs.

Qwen2.5-72B Q4_K_M : inférence locale vs répartie
30tok/s23tok/s15tok/s8tok/s0tok/s28.2tok/s11.1tok/sM2 Ultra seul29.5tok/s5.9tok/sM2 Ultra + DGX Spark (RPC)Prompt (tok/s)Génération (tok/s)
View the data behind this chart
Qwen2.5-72B Q4_K_M : inférence locale vs répartie
M2 Ultra seulM2 Ultra + DGX Spark (RPC)
Prompt (tok/s)tok/s28.2tok/s29.5
Génération (tok/s)tok/s11.1tok/s5.9

Mac Studio pour les LLM : le verdict 2026

Le constat honnête sur le Mac Studio est plus restreint que ne le laisse penser le débat en ligne. Son point fort est la capacité : un seul pool de mémoire unifiée assez grand pour contenir un gros modèle quantifié sans le répartir sur plusieurs cartes GPU. Maintenant que le M5 Ultra est configurable en 256GB ou 512GB, cet argument est plus solide qu'il ne l'a été de toute l'année. Ce que les benchmarks publiés ne montrent pas encore, c'est la vitesse à laquelle les nouvelles puces exécutent les modèles de classe 70B. Les modèles M5 ne parviennent aux clients qu'à partir du 22 septembre, et aucune des sources que nous avons consultées ne contient de résultat 70B pour le M5 Ultra.

Les données plus anciennes fixent les attentes. Sur un test de génération 70B en Q4_K_M datant de mai 2024, une Nvidia H100 PCIe 80GB a produit 25,01 tok/s contre 12,13 tok/s pour un M2 Ultra doté d'un GPU 76 cœurs. Cela représente environ deux fois la vitesse de génération sur la même classe de modèles : en vitesse brute, Apple n'a donc aucune avance à défendre. Un test de mars 2026 associant un Mac Studio M2 Ultra de 128GB à un Nvidia DGX Spark via Ethernet à 10 Gbps apporte une seconde leçon : répartir un modèle entre les deux machines a accéléré le traitement du prompt mais ralenti la génération. L'intérêt du Mac repose sur sa capacité à faire tenir de gros modèles en privé sur une seule machine de bureau, et non sur le fait de devancer les GPU serveurs.

Illustration : performances LLM du Mac Studio face à un serveur GPU, la réalité en 2026

Apple Silicon vs Nvidia : le compromis architectural

L'argument d'Apple est la capacité de la mémoire unifiée : un seul pool de RAM partagé par le CPU et le GPU permet à un gros modèle quantifié de tout simplement tenir en mémoire. Selon la page britannique actuelle des caractéristiques d'Apple, le Mac Studio M5 Max démarre à 36GB et se configure en 48GB, 64GB ou 128GB ; le M5 Ultra démarre à 96GB et se configure en 256GB ou 512GB, et Apple indique que la configuration de 512GB arrivera fin octobre. Pour saisir pourquoi cela compte avant même qu'un modèle ne génère le moindre token, il est utile de lire combien de VRAM un LLM nécessite réellement et de prendre le temps de comprendre la différence entre VRAM et RAM au préalable.

La capacité détermine ce qui tient en mémoire ; la bande passante mémoire détermine en grande partie la vitesse de génération, car chaque token généré par un modèle dense implique une lecture de ses poids. Apple annonce 460GB/s pour le M5 Max à GPU 32 cœurs, 614GB/s pour le M5 Max à GPU 40 cœurs et 1,2TB/s pour le M5 Ultra, soit selon Apple 50 % de plus qu'auparavant ; Apple annonçait 819GB/s pour le M3 Ultra. Un calcul de plafond sur un coin de table rend cela concret : divisez la bande passante par la taille du modèle. Le fichier Qwen2.5-72B Q4_K_M de 44,2GB donne un plafond théorique d'environ 18 tok/s sur le M2 Ultra à 800GB/s, qui a enregistré 11,1 tok/s en pratique, et d'environ 27 tok/s sur le M5 Ultra à 1,2TB/s. Considérez cela comme une limite supérieure pour la génération mono-flux, et non comme un benchmark : les exécutions réelles se situent en dessous.

Tokens par seconde en détail : ce que montrent réellement les benchmarks

Les données Mac + Nvidia les plus détaillées proviennent d'un benchmark GitHub de mars 2026 portant sur le backend RPC de llama.cpp. Il a été exécuté sur un Mac Studio équipé d'un M2 Ultra et de 128GB de mémoire unifiée, relié en point à point via Ethernet à 10 Gbps à un DGX Spark doté de la puce Nvidia GB10 Blackwell. Sur Qwen2.5-72B-Instruct en Q4_K_M, le Mac seul a traité les prompts à 28,2 tok/s et généré à 11,1 tok/s. La répartition du modèle (30,7GB sur Metal, 13,8GB sur CUDA) a légèrement relevé le débit de prompt, à 29,5 tok/s, mais a réduit la génération à 5,9 tok/s.

C'est le test sur petit modèle du même dépôt qui a produit les chiffres les plus frappants, et ils sont faciles à mal interpréter. Sur Qwen2.5-7B-Instruct Q4_K_M, un modèle de 4,4GB et non un 70B, le Mac seul a enregistré 76,1 tok/s en prompt et 91,8 tok/s en génération, tandis que la répartition RPC a porté le débit de prompt à 317,7 tok/s et fait tomber la génération à 52,7 tok/s. Le schéma se vérifie pour les deux tailles : sur une liaison réseau, l'inférence répartie sacrifie la vitesse de génération au profit de la vitesse de prompt. La conclusion du dépôt lui-même est que l'intérêt du RPC réside dans la capacité, c'est-à-dire des modèles trop gros pour l'une ou l'autre machine seule, plutôt que dans la vitesse.

Le tableau de résultats Apple Silicon que llama.cpp tient à jour de longue date apporte une comparaison puce par puce sur le bien plus petit Llama 2 7B en Q4_0. Le M3 Ultra 60 cœurs a enregistré 1 073,09 tok/s en traitement du prompt et 88,40 tok/s en génération, le M4 Max 40 cœurs 885,68 et 83,06, et le M5 Max 40 cœurs, une option de puce qu'Apple vend également dans le nouveau Mac Studio, 3 219,99 et 119,92. Sur un modèle aussi petit, la puissance de calcul compte, et pas seulement la bande passante, ce qui explique pourquoi le M5 Max génère ici plus vite que le M3 Ultra, pourtant doté d'une bande passante supérieure. Ne voyez là qu'une indication des capacités relatives des puces ; un résultat 7B en dit peu sur les vitesses absolues en 70B.

Choisir son Mac Studio : configurations et rapport qualité-prix pour les acheteurs au Royaume-Uni

L'annonce de lancement d'Apple et le récapitulatif Mac Studio de MacRumors situent les prix de départ aux États-Unis à 2 499 $ pour le modèle M5 Max et à 5 499 $ pour le M5 Ultra, avec des précommandes ouvertes et une disponibilité à partir du 22 septembre. Nous n'avons pas vérifié les prix en livres sterling au Royaume-Uni pour cet article : consultez donc directement la boutique Apple britannique avant d'établir votre budget, car les prix locaux, le traitement de la TVA et la disponibilité des configurations évoluent indépendamment des chiffres américains.

Pour les modèles de classe 70B, le palier de mémoire compte davantage que le nom de la puce. Le fichier Qwen2.5-72B Q4_K_M du benchmark ci-dessus pèse 44,2GB avant tout chargement de contexte : un M5 Max de 64GB laisse donc une marge limitée pour macOS, les longs prompts et le cache KV. Le M5 Max de 128GB et le M5 Ultra, à partir de 96GB, sont les points de départ réalistes, et la bande passante de 1,2TB/s du M5 Ultra devrait l'avantager en vitesse de génération sur le même modèle. Les paliers M5 Ultra de 256GB et 512GB sont destinés aux modèles qui ne tiennent tout simplement pas sur des machines plus petites. Ce plafond de 512GB est celui sur lequel Apple s'est appuyé en mars 2025 pour affirmer qu'un Mac Studio M3 Ultra pouvait exécuter des LLM de plus de 600 milliards de paramètres entièrement en mémoire. La disponibilité est la réserve pratique : la configuration de 512GB n'est pas attendue avant fin octobre, et les pénuries de mémoire ont déjà fait disparaître une fois cette année les paliers de mémoire les plus élevés, si bien qu'il faut confirmer les délais de livraison avant de bâtir votre plan sur ces configurations.

Exemple concret : faire tourner un modèle 70B, et la pile logicielle qui compte

Pour un modèle de classe 70B quantifié en Q4_K_M sur un Mac Studio de 96GB ou plus, les étapes pratiques sont les suivantes : choisir un runtime, récupérer un checkpoint pré-quantifié au format GGUF ou MLX, le charger, et laisser suffisamment de marge de mémoire unifiée au-delà des poids du modèle pour le contexte et la charge système avant de commencer à lui soumettre de longs prompts.

Le runtime choisi change réellement le résultat, mais la meilleure comparaison de runtimes publiée que nous ayons trouvée n'est pas un test 70B. Le compte rendu de Famstack de mars 2026 a soumis Qwen3 30B-A3B, un modèle à mélange d'experts, à une charge de travail d'agent d'exploitation en huit tours sur un MacBook Pro équipé d'un M1 Max et de 64GB, en mesurant des tok/s effectifs, qui prennent en compte le traitement du prompt en plus de la génération. Avec des poids GGUF sur le moteur llama.cpp, LM Studio a atteint 41,7, llama.cpp compilé depuis les sources 41,4 et Ollama 26,0, soit 37 % plus lent que LM Studio sur le même moteur. Sur le moteur MLX, oMLX est arrivé en tête avec 38,0, tandis que le mode MLX de LM Studio a atteint 17,0. La leçon pratique pour un acheteur au Royaume-Uni est que la surcouche logicielle peut compter autant que le moteur : mesurez donc les performances de votre propre modèle, de votre quantification et de votre charge de travail sur votre propre machine avant de standardiser sur l'un d'eux.

Tok/s effectifs par runtime : Qwen3 30B-A3B sur M1 Max
50tok/s38tok/s25tok/s13tok/s0tok/s41.7tok/sLM Studio41.4tok/sllama.cpp38tok/soMLX26tok/sOllamaTok/s effectifs
View the data behind this chart
Tok/s effectifs par runtime : Qwen3 30B-A3B sur M1 Max
LM Studiollama.cppoMLXOllama
Tok/s effectifstok/s41.7tok/s41.4tok/s38tok/s26

Consommation, bruit et l'écart de TCO que personne ne publie encore

C'est ici que l'honnêteté compte davantage qu'un chiffre avancé avec aplomb. Les données actuelles ne contiennent aucun chiffre vérifié de consommation en watts, de coût d'électricité ou de bruit de ventilation, ni pour le Mac Studio ni pour une station de travail GPU Nvidia comparable exécutant de l'inférence LLM en continu. Tout tableur de TCO fondé sur des chiffres de consommation inventés est pire que pas de tableur du tout.

Les équipes au Royaume-Uni peuvent en revanche structurer correctement la comparaison avant de demander des chiffres à un fournisseur : le prix d'achat, la valeur de revente attendue et le coût d'exploitation sont trois lignes distinctes, et la ligne du coût d'exploitation nécessite une consommation soutenue sous charge LLM chiffrée par le fournisseur (et non une valeur au repos ou de crête tirée d'une fiche technique), multipliée par votre tarif d'électricité réel au Royaume-Uni. Avant d'engager un budget, prenez le temps de consulter le dernier indice des coûts des serveurs d'IA pour disposer de références de coût de serveurs GPU auxquelles confronter, ligne par ligne, un devis de Mac Studio.

Mac Studio vs serveur GPU : quand le local a vraiment du sens

Les arguments en faveur d'un Mac Studio sont limités mais réels : un opérateur unique exécutant en privé un gros modèle quantifié, sans besoin d'utilisateurs simultanés, de batching ni d'outils propres à CUDA. Les paliers de 256GB et 512GB du M5 Ultra permettent à une seule machine de bureau de contenir des modèles qui exigeraient autrement plusieurs cartes GPU discrètes, et les données publiées montrent que même l'ancien M2 Ultra génère de 11,1 à 12,13 tok/s sur des modèles de classe 70B, ce qui reste exploitable pour une personne qui lit et écrit en parallèle.

Les arguments contre, ce sont tous les usages qui dépassent un seul utilisateur. Les données d'inférence répartie en RPC montrent que la génération ralentit lorsque l'on combine du matériel Mac et Nvidia pour gagner en capacité, et la comparaison H100 contre M2 Ultra montre qu'un GPU serveur génère environ deux fois plus de tokens par seconde sur la même classe de modèles 70B. Si votre charge de travail exige du batching, du fine-tuning ou plusieurs flux d'inférence simultanés, faites la comparaison dans les règles : comparez l'auto-hébergement de LLM et le coût des GPU cloud et utilisez notre calculateur GPU pour l'IA pour dimensionner l'alternative avant de vous engager dans l'une ou l'autre voie.

Pérennité : ce qu'il faut prendre en compte avant d'acheter en 2026

Les fluctuations d'approvisionnement de cette année constituent la leçon en matière de pérennité. En mai 2026, MacRumors a rapporté qu'Apple avait réduit le Mac Studio M3 Ultra à une seule configuration de 96GB à mesure que les pénuries de mémoire s'aggravaient ; le renouvellement du 25 août a réintroduit les options de 256GB et 512GB avec le M5 Ultra. Les paliers de mémoire peuvent disparaître puis revenir au gré de l'approvisionnement : si votre plan repose sur le M5 Ultra de 512GB, qui selon Apple arrivera fin octobre, traitez donc sa disponibilité comme un risque à gérer plutôt que comme un acquis.

Pour les équipes au Royaume-Uni qui s'attendent à voir leurs besoins en modèles croître (fenêtres de contexte plus larges, nombre de paramètres plus élevé, services multi-utilisateurs), la voie CUDA reste la plus évolutive, tout simplement parce que la mutualisation de la VRAM, le batching et les outils de fine-tuning sont conçus autour d'elle plutôt qu'adaptés après coup. Avant de supposer que la voie Mac, en apparence moins chère, le restera une fois vos besoins modifiés, consultez notre comparatif des serveurs GPU d'IA pour 2026.

Sources

Chaque chiffre de cet article renvoie aux sources ci-dessous.

Génération Llama 2 7B Q4_0 par puce Apple
120tok/s90tok/s60tok/s30tok/s0tok/s83.06tok/sM4 Max GPU 40 cœurs88.4tok/sM3 Ultra GPU 60 cœurs119.92tok/sM5 Max GPU 40 cœursGénération (tok/s)
View the data behind this chart
Génération Llama 2 7B Q4_0 par puce Apple
M4 Max GPU 40 cœursM3 Ultra GPU 60 cœursM5 Max GPU 40 cœurs
Génération (tok/s)tok/s83.06tok/s88.4tok/s119.92
Share
À retenir
  • Le renouvellement d'Apple du 25 août 2026 a rétabli les options du Mac Studio à forte capacité mémoire : le M5 Max est configurable jusqu'à 128GB et le M5 Ultra en 256GB ou 512GB, la configuration de 512GB étant attendue fin octobre.
  • Le chiffre de génération de 91,8 tok/s du Mac Studio relevé dans un benchmark RPC de llama.cpp provient d'un modèle 7B, et non d'un 70B ; sur Qwen2.5-72B Q4_K_M, le même M2 Ultra a généré 11,1 tok/s seul et 5,9 tok/s en répartition avec un DGX Spark via 10GbE.
  • Nvidia conserve l'avantage en vitesse brute : une H100 PCIe 80GB a généré 25,01 tok/s sur Llama 3 70B Q4_K_M, contre 12,13 tok/s pour un M2 Ultra, soit environ deux fois plus vite.
  • Le choix du runtime compte autant que le matériel : dans un test de charge de travail d'agent sur Apple Silicon, LM Studio et llama.cpp ont obtenu 41,7 et 41,4 tok/s effectifs, oMLX 38,0 et Ollama 26,0, mesurez donc sur votre propre configuration plutôt que de vous fier à la réputation d'un seul runtime.
  • Nous n'avons trouvé aucune valeur vérifiée de consommation ou de bruit pour l'une ou l'autre plateforme sous charge LLM continue, ni encore aucun benchmark 70B publié pour le M5 Ultra : accueillez donc tout chiffre de TCO ou de vitesse du M5 cité ailleurs avec le même scepticisme que celui que vous réserveriez à un benchmark non sourcé.
Questions fréquentes

FAQMac Studio et LLM

Quelle configuration de Mac Studio choisir pour exécuter des LLM de 70B paramètres et plus en 2026 ?

Commencez par la mémoire. Le fichier Qwen2.5-72B Q4_K_M utilisé dans un benchmark publié pèse 44,2GB avant contexte : visez donc le M5 Max de 128GB ou le M5 Ultra (à partir de 96GB) plutôt qu'une machine de 64GB. La bande passante mémoire de 1,2TB/s du M5 Ultra, contre 614GB/s pour le M5 Max le plus rapide, devrait l'avantager en vitesse de génération ; les paliers de 256GB et 512GB sont destinés aux modèles qui ne tiennent pas dans des configurations plus petites.

Un Mac Studio peut-il vraiment exécuter un modèle de 600 milliards de paramètres ?

Apple a affirmé en mars 2025 qu'un Mac Studio M3 Ultra doté de 512GB de mémoire unifiée pouvait exécuter des LLM de plus de 600 milliards de paramètres entièrement en mémoire. Le M5 Ultra renoue avec ce plafond de 512GB, mais Apple indique que cette configuration ne sera pas disponible avant fin octobre 2026, et le fait qu'un modèle tienne en mémoire ne dit rien de la vitesse à laquelle il génère.

Mac Studio ou serveur GPU Nvidia : lequel est le plus rapide pour l'inférence LLM 70B ?

D'après les données publiées, le GPU serveur Nvidia. Une H100 PCIe 80GB a généré 25,01 tok/s sur Llama 3 70B Q4_K_M contre 12,13 tok/s pour un M2 Ultra. Nous n'avons pas encore trouvé de benchmark 70B publié pour le M5 Ultra ; sa bande passante de 1,2TB/s implique un plafond théorique d'environ 27 tok/s sur un modèle de classe 72B de 44,2GB, et les exécutions réelles se situent en dessous de tels plafonds.

Quelle pile logicielle est la plus performante sur Mac Studio : Ollama, MLX ou llama.cpp ?

Cela dépend du modèle et de la charge de travail. Dans le test de charge de travail d'agent publié par Famstack en mars 2026 avec Qwen3 30B-A3B sur un M1 Max, LM Studio (41,7 tok/s effectifs) et llama.cpp (41,4) sont arrivés en tête, oMLX, basé sur MLX, a atteint 38,0 et Ollama 26,0. Mesurez les performances de votre propre modèle et de votre quantification avant de choisir.

Répartir l'inférence entre un Mac Studio et un GPU Nvidia est-il vraiment utile ?

Cela aide le traitement du prompt mais pénalise la génération. Dans un test RPC de llama.cpp de mars 2026 associant un Mac Studio M2 Ultra à un DGX Spark via Ethernet à 10 Gbps, la répartition de Qwen2.5-7B Q4_K_M a fait passer le débit de prompt de 76,1 à 317,7 tok/s mais a réduit la génération de 91,8 à 52,7 tok/s ; sur Qwen2.5-72B, la génération est tombée de 11,1 à 5,9 tok/s.

Une entreprise au Royaume-Uni devrait-elle exploiter un service LLM partagé sur un Mac Studio ?

Les données de benchmark publiées portent sur l'inférence mono-flux, et non sur le débit multi-utilisateurs simultané, le batching ou le fine-tuning, domaines dans lesquels les GPU serveurs basés sur CUDA sont conçus pour monter en charge. Le Mac Studio convient mieux à un usage mono-opérateur limité par la mémoire qu'à un service de production partagé.

Pour aller plus loin

Une question à laquelle cet article ne répond pas ?

Un échange avec un ingénieur qui l’a déjà fait. Sans discours commercial. À noter : notre équipe travaille uniquement en anglais.

Nous contacter en anglais →

Talk to a UK specialist

Get expert advice or a no-obligation quote — servers, storage, networking, maintenance, finance and cloud. We reply the same working day.

or call 0800 987 4111