Apple a renouvelé le Mac Studio le 25 août 2026 avec les puces M5 Max et M5 Ultra, et le chiffre qui compte le plus pour les acheteurs de LLM locaux fait son retour : le M5 Ultra est configurable avec 512GB de mémoire unifiée, pour une bande passante mémoire de 1,2TB/s. Cela met fin à une période de disette durant laquelle, selon MacRumors, les pénuries de mémoire avaient réduit le Mac Studio M3 Ultra à une seule configuration de 96GB. Mais la capacité mémoire ne détermine que les modèles qui tiennent en mémoire. La vitesse à laquelle ils tournent, et la capacité d'une seule machine à servir toute une équipe, sont des questions distinctes, et les données publiées de tokens par seconde sont plus confuses que ne l'admettent la plupart des comparatifs.
View the data behind this chart
| M2 Ultra seul | M2 Ultra + DGX Spark (RPC) | |
|---|---|---|
| Prompt (tok/s) | tok/s28.2 | tok/s29.5 |
| Génération (tok/s) | tok/s11.1 | tok/s5.9 |
Mac Studio pour les LLM : le verdict 2026
Le constat honnête sur le Mac Studio est plus restreint que ne le laisse penser le débat en ligne. Son point fort est la capacité : un seul pool de mémoire unifiée assez grand pour contenir un gros modèle quantifié sans le répartir sur plusieurs cartes GPU. Maintenant que le M5 Ultra est configurable en 256GB ou 512GB, cet argument est plus solide qu'il ne l'a été de toute l'année. Ce que les benchmarks publiés ne montrent pas encore, c'est la vitesse à laquelle les nouvelles puces exécutent les modèles de classe 70B. Les modèles M5 ne parviennent aux clients qu'à partir du 22 septembre, et aucune des sources que nous avons consultées ne contient de résultat 70B pour le M5 Ultra.
Les données plus anciennes fixent les attentes. Sur un test de génération 70B en Q4_K_M datant de mai 2024, une Nvidia H100 PCIe 80GB a produit 25,01 tok/s contre 12,13 tok/s pour un M2 Ultra doté d'un GPU 76 cœurs. Cela représente environ deux fois la vitesse de génération sur la même classe de modèles : en vitesse brute, Apple n'a donc aucune avance à défendre. Un test de mars 2026 associant un Mac Studio M2 Ultra de 128GB à un Nvidia DGX Spark via Ethernet à 10 Gbps apporte une seconde leçon : répartir un modèle entre les deux machines a accéléré le traitement du prompt mais ralenti la génération. L'intérêt du Mac repose sur sa capacité à faire tenir de gros modèles en privé sur une seule machine de bureau, et non sur le fait de devancer les GPU serveurs.

Apple Silicon vs Nvidia : le compromis architectural
L'argument d'Apple est la capacité de la mémoire unifiée : un seul pool de RAM partagé par le CPU et le GPU permet à un gros modèle quantifié de tout simplement tenir en mémoire. Selon la page britannique actuelle des caractéristiques d'Apple, le Mac Studio M5 Max démarre à 36GB et se configure en 48GB, 64GB ou 128GB ; le M5 Ultra démarre à 96GB et se configure en 256GB ou 512GB, et Apple indique que la configuration de 512GB arrivera fin octobre. Pour saisir pourquoi cela compte avant même qu'un modèle ne génère le moindre token, il est utile de lire combien de VRAM un LLM nécessite réellement et de prendre le temps de comprendre la différence entre VRAM et RAM au préalable.
La capacité détermine ce qui tient en mémoire ; la bande passante mémoire détermine en grande partie la vitesse de génération, car chaque token généré par un modèle dense implique une lecture de ses poids. Apple annonce 460GB/s pour le M5 Max à GPU 32 cœurs, 614GB/s pour le M5 Max à GPU 40 cœurs et 1,2TB/s pour le M5 Ultra, soit selon Apple 50 % de plus qu'auparavant ; Apple annonçait 819GB/s pour le M3 Ultra. Un calcul de plafond sur un coin de table rend cela concret : divisez la bande passante par la taille du modèle. Le fichier Qwen2.5-72B Q4_K_M de 44,2GB donne un plafond théorique d'environ 18 tok/s sur le M2 Ultra à 800GB/s, qui a enregistré 11,1 tok/s en pratique, et d'environ 27 tok/s sur le M5 Ultra à 1,2TB/s. Considérez cela comme une limite supérieure pour la génération mono-flux, et non comme un benchmark : les exécutions réelles se situent en dessous.
Tokens par seconde en détail : ce que montrent réellement les benchmarks
Les données Mac + Nvidia les plus détaillées proviennent d'un benchmark GitHub de mars 2026 portant sur le backend RPC de llama.cpp. Il a été exécuté sur un Mac Studio équipé d'un M2 Ultra et de 128GB de mémoire unifiée, relié en point à point via Ethernet à 10 Gbps à un DGX Spark doté de la puce Nvidia GB10 Blackwell. Sur Qwen2.5-72B-Instruct en Q4_K_M, le Mac seul a traité les prompts à 28,2 tok/s et généré à 11,1 tok/s. La répartition du modèle (30,7GB sur Metal, 13,8GB sur CUDA) a légèrement relevé le débit de prompt, à 29,5 tok/s, mais a réduit la génération à 5,9 tok/s.
C'est le test sur petit modèle du même dépôt qui a produit les chiffres les plus frappants, et ils sont faciles à mal interpréter. Sur Qwen2.5-7B-Instruct Q4_K_M, un modèle de 4,4GB et non un 70B, le Mac seul a enregistré 76,1 tok/s en prompt et 91,8 tok/s en génération, tandis que la répartition RPC a porté le débit de prompt à 317,7 tok/s et fait tomber la génération à 52,7 tok/s. Le schéma se vérifie pour les deux tailles : sur une liaison réseau, l'inférence répartie sacrifie la vitesse de génération au profit de la vitesse de prompt. La conclusion du dépôt lui-même est que l'intérêt du RPC réside dans la capacité, c'est-à-dire des modèles trop gros pour l'une ou l'autre machine seule, plutôt que dans la vitesse.
Le tableau de résultats Apple Silicon que llama.cpp tient à jour de longue date apporte une comparaison puce par puce sur le bien plus petit Llama 2 7B en Q4_0. Le M3 Ultra 60 cœurs a enregistré 1 073,09 tok/s en traitement du prompt et 88,40 tok/s en génération, le M4 Max 40 cœurs 885,68 et 83,06, et le M5 Max 40 cœurs, une option de puce qu'Apple vend également dans le nouveau Mac Studio, 3 219,99 et 119,92. Sur un modèle aussi petit, la puissance de calcul compte, et pas seulement la bande passante, ce qui explique pourquoi le M5 Max génère ici plus vite que le M3 Ultra, pourtant doté d'une bande passante supérieure. Ne voyez là qu'une indication des capacités relatives des puces ; un résultat 7B en dit peu sur les vitesses absolues en 70B.
Choisir son Mac Studio : configurations et rapport qualité-prix pour les acheteurs au Royaume-Uni
L'annonce de lancement d'Apple et le récapitulatif Mac Studio de MacRumors situent les prix de départ aux États-Unis à 2 499 $ pour le modèle M5 Max et à 5 499 $ pour le M5 Ultra, avec des précommandes ouvertes et une disponibilité à partir du 22 septembre. Nous n'avons pas vérifié les prix en livres sterling au Royaume-Uni pour cet article : consultez donc directement la boutique Apple britannique avant d'établir votre budget, car les prix locaux, le traitement de la TVA et la disponibilité des configurations évoluent indépendamment des chiffres américains.
Pour les modèles de classe 70B, le palier de mémoire compte davantage que le nom de la puce. Le fichier Qwen2.5-72B Q4_K_M du benchmark ci-dessus pèse 44,2GB avant tout chargement de contexte : un M5 Max de 64GB laisse donc une marge limitée pour macOS, les longs prompts et le cache KV. Le M5 Max de 128GB et le M5 Ultra, à partir de 96GB, sont les points de départ réalistes, et la bande passante de 1,2TB/s du M5 Ultra devrait l'avantager en vitesse de génération sur le même modèle. Les paliers M5 Ultra de 256GB et 512GB sont destinés aux modèles qui ne tiennent tout simplement pas sur des machines plus petites. Ce plafond de 512GB est celui sur lequel Apple s'est appuyé en mars 2025 pour affirmer qu'un Mac Studio M3 Ultra pouvait exécuter des LLM de plus de 600 milliards de paramètres entièrement en mémoire. La disponibilité est la réserve pratique : la configuration de 512GB n'est pas attendue avant fin octobre, et les pénuries de mémoire ont déjà fait disparaître une fois cette année les paliers de mémoire les plus élevés, si bien qu'il faut confirmer les délais de livraison avant de bâtir votre plan sur ces configurations.
Exemple concret : faire tourner un modèle 70B, et la pile logicielle qui compte
Pour un modèle de classe 70B quantifié en Q4_K_M sur un Mac Studio de 96GB ou plus, les étapes pratiques sont les suivantes : choisir un runtime, récupérer un checkpoint pré-quantifié au format GGUF ou MLX, le charger, et laisser suffisamment de marge de mémoire unifiée au-delà des poids du modèle pour le contexte et la charge système avant de commencer à lui soumettre de longs prompts.
Le runtime choisi change réellement le résultat, mais la meilleure comparaison de runtimes publiée que nous ayons trouvée n'est pas un test 70B. Le compte rendu de Famstack de mars 2026 a soumis Qwen3 30B-A3B, un modèle à mélange d'experts, à une charge de travail d'agent d'exploitation en huit tours sur un MacBook Pro équipé d'un M1 Max et de 64GB, en mesurant des tok/s effectifs, qui prennent en compte le traitement du prompt en plus de la génération. Avec des poids GGUF sur le moteur llama.cpp, LM Studio a atteint 41,7, llama.cpp compilé depuis les sources 41,4 et Ollama 26,0, soit 37 % plus lent que LM Studio sur le même moteur. Sur le moteur MLX, oMLX est arrivé en tête avec 38,0, tandis que le mode MLX de LM Studio a atteint 17,0. La leçon pratique pour un acheteur au Royaume-Uni est que la surcouche logicielle peut compter autant que le moteur : mesurez donc les performances de votre propre modèle, de votre quantification et de votre charge de travail sur votre propre machine avant de standardiser sur l'un d'eux.
View the data behind this chart
| LM Studio | llama.cpp | oMLX | Ollama | |
|---|---|---|---|---|
| Tok/s effectifs | tok/s41.7 | tok/s41.4 | tok/s38 | tok/s26 |
Consommation, bruit et l'écart de TCO que personne ne publie encore
C'est ici que l'honnêteté compte davantage qu'un chiffre avancé avec aplomb. Les données actuelles ne contiennent aucun chiffre vérifié de consommation en watts, de coût d'électricité ou de bruit de ventilation, ni pour le Mac Studio ni pour une station de travail GPU Nvidia comparable exécutant de l'inférence LLM en continu. Tout tableur de TCO fondé sur des chiffres de consommation inventés est pire que pas de tableur du tout.
Les équipes au Royaume-Uni peuvent en revanche structurer correctement la comparaison avant de demander des chiffres à un fournisseur : le prix d'achat, la valeur de revente attendue et le coût d'exploitation sont trois lignes distinctes, et la ligne du coût d'exploitation nécessite une consommation soutenue sous charge LLM chiffrée par le fournisseur (et non une valeur au repos ou de crête tirée d'une fiche technique), multipliée par votre tarif d'électricité réel au Royaume-Uni. Avant d'engager un budget, prenez le temps de consulter le dernier indice des coûts des serveurs d'IA pour disposer de références de coût de serveurs GPU auxquelles confronter, ligne par ligne, un devis de Mac Studio.
Mac Studio vs serveur GPU : quand le local a vraiment du sens
Les arguments en faveur d'un Mac Studio sont limités mais réels : un opérateur unique exécutant en privé un gros modèle quantifié, sans besoin d'utilisateurs simultanés, de batching ni d'outils propres à CUDA. Les paliers de 256GB et 512GB du M5 Ultra permettent à une seule machine de bureau de contenir des modèles qui exigeraient autrement plusieurs cartes GPU discrètes, et les données publiées montrent que même l'ancien M2 Ultra génère de 11,1 à 12,13 tok/s sur des modèles de classe 70B, ce qui reste exploitable pour une personne qui lit et écrit en parallèle.
Les arguments contre, ce sont tous les usages qui dépassent un seul utilisateur. Les données d'inférence répartie en RPC montrent que la génération ralentit lorsque l'on combine du matériel Mac et Nvidia pour gagner en capacité, et la comparaison H100 contre M2 Ultra montre qu'un GPU serveur génère environ deux fois plus de tokens par seconde sur la même classe de modèles 70B. Si votre charge de travail exige du batching, du fine-tuning ou plusieurs flux d'inférence simultanés, faites la comparaison dans les règles : comparez l'auto-hébergement de LLM et le coût des GPU cloud et utilisez notre calculateur GPU pour l'IA pour dimensionner l'alternative avant de vous engager dans l'une ou l'autre voie.
Pérennité : ce qu'il faut prendre en compte avant d'acheter en 2026
Les fluctuations d'approvisionnement de cette année constituent la leçon en matière de pérennité. En mai 2026, MacRumors a rapporté qu'Apple avait réduit le Mac Studio M3 Ultra à une seule configuration de 96GB à mesure que les pénuries de mémoire s'aggravaient ; le renouvellement du 25 août a réintroduit les options de 256GB et 512GB avec le M5 Ultra. Les paliers de mémoire peuvent disparaître puis revenir au gré de l'approvisionnement : si votre plan repose sur le M5 Ultra de 512GB, qui selon Apple arrivera fin octobre, traitez donc sa disponibilité comme un risque à gérer plutôt que comme un acquis.
Pour les équipes au Royaume-Uni qui s'attendent à voir leurs besoins en modèles croître (fenêtres de contexte plus larges, nombre de paramètres plus élevé, services multi-utilisateurs), la voie CUDA reste la plus évolutive, tout simplement parce que la mutualisation de la VRAM, le batching et les outils de fine-tuning sont conçus autour d'elle plutôt qu'adaptés après coup. Avant de supposer que la voie Mac, en apparence moins chère, le restera une fois vos besoins modifiés, consultez notre comparatif des serveurs GPU d'IA pour 2026.
Sources
Chaque chiffre de cet article renvoie aux sources ci-dessous.
- •Apple — Mac Studio technical specifications (UK) : mémoire et bande passante des M5 Max et M5 Ultra
- •Apple Newsroom — Apple introduces new Mac Studio with M5 Max and M5 Ultra (25 août 2026)
- •MacRumors — Mac Studio roundup : date de lancement, calendrier de la configuration 512GB et prix aux États-Unis (août 2026)
- •MacRumors — Apple cuts more Mac Studio and Mac mini RAM options as memory shortage worsens (5 mai 2026)
- •Apple Newsroom — Mac Studio with M3 Ultra launch : affirmations sur les 512GB et les 600B+ paramètres (mars 2025)
- •Apple Newsroom — Apple introduces M2 Ultra : bande passante mémoire de 800GB/s (juin 2023)
- •GitHub — llama.cpp distributed inference benchmarks : Mac Studio M2 Ultra + DGX Spark via 10GbE (mars 2026)
- •GitHub — GPU benchmarks on LLM inference : H100 et M2 Ultra sur Llama 3 70B (instantané de mai 2024)
- •GitHub — Performance of llama.cpp on Apple Silicon M-series : tableau de résultats Llama 2 7B
- •Famstack — GGUF vs MLX on Apple Silicon, part 2 : comparaison de runtimes (mars 2026)
- •eCorpIT — Local LLM on Apple Silicon vs cloud API break-even : bande passante du M3 Ultra (août 2026)
View the data behind this chart
| M4 Max GPU 40 cœurs | M3 Ultra GPU 60 cœurs | M5 Max GPU 40 cœurs | |
|---|---|---|---|
| Génération (tok/s) | tok/s83.06 | tok/s88.4 | tok/s119.92 |
