Apple hat den Mac Studio am 25. August 2026 mit den Chips M5 Max und M5 Ultra aktualisiert, und die Zahl, auf die es Käufern für lokale LLMs am meisten ankommt, ist zurück: Der M5 Ultra lässt sich mit 512 GB Unified Memory konfigurieren und bietet eine Speicherbandbreite von 1,2 TB/s. Damit endet eine magere Phase, in der Speicherknappheit laut MacRumors den Mac Studio mit M3 Ultra auf eine einzige Konfiguration mit 96 GB reduziert hatte. Die Speicherkapazität entscheidet aber nur darüber, welche Modelle hineinpassen. Wie schnell sie laufen und ob ein einzelnes Gerät ein ganzes Team bedienen kann, sind getrennte Fragen – und die veröffentlichten Daten zu Tokens pro Sekunde sind unübersichtlicher, als die meisten Vergleiche zugeben.
View the data behind this chart
| M2 Ultra allein | M2 Ultra + DGX Spark (RPC) | |
|---|---|---|
| Prompt tok/s | tok/s28.2 | tok/s29.5 |
| Generierung tok/s | tok/s11.1 | tok/s5.9 |
Mac Studio für LLMs: Das Fazit 2026
Die ehrliche Einschätzung des Mac Studio fällt eingeschränkter aus, als die Debatte im Netz vermuten lässt. Seine Stärke ist die Kapazität: ein einziger Pool aus Unified Memory, groß genug, um ein großes quantisiertes Modell aufzunehmen, ohne es auf mehrere GPU-Karten aufzuteilen. Da sich der M5 Ultra nun mit 256 GB oder 512 GB konfigurieren lässt, ist dieses Argument so stark wie das ganze Jahr über nicht. Was die veröffentlichten Benchmarks noch nicht zeigen, ist, wie schnell die neuen Chips Modelle der 70B-Klasse ausführen. Die M5-Modelle erreichen Kunden erst ab dem 22. September, und keine der von uns geprüften Quellen enthält ein 70B-Ergebnis für den M5 Ultra.
Die älteren Daten stecken die Erwartungen ab. In einem Generierungstest mit 70B in Q4_K_M vom Mai 2024 erreichte eine Nvidia H100 PCIe 80GB 25,01 tok/s, gegenüber 12,13 tok/s bei einem M2 Ultra mit 76-Kern-GPU. Das ist bei derselben Modellklasse rund die doppelte Generierungsgeschwindigkeit – bei der reinen Geschwindigkeit hat Apple also keinen Vorsprung zu verteidigen. Ein Test vom März 2026, der einen Mac Studio mit M2 Ultra und 128 GB über 10-Gbps-Ethernet mit einem Nvidia DGX Spark koppelte, liefert eine zweite Lehre: Die Aufteilung eines Modells auf beide Maschinen beschleunigte das Prompt Processing, verlangsamte aber die Generierung. Das Argument für den Mac beruht darauf, große Modelle privat auf einem einzigen Desktop-Rechner unterzubringen, nicht darauf, Server-GPUs an Geschwindigkeit zu übertreffen.

Apple Silicon vs. Nvidia: Der architektonische Zielkonflikt
Apples Argument ist die Kapazität des Unified Memory: Ein gemeinsamer RAM-Pool für CPU und GPU bedeutet, dass ein großes quantisiertes Modell einfach hineinpasst. Laut Apples aktueller britischer Spezifikationsseite startet der Mac Studio mit M5 Max bei 36 GB und lässt sich auf 48 GB, 64 GB oder 128 GB konfigurieren; der M5 Ultra startet bei 96 GB und lässt sich auf 256 GB oder 512 GB konfigurieren, wobei die Konfiguration mit 512 GB laut Apple Ende Oktober verfügbar wird. Wer verstehen möchte, warum das schon wichtig ist, bevor ein Modell auch nur ein einziges Token generiert, sollte nachlesen, wie viel VRAM ein LLM wirklich braucht, und sich zunächst die Zeit nehmen, den Unterschied zwischen VRAM und RAM zu verstehen.
Die Kapazität entscheidet, was hineinpasst; die Speicherbandbreite entscheidet weitgehend über die Generierungsgeschwindigkeit, weil für jedes Token, das ein dichtes Modell generiert, seine Gewichte gelesen werden müssen. Apple nennt 460 GB/s für den M5 Max mit 32-Kern-GPU, 614 GB/s für den M5 Max mit 40-Kern-GPU und 1,2 TB/s für den M5 Ultra, was laut Apple 50 Prozent mehr ist als zuvor; für den M3 Ultra gab Apple 819 GB/s an. Eine überschlägige Obergrenze macht das greifbar: Bandbreite geteilt durch Modellgröße. Die 44,2 GB große Datei von Qwen2.5-72B in Q4_K_M ergibt auf dem M2 Ultra mit 800 GB/s eine theoretische Obergrenze von etwa 18 tok/s – in der Praxis wurden dort 11,1 tok/s gemessen – und auf dem M5 Ultra mit 1,2 TB/s von etwa 27 tok/s. Verstehen Sie das als Obergrenze für die Single-Stream-Generierung, nicht als Benchmark: Reale Läufe liegen darunter.
Tokens pro Sekunde im Detail: Was die Benchmarks tatsächlich zeigen
Die detailliertesten Daten zur Kombination aus Mac und Nvidia stammen aus einem GitHub-Benchmark vom März 2026 zum RPC-Backend von llama.cpp. Er lief auf einem Mac Studio mit M2 Ultra und 128 GB Unified Memory, der über eine Punkt-zu-Punkt-Verbindung mit 10-Gbps-Ethernet an einen DGX Spark mit Nvidias Chip GB10 Blackwell angebunden war. Bei Qwen2.5-72B-Instruct in Q4_K_M verarbeitete der Mac allein Prompts mit 28,2 tok/s und generierte mit 11,1 tok/s. Die Aufteilung des Modells (30,7 GB auf Metal, 13,8 GB auf CUDA) hob den Prompt-Durchsatz leicht auf 29,5 tok/s an, senkte die Generierung aber auf 5,9 tok/s.
Der Test mit einem kleinen Modell aus demselben Repository lieferte die auffälligen Zahlen, und diese werden leicht falsch gelesen. Bei Qwen2.5-7B-Instruct in Q4_K_M, einem 4,4 GB großen Modell statt eines 70B-Modells, erreichte der Mac allein 76,1 tok/s beim Prompt Processing und 91,8 tok/s bei der Generierung, während die RPC-Aufteilung den Prompt-Durchsatz auf 317,7 tok/s steigerte und die Generierung auf 52,7 tok/s senkte. Das Muster gilt bei beiden Größen: Über eine Netzwerkverbindung tauscht verteilte Inferenz Generierungsgeschwindigkeit gegen Prompt-Geschwindigkeit. Das eigene Fazit des Repositorys lautet, dass der Wert von RPC in der Kapazität liegt – also in Modellen, die für jede der beiden Maschinen allein zu groß sind –, nicht in der Geschwindigkeit.
Die seit Langem gepflegte Ergebnistabelle von llama.cpp für Apple Silicon ergänzt einen Chip-zu-Chip-Vergleich mit dem deutlich kleineren Llama 2 7B in Q4_0. Der M3 Ultra mit 60 Kernen erreichte 1.073,09 tok/s beim Prompt Processing und 88,40 tok/s bei der Generierung, der M4 Max mit 40 Kernen 885,68 und 83,06 und der M5 Max mit 40 Kernen – eine Chipoption, die Apple auch im neuen Mac Studio verkauft – 3.219,99 und 119,92. Bei einem so kleinen Modell zählt neben der Bandbreite auch die Rechenleistung, weshalb der M5 Max hier schneller generiert als der M3 Ultra mit seiner höheren Bandbreite. Lesen Sie diese Werte nur als Hinweis auf die relative Chip-Leistung; ein 7B-Ergebnis sagt wenig über absolute Geschwindigkeiten bei 70B aus.
Die passende Mac-Studio-Konfiguration: Ausstattung und Preis-Leistung für britische Käufer
Apples Launch-Ankündigung und die Mac-Studio-Übersicht von MacRumors nennen als US-Einstiegspreise 2.499 US-Dollar für das Modell mit M5 Max und 5.499 US-Dollar für den M5 Ultra; Vorbestellungen sind möglich, die Verfügbarkeit beginnt am 22. September. Britische Preise in Pfund Sterling haben wir für diesen Artikel nicht verifiziert – prüfen Sie daher vor der Budgetplanung direkt den britischen Apple Store, da sich lokale Preise, die Behandlung der Mehrwertsteuer und die Verfügbarkeit von Konfigurationen unabhängig von den US-Zahlen ändern.
Bei Modellen der 70B-Klasse ist die Speicherstufe wichtiger als die Chip-Bezeichnung. Die Datei von Qwen2.5-72B in Q4_K_M aus dem obigen Benchmark ist 44,2 GB groß, bevor überhaupt Kontext geladen ist, sodass ein M5 Max mit 64 GB nur begrenzte Reserven für macOS, lange Prompts und den KV-Cache lässt. Der M5 Max mit 128 GB und der M5 Ultra ab 96 GB sind die realistischen Ausgangspunkte, und die Bandbreite von 1,2 TB/s dürfte dem M5 Ultra beim selben Modell einen Vorteil bei der Generierungsgeschwindigkeit verschaffen. Die Stufen des M5 Ultra mit 256 GB und 512 GB sind für Modelle gedacht, die auf kleinere Maschinen überhaupt nicht passen. Genau diese Obergrenze von 512 GB nannte Apple im März 2025, als es erklärte, ein Mac Studio mit M3 Ultra könne LLMs mit über 600 Milliarden Parametern vollständig im Arbeitsspeicher ausführen. Der praktische Vorbehalt ist die Verfügbarkeit: Die Konfiguration mit 512 GB wird erst Ende Oktober erwartet, und Speicherknappheit hat die obersten Speicherstufen in diesem Jahr bereits einmal vom Markt verschwinden lassen – klären Sie daher die Lieferzeiten, bevor Sie damit planen.
Praxisbeispiel: Ein 70B-Modell zum Laufen bringen – und der Software-Stack, auf den es ankommt
Für ein Modell der 70B-Klasse mit Q4_K_M-Quantisierung auf einem Mac Studio mit 96 GB oder mehr sind die praktischen Schritte: eine Runtime wählen, einen vorquantisierten Checkpoint im GGUF- oder MLX-Format herunterladen, ihn laden und oberhalb der Modellgewichte genügend Unified-Memory-Reserve für Kontext und System-Overhead lassen, bevor lange Prompts verarbeitet werden.
Die gewählte Runtime verändert das Ergebnis spürbar, doch der beste veröffentlichte Runtime-Vergleich, den wir gefunden haben, ist kein 70B-Test. Der Bericht von Famstack vom März 2026 ließ Qwen3 30B-A3B, ein Mixture-of-Experts-Modell, einen Ops-Agent-Workload mit acht Dialogrunden auf einem MacBook Pro mit M1 Max und 64 GB durchlaufen und maß dabei die effektiven tok/s, in die neben der Generierung auch das Prompt Processing einfließt. Mit GGUF-Gewichten auf der llama.cpp-Engine erreichte LM Studio 41,7, aus dem Quellcode kompiliertes llama.cpp 41,4 und Ollama 26,0 – also 37 % langsamer als LM Studio auf derselben Engine. Auf der MLX-Engine lag oMLX mit 38,0 vorn, während der MLX-Modus von LM Studio auf 17,0 kam. Die praktische Lehre für britische Käufer: Der Wrapper kann ebenso viel ausmachen wie die Engine – benchmarken Sie daher Ihr eigenes Modell, Ihre eigene Quantisierung und Ihren eigenen Workload auf Ihrer eigenen Maschine, bevor Sie sich auf eine Lösung als Standard festlegen.
View the data behind this chart
| LM Studio | llama.cpp | oMLX | Ollama | |
|---|---|---|---|---|
| Effektive tok/s | tok/s41.7 | tok/s41.4 | tok/s38 | tok/s26 |
Strom, Lautstärke und die TCO-Lücke, zu der noch niemand Zahlen veröffentlicht
Hier zählt Ehrlichkeit mehr als eine selbstbewusst klingende Zahl. In den aktuellen Daten gibt es weder für den Mac Studio noch für eine vergleichbare Nvidia-GPU-Workstation bei kontinuierlicher LLM-Inferenz einen verifizierten Wert für Leistungsaufnahme, Stromkosten oder Lüftergeräusch. Eine TCO-Tabelle auf Basis erfundener Verbrauchswerte ist schlechter als gar keine.
Britische Teams können den Vergleich stattdessen sauber strukturieren, bevor sie einen Anbieter nach Zahlen fragen: Kaufpreis, erwarteter Wiederverkaufswert und Betriebskosten sind drei getrennte Posten, und für den Posten Betriebskosten braucht es eine vom Anbieter angegebene dauerhafte Leistungsaufnahme unter LLM-Last – keinen Leerlauf- oder Spitzenwert aus dem Datenblatt –, multipliziert mit Ihrem tatsächlichen britischen Stromtarif. Bevor Sie Budget freigeben, lohnt sich ein Blick in den aktuellen KI-Server-Kostenindex, der Kostenbasiswerte für GPU-Server liefert, an denen sich ein Mac-Studio-Angebot Posten für Posten messen lässt.
Mac Studio vs. GPU-Server: Wann lokal wirklich sinnvoll ist
Das Argument für einen Mac Studio ist eng umrissen, aber real: ein einzelner Anwender, der ein großes quantisiertes Modell privat betreibt, ohne Anforderungen an gleichzeitige Nutzer, Batching oder CUDA-spezifische Tools. Mit den Stufen des M5 Ultra mit 256 GB und 512 GB kann ein einziger Desktop-Rechner Modelle aufnehmen, für die sonst mehrere separate GPU-Karten nötig wären, und die veröffentlichten Daten zeigen, dass selbst der ältere M2 Ultra bei Modellen der 70B-Klasse 11,1 bis 12,13 tok/s generiert – brauchbar für eine Person, die parallel dazu liest und schreibt.
Gegen ihn spricht alles, was über einen einzelnen Nutzer hinausgeht. Die Daten zur RPC-Split-Inferenz zeigen, dass die Generierung langsamer wird, sobald man Mac- und Nvidia-Hardware für mehr Kapazität kombiniert, und der Vergleich H100 gegen M2 Ultra zeigt, dass eine Server-GPU in derselben 70B-Modellklasse rund doppelt so viele Tokens pro Sekunde generiert. Wenn Ihr Workload Batching, Fine-Tuning oder mehrere parallele Inferenz-Streams erfordert, sollten Sie den Vergleich sauber durchführen: Self-Hosting von LLMs mit den Kosten für Cloud-GPUs vergleichen und mit unserem KI-GPU-Rechner die Alternative dimensionieren, bevor Sie sich für einen der beiden Wege entscheiden.
Zukunftssicherheit: Was vor dem Kauf 2026 zu bedenken ist
Die Angebotsschwankungen dieses Jahres sind die eigentliche Lehre zur Zukunftssicherheit. Im Mai 2026 berichtete MacRumors, Apple habe den Mac Studio mit M3 Ultra wegen sich verschärfender Speicherknappheit auf eine einzige Konfiguration mit 96 GB reduziert; das Update vom 25. August brachte mit dem M5 Ultra die Optionen mit 256 GB und 512 GB zurück. Speicherstufen können je nach Liefersituation verschwinden und wiederkehren – wenn Ihre Planung also vom M5 Ultra mit 512 GB abhängt, der laut Apple Ende Oktober verfügbar wird, sollten Sie die Verfügbarkeit als zu steuerndes Risiko behandeln und nicht als gegeben voraussetzen.
Für britische Teams, die mit wachsenden Modellanforderungen rechnen – größere Kontextfenster, mehr Parameter, Mehrbenutzerdienste –, bleibt der CUDA-Pfad der besser erweiterbare, schlicht weil VRAM-Pooling, Batching und Fine-Tuning-Tools um ihn herum entwickelt wurden, statt nachträglich darauf aufgesetzt zu werden. Bevor Sie annehmen, dass der günstiger wirkende Mac-Weg auch dann günstiger bleibt, wenn sich Ihre Anforderungen ändern, sehen Sie sich unseren Vergleich von KI-GPU-Servern für 2026 an.
Quellen
Jede Zahl in diesem Artikel lässt sich auf die folgenden Quellen zurückführen.
- •Apple — Mac Studio technical specifications (UK): Speicher und Bandbreite von M5 Max und M5 Ultra
- •Apple Newsroom — Apple introduces new Mac Studio with M5 Max and M5 Ultra (25. Aug. 2026)
- •MacRumors — Mac Studio roundup: Marktstart, Zeitplan für 512 GB und US-Preise (Aug. 2026)
- •MacRumors — Apple cuts more Mac Studio and Mac mini RAM options as memory shortage worsens (5. Mai 2026)
- •Apple Newsroom — Mac Studio with M3 Ultra launch: Angaben zu 512 GB und 600B+ Parametern (März 2025)
- •Apple Newsroom — Apple introduces M2 Ultra: Speicherbandbreite von 800 GB/s (Juni 2023)
- •GitHub — llama.cpp distributed inference benchmarks: Mac Studio mit M2 Ultra + DGX Spark über 10GbE (März 2026)
- •GitHub — GPU benchmarks on LLM inference: H100 und M2 Ultra mit Llama 3 70B (Stand Mai 2024)
- •GitHub — Performance of llama.cpp on Apple Silicon M-series: Ergebnistabelle für Llama 2 7B
- •Famstack — GGUF vs MLX on Apple Silicon, part 2: Runtime-Vergleich (März 2026)
- •eCorpIT — Local LLM on Apple Silicon vs cloud API break-even: Bandbreite des M3 Ultra (Aug. 2026)
View the data behind this chart
| M4 Max, 40-Kern-GPU | M3 Ultra, 60-Kern-GPU | M5 Max, 40-Kern-GPU | |
|---|---|---|---|
| Generierung tok/s | tok/s83.06 | tok/s88.4 | tok/s119.92 |
