holistechlabssushi · M1 Max ↔ Strix Halo
DEEN

Messung · 7. bis 10. Oktober 2026 · je 48 Messläufe

Qwen3.8-Flash-Next auf Apple M1 und Strix Halo

sushi 1.2.1 · MacBook Pro M1 Max gegen halogen 0.17.0 · HP ZBook Ultra G1a

Autoren

Dipl.-Ing. Sören GebbertInstitut für holistische Technologieforschung GmbH Claude Code Opus 5.5Anthropic

Maschine und Engine

MacBook Pro M1 Max

SoC
Apple M1 Max, 10 CPU-Kerne, 32 GPU-Kerne
Speicher
64 GiB Unified Memory, davon bis 56 GiB für die GPU (iogpu.wired_limit_mb)
System
macOS 27.0.1, Netzbetrieb
Engine
sushi 1.2.1, MTP an, KV-Cache 8 bit (Vorgaben)
Gewichte
beamster/Qwen3.8-Flash-Next-Sushi-2.6bpw

Maschine und Engine

HP ZBook Ultra G1a

SoC
Ryzen AI Max+ PRO 395, Radeon 8060S
Speicher
128 GiB LPDDR5X-8000 als Unified Memory
System
Ubuntu 24.04, platform_profile=performance
Engine
halogen-flash-server 0.17.0, MTP an (Vorgabe)
Gewichte
v2.hgn, 3,0 bpw

Protokoll

Acht Fragen an ein Wetterprotokoll

Längen
32.000 bis 245.000 Token, nativ
Dokumente
auf beiden Maschinen byteweise dieselben
Budget
3.072 Token Ausgabe, davon höchstens 2.048 Denken, Temperatur 0
Gewertet
sechs Aufgaben; die zwei Rechenaufgaben prüfen Arithmetik, nicht Kontext
245k Kontext245.000 Token im Prompt

337Token/s

MacBook Pro M1 Max · sushiPrompt-Verarbeitung bei der ersten Frage

12,1Minuten

Ganzen Text einlesen einmal, bei der ersten Frage

27,0Sekunden

Folgefrage einlesen der Text ist schon verarbeitet

33,0Token/s

Ausgabe beim Antworten auf Folgefragen

1.212Token/s

HP ZBook Ultra G1a · halogenPrompt-Verarbeitung bei der ersten Frage

3,4Minuten

Ganzen Text einlesen einmal, bei der ersten Frage

0,5Sekunden

Folgefrage einlesen der Text ist schon verarbeitet

53,6Token/s

Ausgabe beim Antworten auf Folgefragen

Mediane über alle Messläufe dieser Länge. Bei der ersten Frage zu einem Text liest die Maschine ihn vollständig ein, bei jeder Folgefrage kommt nur die neue Frage hinzu. Die Längen dazwischen zeigt Kapitel 02.

01 · Aufbau

Dasselbe Protokoll auf zwei Maschinen

Auf dem MacBook Pro M1 Max liefen dieselben 48 Messläufe wie auf dem HP ZBook Ultra G1a im Bericht vom Oktober, soweit sie unter der nativen Grenze von 262.144 Token liegen: dieselben Dokumente, auf dem Mac neu erzeugt und Byte für Byte gegen die Rohdaten des ZBook geprüft, dieselben acht Fragen, dieselbe Bewertung, dieselbe Reihenfolge. Jeder Messlauf bekam einen frisch gestarteten Server ohne Plattencache.

Beide Engines laufen mit ihren Vorgaben, auch mit ihrer Mehrtoken-Vorhersage (MTP). Auf dem Mac ist an zwei Anfragen geprüft, dass sushi mit MTP Byte für Byte dieselbe Ausgabe liefert wie ohne. halogen schließt den Denkblock, sobald nur noch 1.024 der 3.072 Token bleiben; sushi bekommt dafür ein Denkbudget von 2.048 Token.

Verglichen werden zwei Stapel, nicht zwei Chips: Maschine, Engine und Gewichte sind zugleich verschieden. Kapitel 06 sagt, was daraus folgt.

02 · Tempo

Das ZBook liest schneller ein und antwortet schneller

Bei der ersten Frage zu einem Text liest das ZBook 3,5- bis 3,8-mal so viele Token je Sekunde ein wie das M1 Max. Eine Folgefrage braucht auf dem ZBook höchstens 0,6 Sekunden, auf dem M1 Max 13 bis 27 Sekunden.

Das ZBook liest gut dreieinhalbmal so schnell ein Eingelesene Token je Sekunde bei der ersten Frage zu einem Text, Median je Länge. MacBook Pro M1 Max · sushi 1.2.1 · HP ZBook Ultra G1a · halogen 0.17.0 · Qwen3.8-Flash-Next Temperatur 0 · acht Fragen mit eindeutiger Antwort · 32k bis 245k nativ · gemessen am 7./8.10. (ZBook) und 9./10.10.2026 (M1 Max) M1 Max · sushi ZBook · halogen 32k 64k 96k 128k 192k 245k Länge des Prompts in Token (logarithmisch) 0 250 500 750 1.000 1.250 1.500 Token je Sekunde 1.398 363 1.323 362 1.312 360 1.308 359 1.289 357 1.286 356 1.262 355 1.238 353 1.235 351 1.231 350 1.198 343 1.212 337
Beide halten ihr Einlesetempo fast über die ganze Länge. Das M1 Max liest 363 Token je Sekunde bei 32k und 337 bei 245k, das ZBook 1.398 und 1.212.
Auf dem M1 Max kostet auch die Folgefrage Sekunden Einlesezeit, Median je Länge, logarithmisch: helle Linie erste Frage, dunkle Linie Folgefrage. MacBook Pro M1 Max · sushi 1.2.1 · HP ZBook Ultra G1a · halogen 0.17.0 · Qwen3.8-Flash-Next Temperatur 0 · acht Fragen mit eindeutiger Antwort · 32k bis 245k nativ · gemessen am 7./8.10. (ZBook) und 9./10.10.2026 (M1 Max) M1 Max · sushi ZBook · halogen 32k 64k 96k 128k 192k 245k Länge des Prompts in Token (logarithmisch) 1 s 10 s 1 min 5 min 15 min Einlesezeit 23,0 s 3,4 min 0,5 s 0,5 s 1,5 min 12,1 min 21,7 s 27,0 s
sushi liest bei jeder Folgefrage ein Stück des Textes neu. In allen 347 Folgefragen übernahm es aus seinem Cache ein Vielfaches von 8.192 Token und las 3.699 bis 7.970 Token neu ein; halogen übernimmt alles bis auf die neue Frage. Bei 245k dauert das erste Einlesen auf dem M1 Max 12,1 Minuten, auf dem ZBook 3,4.
Die Ausgabe hängt auf beiden kaum an der Länge Erzeugte Token je Sekunde beim Antworten auf Folgefragen, Median je Länge. MacBook Pro M1 Max · sushi 1.2.1 · HP ZBook Ultra G1a · halogen 0.17.0 · Qwen3.8-Flash-Next Temperatur 0 · acht Fragen mit eindeutiger Antwort · 32k bis 245k nativ · gemessen am 7./8.10. (ZBook) und 9./10.10.2026 (M1 Max) M1 Max · sushi ZBook · halogen 32k 64k 96k 128k 192k 245k Länge des Prompts in Token (logarithmisch) 0 10 20 30 40 50 60 Token je Sekunde 55,3 35,5 55,8 37,5 54,1 33,4 54,7 34,7 54,2 34,8 54,5 34,8 53,2 31,7 53,6 32,5 53,2 35,0 53,4 34,3 53,0 34,8 53,6 33,0
Die Ausgabe hängt auf beiden kaum an der Länge. Das M1 Max erzeugt 31,7 bis 37,5 Token je Sekunde, das ZBook 53,0 bis 55,8.

Die Zeiten misst auf dem ZBook die Engine selbst, auf dem Mac das Messskript am Datenstrom: Einlesen bis zum ersten Token, Ausgabe danach.

03 · Verstehen

Im festen Kern finden beide fast jede Antwort

Über alle Längen bis 245k löst das M1 Max mit sushi 100 von 108 wertbaren Aufgaben, das ZBook mit halogen 105 von 108.

Im festen Kern finden beide fast jede Antwort Anteil richtig gelöster wertbarer Aufgaben im festen Kern, je Länge drei Fassungen. MacBook Pro M1 Max · sushi 1.2.1 · HP ZBook Ultra G1a · halogen 0.17.0 · Qwen3.8-Flash-Next Temperatur 0 · acht Fragen mit eindeutiger Antwort · 32k bis 245k nativ · gemessen am 7./8.10. (ZBook) und 9./10.10.2026 (M1 Max) M1 Max · sushi ZBook · halogen 32k 64k 96k 128k 192k 245k Länge des Prompts in Token (logarithmisch) 50 % 60 % 70 % 80 % 90 % 100 % Anteil richtig 18 / 18 15 / 18 18 / 18 16 / 18 18 / 18 18 / 18 17 / 18 18 / 18 16 / 18 15 / 18
Der Abstand ist klein. Beide rechnen mit verschiedenen Gewichten desselben Modells und mit verschiedenen Engines; ob er von den Gewichten, der Engine oder der Maschine kommt, trennt dieser Vergleich nicht.

Gewertet ist wie im Kontextbericht nur der feste Kern: dasselbe Wetterprotokoll in jeder Länge, aufgefüllt mit einem fachfremden Wartungsjournal. Je Länge liefen drei Fassungen mit anderen Zufallswerten.

04 · Speicher

Bei 245k wird der Speicher auf dem M1 Max knapp

Von 5 Messläufen mit 245k lehnte sushi in einem die 6. Frage ab: Sie hätte rund 8.507 MB GPU-Speicher gebraucht, frei waren 8.005 MB. Die Wiederholung desselben Messlaufs ging vollständig durch, und nur sie ist gewertet. Die Grenze liegt also knapp unter dieser Länge und hängt vom Zustand der Engine ab, nicht fest an der Zahl der Token.

Das M1 Max hat 64 GiB, von denen 56 GiB der GPU zur Verfügung stehen. Das ZBook hat 128 GiB. Die Speicherzahlen beider Engines stehen hier nicht nebeneinander: macOS und Linux zählen belegten Speicher verschieden.

05 · Alle Zahlen

Die Ergebnisse je Längenstufe

Tempo: Mediane über alle gewerteten Messläufe der Stufe, Einlesen bei der ersten Frage. Verstehen: der feste Kern, sechs wertbare Aufgaben je Messlauf. Die Werte je Messlauf stehen in docs/kontext-werte-m1.json und docs/kontext-werte-2026-10.json.

Tempo
Länge Läufe Einlesen M1 (t/s) Einlesen ZBook (t/s) Folgefrage M1 (s) Folgefrage ZBook (s) Ausgabe M1 (t/s) Ausgabe ZBook (t/s)
32k43631.39821,70,535,555,3
64k63621.32320,10,437,555,8
80k33601.31219,20,433,454,1
96k63591.30819,00,534,754,7
112k33571.28918,00,434,854,2
128k63561.28617,10,534,854,5
144k33551.26216,20,531,753,2
160k33531.23814,70,532,553,6
176k33511.23514,00,535,053,2
192k63501.23113,10,634,353,4
229k13431.19827,20,534,853,0
245k43371.21227,00,533,053,6
Verstehen, fester Kern
Länge Läufe richtig M1 richtig ZBook
32k315 / 1818 / 18
64k316 / 1818 / 18
96k318 / 1818 / 18
128k317 / 1818 / 18
192k318 / 1818 / 18
245k316 / 1815 / 18

06 · Grenzen

Was dieser Vergleich nicht zeigt

Kein Vergleich der Chips. Maschine, Engine und Gewichte sind zugleich verschieden. Wie schnell halogen auf einem Mac oder sushi auf Strix Halo wäre, ist nicht gemessen.

Verschiedene Gewichte. halogen rechnet mit v2.hgn (3,0 bpw), sushi mit beamster/Qwen3.8-Flash-Next-Sushi-2.6bpw. Unterschiede im Verstehen können von den Gewichten kommen.

Nur bis zur nativen Grenze. Über 262.144 Token ist auf dem M1 Max nichts gemessen; schon bei 245k wird der Speicher knapp.

Eine Art Dokument, eine Sitzung. Die Aufgaben fragen nach einem tabellarischen Messprotokoll, eine Frage nach der anderen. Wie sich beide Maschinen mit Quelltext, mehreren Sitzungen oder einem Agenten schlagen, ist hier nicht gemessen.