Messung · 7. bis 10. Oktober 2026 · je 48 Messläufe
Qwen3.8-Flash-Next auf Apple M1 und Strix Halo
sushi 1.2.1 · MacBook Pro M1 Max gegen halogen 0.17.0 · HP ZBook Ultra G1a
Autoren
Maschine und Engine
MacBook Pro M1 Max
- SoC
- Apple M1 Max, 10 CPU-Kerne, 32 GPU-Kerne
- Speicher
- 64 GiB Unified Memory, davon bis 56 GiB für die GPU
(
iogpu.wired_limit_mb) - System
- macOS 27.0.1, Netzbetrieb
- Engine
- sushi 1.2.1, MTP an, KV-Cache 8 bit (Vorgaben)
- Gewichte
beamster/Qwen3.8-Flash-Next-Sushi-2.6bpw
Maschine und Engine
HP ZBook Ultra G1a
- SoC
- Ryzen AI Max+ PRO 395, Radeon 8060S
- Speicher
- 128 GiB LPDDR5X-8000 als Unified Memory
- System
- Ubuntu 24.04,
platform_profile=performance - Engine
- halogen-flash-server 0.17.0, MTP an (Vorgabe)
- Gewichte
v2.hgn, 3,0 bpw
Protokoll
Acht Fragen an ein Wetterprotokoll
- Längen
- 32.000 bis 245.000 Token, nativ
- Dokumente
- auf beiden Maschinen byteweise dieselben
- Budget
- 3.072 Token Ausgabe, davon höchstens 2.048 Denken, Temperatur 0
- Gewertet
- sechs Aufgaben; die zwei Rechenaufgaben prüfen Arithmetik, nicht Kontext
337Token/s
MacBook Pro M1 Max · sushiPrompt-Verarbeitung bei der ersten Frage
12,1Minuten
Ganzen Text einlesen einmal, bei der ersten Frage
27,0Sekunden
Folgefrage einlesen der Text ist schon verarbeitet
33,0Token/s
Ausgabe beim Antworten auf Folgefragen
1.212Token/s
HP ZBook Ultra G1a · halogenPrompt-Verarbeitung bei der ersten Frage
3,4Minuten
Ganzen Text einlesen einmal, bei der ersten Frage
0,5Sekunden
Folgefrage einlesen der Text ist schon verarbeitet
53,6Token/s
Ausgabe beim Antworten auf Folgefragen
Mediane über alle Messläufe dieser Länge. Bei der ersten Frage zu einem Text liest die Maschine ihn vollständig ein, bei jeder Folgefrage kommt nur die neue Frage hinzu. Die Längen dazwischen zeigt Kapitel 02.
01 · Aufbau
Dasselbe Protokoll auf zwei Maschinen
Auf dem MacBook Pro M1 Max liefen dieselben 48 Messläufe wie auf dem HP ZBook Ultra G1a im Bericht vom Oktober, soweit sie unter der nativen Grenze von 262.144 Token liegen: dieselben Dokumente, auf dem Mac neu erzeugt und Byte für Byte gegen die Rohdaten des ZBook geprüft, dieselben acht Fragen, dieselbe Bewertung, dieselbe Reihenfolge. Jeder Messlauf bekam einen frisch gestarteten Server ohne Plattencache.
Beide Engines laufen mit ihren Vorgaben, auch mit ihrer Mehrtoken-Vorhersage (MTP). Auf dem Mac ist an zwei Anfragen geprüft, dass sushi mit MTP Byte für Byte dieselbe Ausgabe liefert wie ohne. halogen schließt den Denkblock, sobald nur noch 1.024 der 3.072 Token bleiben; sushi bekommt dafür ein Denkbudget von 2.048 Token.
Verglichen werden zwei Stapel, nicht zwei Chips: Maschine, Engine und Gewichte sind zugleich verschieden. Kapitel 06 sagt, was daraus folgt.
02 · Tempo
Das ZBook liest schneller ein und antwortet schneller
Bei der ersten Frage zu einem Text liest das ZBook 3,5- bis 3,8-mal so viele Token je Sekunde ein wie das M1 Max. Eine Folgefrage braucht auf dem ZBook höchstens 0,6 Sekunden, auf dem M1 Max 13 bis 27 Sekunden.
Die Zeiten misst auf dem ZBook die Engine selbst, auf dem Mac das Messskript am Datenstrom: Einlesen bis zum ersten Token, Ausgabe danach.
03 · Verstehen
Im festen Kern finden beide fast jede Antwort
Über alle Längen bis 245k löst das M1 Max mit sushi 100 von 108 wertbaren Aufgaben, das ZBook mit halogen 105 von 108.
Gewertet ist wie im Kontextbericht nur der feste Kern: dasselbe Wetterprotokoll in jeder Länge, aufgefüllt mit einem fachfremden Wartungsjournal. Je Länge liefen drei Fassungen mit anderen Zufallswerten.
04 · Speicher
Bei 245k wird der Speicher auf dem M1 Max knapp
Von 5 Messläufen mit 245k lehnte sushi in einem die 6. Frage ab: Sie hätte rund 8.507 MB GPU-Speicher gebraucht, frei waren 8.005 MB. Die Wiederholung desselben Messlaufs ging vollständig durch, und nur sie ist gewertet. Die Grenze liegt also knapp unter dieser Länge und hängt vom Zustand der Engine ab, nicht fest an der Zahl der Token.
Das M1 Max hat 64 GiB, von denen 56 GiB der GPU zur Verfügung stehen. Das ZBook hat 128 GiB. Die Speicherzahlen beider Engines stehen hier nicht nebeneinander: macOS und Linux zählen belegten Speicher verschieden.
05 · Alle Zahlen
Die Ergebnisse je Längenstufe
Tempo: Mediane über alle gewerteten Messläufe der Stufe, Einlesen bei der ersten Frage. Verstehen: der feste Kern, sechs wertbare Aufgaben je Messlauf. Die Werte je Messlauf stehen in docs/kontext-werte-m1.json und docs/kontext-werte-2026-10.json.
| Länge | Läufe | Einlesen M1 (t/s) | Einlesen ZBook (t/s) | Folgefrage M1 (s) | Folgefrage ZBook (s) | Ausgabe M1 (t/s) | Ausgabe ZBook (t/s) |
|---|---|---|---|---|---|---|---|
| 32k | 4 | 363 | 1.398 | 21,7 | 0,5 | 35,5 | 55,3 |
| 64k | 6 | 362 | 1.323 | 20,1 | 0,4 | 37,5 | 55,8 |
| 80k | 3 | 360 | 1.312 | 19,2 | 0,4 | 33,4 | 54,1 |
| 96k | 6 | 359 | 1.308 | 19,0 | 0,5 | 34,7 | 54,7 |
| 112k | 3 | 357 | 1.289 | 18,0 | 0,4 | 34,8 | 54,2 |
| 128k | 6 | 356 | 1.286 | 17,1 | 0,5 | 34,8 | 54,5 |
| 144k | 3 | 355 | 1.262 | 16,2 | 0,5 | 31,7 | 53,2 |
| 160k | 3 | 353 | 1.238 | 14,7 | 0,5 | 32,5 | 53,6 |
| 176k | 3 | 351 | 1.235 | 14,0 | 0,5 | 35,0 | 53,2 |
| 192k | 6 | 350 | 1.231 | 13,1 | 0,6 | 34,3 | 53,4 |
| 229k | 1 | 343 | 1.198 | 27,2 | 0,5 | 34,8 | 53,0 |
| 245k | 4 | 337 | 1.212 | 27,0 | 0,5 | 33,0 | 53,6 |
| Länge | Läufe | richtig M1 | richtig ZBook |
|---|---|---|---|
| 32k | 3 | 15 / 18 | 18 / 18 |
| 64k | 3 | 16 / 18 | 18 / 18 |
| 96k | 3 | 18 / 18 | 18 / 18 |
| 128k | 3 | 17 / 18 | 18 / 18 |
| 192k | 3 | 18 / 18 | 18 / 18 |
| 245k | 3 | 16 / 18 | 15 / 18 |
06 · Grenzen
Was dieser Vergleich nicht zeigt
Kein Vergleich der Chips. Maschine, Engine und Gewichte sind zugleich verschieden. Wie schnell halogen auf einem Mac oder sushi auf Strix Halo wäre, ist nicht gemessen.
Verschiedene Gewichte. halogen rechnet mit v2.hgn (3,0 bpw), sushi mit beamster/Qwen3.8-Flash-Next-Sushi-2.6bpw. Unterschiede im Verstehen können von den Gewichten kommen.
Nur bis zur nativen Grenze. Über 262.144 Token ist auf dem M1 Max nichts gemessen; schon bei 245k wird der Speicher knapp.
Eine Art Dokument, eine Sitzung. Die Aufgaben fragen nach einem tabellarischen Messprotokoll, eine Frage nach der anderen. Wie sich beide Maschinen mit Quelltext, mehreren Sitzungen oder einem Agenten schlagen, ist hier nicht gemessen.