holistechlabshalogen · 32k → 990k
DEEN

Messung · 21. bis 23. September 2026 · 54 Messläufe

Langer Kontext auf dem HP ZBook Ultra G1a

halogen-flash-server 0.12.1 und 0.13.1 von 32.000 bis 990.000 Token

Autoren

Dipl.-Ing. Sören GebbertInstitut für holistische Technologieforschung GmbH Claude Code Opus 5.5Anthropic

Maschine

HP ZBook Ultra G1a

SoC
Ryzen AI Max+ PRO 395
GPU
Radeon 8060S, gfx1151
Speicher
128 GiB LPDDR5X-8000, verlötet – als Unified Memory von CPU und GPU geteilt
SSD
Samsung 990 PRO, 4 TB, NVMe über PCIe 4.0 x4
System
Ubuntu 24.04, 140-W-Netzteil, platform_profile=performance

Modell

Qwen3.8-Flash-Next

Größe
rund 180B – gemessen 176,9 Mrd. Parameter
Bauart
„512×56B“, 48 Blöcke, 512 Experten, davon 10 je Token aktiv
Kontext
nativ bis 262.144 Token, darüber YaRN mit Faktor 4

Engine

halogen-flash-server

Stand
Image 0.12.1 und 0.13.1, Podman – byteweise dieselben Token
Gewichte
w4b.hgn + Qualitäts-Overlay, 5,53 bpw
Aufruf
HALOGEN_CTX je Länge bis 1.048.576, HALOGEN_ROPE_YARN=4 über 262k
Budget
3.072 Token Ausgabe je Aufgabe, Temperatur 0, je Messlauf ein frischer Container

Aufgaben

Acht Fragen an ein Wetterprotokoll

Text
651 Zeilen Messwerte von Wetterstationen, in jeder Länge dieselben
Länge
aufgefüllt mit einem fachfremden Wartungsjournal
Art
nachschlagen, vergleichen, zählen, summieren
Gewertet
sechs; die zwei Rechenaufgaben prüfen Arithmetik, nicht Kontext
32k Kontext32.000 Token im Prompt

1.194Token/s

Prompt-Verarbeitung bei der ersten Frage zu einem Text

27Sekunden

Ganzen Text einlesen einmal, bei der ersten Frage

1,8Sekunden

Folgefrage einlesen der Text selbst ist schon verarbeitet

47,2Token/s

Ausgabe beim Antworten auf Folgefragen

100,1GiB

Speicher belegt von 125,1 GiB; danach frei: 13,2 GiB

990k Kontext990.000 Token im Prompt

768Token/s

Prompt-Verarbeitung bei der ersten Frage zu einem Text

21,5Minuten

Ganzen Text einlesen einmal, bei der ersten Frage

2,3Sekunden

Folgefrage einlesen der Text selbst ist schon verarbeitet

40,9Token/s

Ausgabe beim Antworten auf Folgefragen

109,3GiB

Speicher belegt von 125,1 GiB; danach frei: 4,1 GiB

Mediane über alle Messläufe der jeweiligen Länge. Bei der ersten Frage zu einem Text liest die Maschine ihn vollständig ein. Bei jeder Folgefrage ist er schon verarbeitet, und nur die neue Frage kommt hinzu. Die Längen dazwischen zeigt Kapitel 02.

01 · Aufbau

Dieselbe Aufgabe in jeder Länge

Wer wissen will, ob ein Modell langen Kontext versteht, muss die Länge ändern und die Aufgabe festhalten. Gefragt wird deshalb immer nach demselben Wetterprotokoll: 651 Zeilen Messwerte von Wetterstationen, rund 32.000 Token, dazu acht Fragen mit eindeutiger Antwort. Auf die jeweilige Länge kommt der Text durch ein fachfremdes Wartungsjournal davor und dahinter, bei 990k mit 957.999 Token. Ändert sich das Ergebnis, kann es nur an der Länge liegen.

Bis 245k liefen je Stufe drei Fassungen des Wetterprotokolls mit anderen Zufallswerten, darüber eine: 21 Messläufe für das Verstehen. Für das Tempo zählen alle 54 gewerteten Messläufe dieser Tage, auch die mit anderen Dokumenten derselben Länge; wie schnell die Maschine einliest und antwortet, hängt an der Zahl der Token, nicht an ihrem Inhalt. Verworfen sind Aufwärmläufe, Wiederholungen desselben Dokuments und Vorläufe mit anderer Einstellung. Welcher Messlauf warum fehlt, steht in der Auswertung im Repository.

02 · Tempo

Einmal einlesen, dann antwortet es in Sekunden

Bei der ersten Frage zu einem Text liest die Maschine 1.194 Token je Sekunde bei 32k und 768 bei 990k. Jede Folgefrage zum selben Text braucht danach höchstens 2,3 Sekunden, in jeder Länge.

Das Einlesen verliert bis 990k gut ein Drittel Tempo Eingelesene Token je Sekunde bei der ersten Frage zu einem Text, je Messlauf ein Punkt. HP ZBook Ultra G1a · Ryzen AI Max+ PRO 395 · Qwen3.8-Flash-Next · halogen 0.12.1 und 0.13.1 Temperatur 0 · acht Fragen mit eindeutiger Antwort · bis 262.144 Token nativ, darüber YaRN 4 · gemessen vom 21. bis 23.9.2026 32k 64k 128k 256k 512k 1M jenseits der nativen Grenze: YaRN 4 native Grenze Länge des Prompts in Token (logarithmisch) 0 250 500 750 1.000 1.250 Token je Sekunde 1.194 1.120 1.084 1.109 1.076 1.069 1.037 1.026 996 1.044 1.000 1.037 891 837 768
Das Einlesen verliert bis zur nativen Grenze 13 Prozent Tempo, bis 990k 36. Jeder Punkt ist ein Messlauf, die Linie der Median je Stufe.
Einmal warten, dann antwortet es in Sekunden Einlesezeit bei der ersten Frage und bei jeder Folgefrage, logarithmisch. HP ZBook Ultra G1a · Ryzen AI Max+ PRO 395 · Qwen3.8-Flash-Next · halogen 0.12.1 und 0.13.1 Temperatur 0 · acht Fragen mit eindeutiger Antwort · bis 262.144 Token nativ, darüber YaRN 4 · gemessen vom 21. bis 23.9.2026 Folgefragen erste Frage 32k 64k 128k 256k 512k 1M jenseits der nativen Grenze: YaRN 4 native Grenze Länge des Prompts in Token (logarithmisch) 1 s 10 s 1 min 5 min 20 min Einlesezeit 27,0 s 57,3 s 1,2 min 1,4 min 1,7 min 2,0 min 2,3 min 2,6 min 3,0 min 3,1 min 3,8 min 3,9 min 7,4 min 11,8 min 21,5 min 1,8 s 1,7 s 1,8 s 2,0 s 1,5 s 1,9 s 1,9 s 2,0 s 1,9 s 2,1 s 1,9 s 1,8 s 1,8 s 2,1 s 2,3 s
Gewartet wird bei der ersten Frage. Bei 990k dauert das Einlesen 21,5 Minuten; danach ist der Text verarbeitet, und jede weitere Frage kostet nur noch ihre eigenen Token.
Die Erzeugung bleibt nahezu gleich schnell Erzeugte Token je Sekunde beim Antworten auf Folgefragen, je Messlauf der Median. HP ZBook Ultra G1a · Ryzen AI Max+ PRO 395 · Qwen3.8-Flash-Next · halogen 0.12.1 und 0.13.1 Temperatur 0 · acht Fragen mit eindeutiger Antwort · bis 262.144 Token nativ, darüber YaRN 4 · gemessen vom 21. bis 23.9.2026 32k 64k 128k 256k 512k 1M jenseits der nativen Grenze: YaRN 4 native Grenze Länge des Prompts in Token (logarithmisch) 0 10 20 30 40 50 60 Token je Sekunde 47,2 45,6 40,9 43,6 45,5 44,4 36,5 37,0 43,3 42,3 44,1 41,9 44,1 42,5 40,9
Die Ausgabe hängt kaum an der Länge. Von 47,2 auf 40,9 Token je Sekunde, bei dreißigfachem Kontext. Einzelne Antworten, die die Speicherverdichtung des Kernels ausbremst, sind nicht mitgezählt; sie ändern kein Token.

Für die Arbeit mit einem langen Dokument heißt das: Man wartet einmal, bei 245k 3,9 Minuten, und fragt danach im Gespräch weiter. Ein Agent, der seinen Verlauf fortschreibt, zahlt das Einlesen nur für das, was neu hinzukommt.

03 · Speicher

Den Speicher bestimmt der Pool, nicht der Prompt

halogen reserviert beim Start einen Pool für eine feste Zahl von Positionen und belegt ihn ganz, gleich wie lang der Text später ist. Bis 262k lief jeder Messlauf mit demselben Pool: 100,1 GiB, ob der Prompt 32.000 oder 245.000 Token lang war. Für 990k sind es 109,3 GiB von 125,1 GiB.

Den Speicher bestimmt der Pool, nicht der Prompt Was halogen nach dem Start belegt, je Konfiguration; die Zahlen nennt die Engine beim Start selbst. HP ZBook Ultra G1a · Ryzen AI Max+ PRO 395 · Qwen3.8-Flash-Next · halogen 0.12.1 und 0.13.1 Temperatur 0 · acht Fragen mit eindeutiger Antwort · bis 262.144 Token nativ, darüber YaRN 4 · gemessen vom 21. bis 23.9.2026 Arbeitsspeicher KV-Pool Gewichte 0 20 40 60 80 100 120 Gigabyte (GiB) Rechner: 125,1 GiB 32k bis 245k Pool 393.216 Positionen 68,0 10,8 21,4 100,1 GiB danach frei: 13,2–13,7 GiB 396k Pool 425.984 Positionen 68,0 11,7 12,5 92,1 GiB danach frei: 21,1–21,7 GiB 594k Pool 622.592 Positionen 68,0 17,1 12,5 97,6 GiB danach frei: 15,3–16,3 GiB 990k Pool 1.048.576 Positionen 68,0 28,8 12,5 109,3 GiB danach frei: 4,1–5,6 GiB
Die Gewichte sind immer gleich, der KV-Pool wächst mit den Positionen. 10,8 GiB für 393.216 Positionen, 28,8 GiB für 1.048.576. Die Zahlen nennt die Engine selbst beim Start, hier aus 15 Starts eigener Messcontainer.

Oberhalb 262k lief halogen mit einem Generierungsbudget von 16.384 statt 32.768 Token. Das senkt den Arbeitsspeicher von 21,4 auf 12,5 GiB, und deshalb belegt der Pool für 396k weniger als der native.

Bei 990k wird es eng. Nach dem Start blieben dem Rechner 4,1 bis 5,6 GiB für alles andere, und schon beim Reservieren des Pools musste der Kernel den Speicher 534-mal verdichten; bei den kleineren Pools kein einziges Mal. Neben einem Pool dieser Größe sollte auf dem Notebook nichts Großes mehr laufen.

04 · Verstehen

Bis 262k hält das Verstehen, darüber lässt es nach

Bis 245k löst das Modell 106 von 108 wertbaren Aufgaben.

Bis 262k hält das Verstehen, darüber lässt es nach Anteil richtig gelöster wertbarer Aufgaben; bis 245k drei Fassungen des Wetterprotokolls, darüber eine. HP ZBook Ultra G1a · Ryzen AI Max+ PRO 395 · Qwen3.8-Flash-Next · halogen 0.12.1 und 0.13.1 Temperatur 0 · acht Fragen mit eindeutiger Antwort · bis 262.144 Token nativ, darüber YaRN 4 · gemessen vom 21. bis 23.9.2026 32k 64k 128k 256k 512k 1M jenseits der nativen Grenze: YaRN 4 native Grenze Länge des Prompts in Token (logarithmisch) 0 % 25 % 50 % 75 % 100 % Anteil richtig 100 % 94 % 100 % 100 % 100 % 94 % 83 % 67 % 67 %
Bis zur nativen Grenze bleibt die Linie oben. Erst jenseits von 262k, mit YaRN, fällt sie ab.

Innerhalb der nativen Grenze ist Länge für dieses Modell kein Hindernis. Die erste Fassung des Wetterprotokolls löst in jeder Stufe bis 245k alle acht Aufgaben, auch die zwei Rechenaufgaben; über alle 18 Messläufe fehlen 2 Antworten, verteilt auf 64k und 245k, nicht gehäuft am oberen Ende.

05 · Über 262k

Was zuerst ausfällt, ist das Nachschlagen

Oberhalb der nativen Grenze liegt es an der Länge. Dasselbe Wetterprotokoll ergibt bei 396k 6 von 8, bei 594k 4 von 8 und bei 990k 5 von 8 richtige Antworten.

Was zuerst ausfällt, ist das Nachschlagen Dasselbe Wetterprotokoll in jeder Länge: gefüllter Punkt richtig, offener falsch. HP ZBook Ultra G1a · Ryzen AI Max+ PRO 395 · Qwen3.8-Flash-Next · halogen 0.12.1 und 0.13.1 Temperatur 0 · acht Fragen mit eindeutiger Antwort · bis 262.144 Token nativ, darüber YaRN 4 · gemessen vom 21. bis 23.9.2026 32k 64k 96k 128k 192k 245k 396k 594k 990k Wert einer benannten Zeile ablesen (Wind) Wert einer benannten Zeile ablesen (Sensor) Abstand zweier weit entfernter Einträge Beinahe-Duplikat unterscheiden Eindeutige Kombination finden Maximum einer Teilmenge finden Teilmenge zählen Teilmenge summieren
Die schwereren Aufgaben halten länger. Eine Kombination finden, ein Maximum bestimmen, ein Beinahe-Duplikat erkennen: in jeder Länge richtig. Den Wert einer benannten Zeile abzulesen misslingt ab 396k.

Das Muster ist kein gleichmäßiger Verfall. Das Modell nennt eine echte Sensorkennung aus demselben Protokoll, nur aus der falschen Zeile; bei 245k greift es dieselbe Zeile noch sicher. Es verliert also nicht den Text, sondern die genaue Stelle darin.

Auch das Einlesen wird jenseits der Grenze teurer: bei 990k kostet jedes Token 35 Prozent mehr Zeit als bei 245k. Die Ausgabe bleibt davon fast unberührt.

06 · YaRN

Bei gleicher Länge ändert YaRN das Ergebnis nicht

Über 262.144 Token kommt das Modell nur mit YaRN, einer Streckung der Positionskodierung. Der Verdacht liegt nahe, dass sie den Abfall verursacht. Die Messung widerlegt ihn.

Bei gleicher Länge ändert YaRN das Ergebnis nicht Je Paar dasselbe Dokument mit 245.000 Token, einmal nativ und einmal mit YaRN 4. HP ZBook Ultra G1a · Ryzen AI Max+ PRO 395 · Qwen3.8-Flash-Next · halogen 0.12.1 und 0.13.1 Temperatur 0 · acht Fragen mit eindeutiger Antwort · bis 262.144 Token nativ, darüber YaRN 4 · gemessen vom 21. bis 23.9.2026 YaRN 4 nativ 0 50 100 150 200 250 300 Einlesen bei der ersten Frage, in Sekunden langes Wetterprotokoll, Lauf 1 238 s · 4 / 8 richtig 246 s · 4 / 8 richtig langes Wetterprotokoll, Lauf 2 252 s · 4 / 8 richtig 252 s · 4 / 8 richtig kurzes Protokoll im Wartungsjournal 230 s · 8 / 8 richtig 236 s · 8 / 8 richtig
Dieselben Aufgaben richtig, in allen drei Paaren. Das Einlesen dauert mit YaRN höchstens 3 Prozent länger.

Zwei unabhängige Gegenproben stehen dahinter: ein Block von vier Messläufen in wechselnder Reihenfolge auf einem langen Wetterprotokoll von 4.993 Zeilen, und ein Messlauf mit dem kurzen Wetterprotokoll im Wartungsjournal, der genau an die native Reihe anschließt. Der Wortlaut der Antworten ändert sich mit YaRN, die Lösung nicht.

YaRN macht die Längen über 262k erst möglich, verursacht aber nicht, dass das Modell dort schlechter nachschlägt. Das liegt an der Länge selbst.

07 · Alle Zahlen

Die Ergebnisse je Längenstufe

Verstehen: das Wetterprotokoll im Wartungsjournal, die sechs wertbaren Aufgaben über alle Messläufe der Stufe. Tempo: Mediane über alle gewerteten Messläufe der Stufe. Aus diesen Werten sind alle Grafiken dieses Berichts gerechnet; die Werte je Messlauf stehen in docs/kontext-werte.json.

Verstehen
Länge Skalierung Läufe richtig
32knativ318 / 18
64knativ317 / 18
96knativ318 / 18
128knativ318 / 18
192knativ318 / 18
245knativ317 / 18
396kYaRN 415 / 6
594kYaRN 414 / 6
990kYaRN 414 / 6
Tempo
Länge Läufe Einlesen (s) Einlesen (t/s) Ausgabe (t/s) Folgefrage (s)
32k427,01.19447,21,8
64k657,31.12045,61,7
80k373,91.08440,91,8
96k686,71.10943,62,0
112k3104,21.07645,51,5
128k6119,91.06944,41,9
144k3138,91.03736,51,9
160k3156,01.02637,02,0
176k3177,599643,31,8
192k6184,11.04442,32,1
229k1229,11.00044,11,9
245k4236,41.03741,91,8
396k2444,989144,11,8
594k2709,683742,52,1
990k21.289,076840,92,3
Speicher
Pool Budget Starts Gewichte KV-Pool Arbeit zusammen danach frei
393.21632.768968,010,821,4100,113,2–13,7
425.98416.384268,011,712,592,121,1–21,7
622.59216.384268,017,112,597,615,3–16,3
1.048.57616.384268,028,812,5109,34,1–5,6

08 · Grenzen

Was diese Arbeit nicht zeigt

Eine Fassung über 262k. Oberhalb der nativen Grenze lief je Länge eine Fassung des Wetterprotokolls. Bei Temperatur 0 wiederholt dasselbe Dokument dieselbe Antwort; die Streuung liegt zwischen Dokumenten und ist dort nicht gemessen. Dass 990k eine Aufgabe mehr löst als 594k, gehört dazu. Belastbar ist der Abstand: Dieselbe Fassung ist bis 245k fehlerfrei und ab 396k nicht mehr.

Ein Pool für alle Längen bis 262k. Bis 262k lief jeder Messlauf mit dem Alltagspool von 393.216 Positionen. Wie viel Speicher ein kleinerer Pool für kurze Texte spart, ist nicht gemessen.

Die kleinere Arena. Ab 396k arbeitet halogen mit einem Generierungsbudget von 16.384 statt 32.768 Token. Das ändert sich zugleich mit der Länge und ist nicht getrennt gemessen.

Eine Art Dokument. Die Aufgaben stellen Fragen an ein tabellarisches Messprotokoll. Für Quelltext, Fließtext oder Gespräche kann die Grenze anders liegen.

Eine Engine, eine Maschine. Gemessen ist halogen 0.12.1 und 0.13.1 auf dem HP ZBook Ultra G1a. Das Tempo gilt für diesen Stapel; ob llama.cpp bei denselben Längen dasselbe versteht, ist hier nicht gemessen.