Messung · 15. Juni 2025 · drei Läufe je Modell
Neun Modelle auf dem HP ZBook Ultra G1a
dicht besetzt gegen Mischung aus Experten
Autoren
Maschine
HP ZBook Ultra 14 Zoll G1a
- SoC
- AMD Ryzen AI Max+ PRO 395
- GPU
- Radeon 8060S
- Speicher
- 128 GB – dedizierter Grafikspeicher im BIOS auf 512 MB gesetzt
- System
- Windows 11 Pro 24H2
Laufzeit – für alle Modelle dieselbe
LM Studio 0.3.16
- Engine
- llama.cpp Vulkan v1.34.1
- Auslagerung
- so viele Schichten auf der GPU, wie die Maschine zuließ
- Kontext
- 8.192 Token, für alle Läufe gleich
- KV-Cache
- auf der GPU
Aufgabe
Zusammenfassen
- Vorlage
- englischer Wikipedia-Artikel über Platon, 27 KB
- Auftrag
- Einleitung aus zwei bis drei Sätzen, dazu vier Stichpunkte
- Läufe
- drei je Modell: einer ohne Cache, zwei mit
- Modelle
- 9 – von 0,6 Mrd. bis über 100 Mrd. Parametern
Herkunft dieses Berichts
Beitrag von 2025
- Erschienen
- 15. Juni 2025
- Belege
- Ergebnistabelle und 47 Bildschirmfotos aus LM Studio
- Aufbereitung
- neu gesetzt, Grafiken aus denselben Zahlen gerechnet
- Nachfolger
- die Messung vom 8. September 2026 auf derselben Maschine
Was diese Maschine 2025 leistete
44,0Token/s
Qwen3-0.6b Q8 das schnellste Modell im Feld
25,8Token/s
Qwen-30B-A3B Q4_K_M Faktor 5,6 gegenüber dem gleich großen QwQ 32B Q8
0,24Sekunden
Warten mit Cache statt 119,4 s ohne, bei QwQ 32B Q8
4,3Prozent
größte Streuung über drei Läufe, bei allen anderen weniger
Tempowerte sind Mittel aus den drei Läufen des jeweiligen Modells. Die Wartezeit ohne Cache stammt aus dem ersten Lauf, die mit Cache ist das Mittel der beiden folgenden. Alle Zahlen stehen in der Ergebnistabelle des Originalbeitrags.
01 · Das Feld
Neun Modelle, eine Maschine
Zwischen dem schnellsten und dem langsamsten Modell liegt Faktor 9,5: 44,0 gegen 4,6 Token je Sekunde. Beides lief auf derselben Maschine, mit derselben Aufgabe.
02 · Bauart
Warum die Experten vorn liegen
Ein dicht besetztes Modell rechnet je Token mit allen seinen Parametern. Ein Expertenmodell speichert ebenso viele, rechnet aber nur mit einem Teil. Der Speicherbedarf richtet sich nach der ersten Zahl, das Tempo nach der zweiten.
Zwei Modelle dieses Feldes machen den Unterschied unmittelbar sichtbar, weil ihre Namen dieselbe Größenordnung nennen. Qwen-30B-A3B Q4_K_M ist eine Mischung aus Experten und erreicht 25,8 Token je Sekunde. QwQ 32B Q8 ist dicht besetzt, etwa gleich groß – und kommt auf 4,6. Das ist Faktor 5,6 zugunsten der Bauart, bei praktisch gleicher Parameterzahl.
Ohne Ausnahme gilt der Zusammenhang allerdings nicht. Llama-4-Scout-17B-16e-Instruct ist ebenfalls eine Mischung aus Experten und bleibt mit 6,1 Token je Sekunde hinter mehreren dichten Modellen zurück – aus einem Grund, der nichts mit der Bauart zu tun hat. Kapitel 05 zeigt ihn.
Ein Jahr später wurde daraus die Grundlage der nächsten Messung: Qwen3.8-Flash-Next hält 512 Experten vor und aktiviert zehn je Token. Was hier als Vorteil sichtbar wird, trägt dort ein Modell mit 176,9 Mrd. Parametern auf demselben Notebook.
03 · Der Cache
Was beim zweiten Mal übrig bleibt
Derselbe Prompt, zum zweiten Mal gestellt: aus 119,4 Sekunden Warten werden 0,24. Faktor 487 – und das Ausgabetempo bleibt dabei unverändert.
Für die Bedienung ist das der Unterschied zwischen brauchbar und unbrauchbar. Beim ersten Aufruf eines langen Textes wartet man; bei jeder Rückfrage zum selben Text nicht mehr. Wer ein Dokument bearbeitet, zahlt die Verarbeitung also einmal und nicht bei jeder Frage.
04 · Wiederholbarkeit
Dreimal gefragt, dreimal dieselbe Zahl
Kein Modell streut über 4,3 Prozent zwischen seinen drei Läufen. Sieben von neun bleiben unter zwei.
05 · Die Grenze
Wo die Maschine 2025 nicht mehr weiterkam
Acht der neun Modelle liefen vollständig auf der GPU. Beim neunten ging das nicht: Der Vulkan-Treiber gab 2025 höchstens 64 GB Grafikspeicher frei, und Llama-4-Scout brauchte mehr. Sechs seiner 48 Schichten blieben auf der CPU. Die Sensoren zeigen, was das kostet: Der GPU-Takt fällt von 2.650 auf 846 MHz und die Auslastung auf 72 Prozent, während die CPU mit 61 Prozent mitrechnet.
Der Beitrag von 2025 schloss mit der Vermutung, ein Treiber-Update könne diese Grenze aufheben. Die Messung vom 8. September 2026 auf derselben Maschine gibt darauf eine Antwort, wenn auch unter anderem Betriebssystem: Unter Linux gibt der Kernelparameter amdgpu.gttsize 110 GiB des Arbeitsspeichers für die GPU frei, und ein Modell mit 176,9 Mrd. Parametern läuft. Die Grenze lag also im Software-Stapel, nicht in der Maschine.
06 · Alle Zahlen
Die vollständige Ergebnistabelle
27 Läufe, so wie sie im Originalbeitrag stehen. Aus dieser Tabelle sind alle Grafiken dieses Berichts gerechnet.
| Modell | Lauf | Token/s | Token | Warten (s) | Cache |
|---|---|---|---|---|---|
| Qwen3-0.6b Q8 | 1 | 44,47 | 485 | 2,26 | nein |
| 2 | 43,71 | 446 | 0,06 | ja | |
| 3 | 43,78 | 429 | 0,06 | ja | |
| Qwen-30B-A3B Q4_K_M | 1 | 25,66 | 668 | 67,12 | nein |
| 2 | 25,80 | 947 | 0,08 | ja | |
| 3 | 26,07 | 773 | 0,09 | ja | |
| Qwen-30B-A3B Q8 | 1 | 23,12 | 666 | 62,42 | nein |
| 2 | 23,68 | 651 | 0,08 | ja | |
| 3 | 23,51 | 836 | 0,08 | ja | |
| Qwen3-4B Q8 | 1 | 19,61 | 627 | 10,09 | nein |
| 2 | 19,85 | 697 | 0,09 | ja | |
| 3 | 19,92 | 598 | 0,09 | ja | |
| Nous-Hermes-2-Mixtral-8x7 Q8 | 1 | 10,65 | 208 | 38,46 | nein |
| 2 | 10,75 | 225 | 0,13 | ja | |
| 3 | 10,76 | 266 | 0,13 | ja | |
| Gemma-3 12b | 1 | 7,75 | 324 | 28,61 | nein |
| 2 | 7,65 | 289 | 0,17 | ja | |
| 3 | 7,60 | 333 | 0,17 | ja | |
| Magistral-Small Q8 | 1 | 6,60 | 924 | 80,20 | nein |
| 2 | 6,56 | 2.561 | 0,19 | ja | |
| 3 | 6,62 | 1.041 | 0,22 | ja | |
| Llama-4-Scout-17B-16e-Instruct | 1 | 5,92 | 301 | 82,54 | nein |
| 2 | 6,11 | 356 | 0,23 | ja | |
| 3 | 6,18 | 286 | 0,21 | ja | |
| QwQ 32B Q8 | 1 | 4,65 | 782 | 119,42 | nein |
| 2 | 4,64 | 1.125 | 0,24 | ja | |
| 3 | 4,62 | 1.297 | 0,25 | ja |
07 · Grenzen
Was diese Arbeit nicht zeigt
Keine Qualität. Gemessen wurde Tempo, nicht die Güte der Zusammenfassungen. Ob ein Modell die Aufgabe besser löst als ein anderes, steht hier nicht.
Ein Prompt, eine Länge. Alle Läufe verwenden denselben Text mit 8.192 Token Kontext. Über das Verhalten bei sehr langen Kontexten sagt die Messung nichts – dafür steht der Bericht von 2026.
Ein Stapel, ein Zeitpunkt. Windows 11, LM Studio 0.3.16, llama.cpp Vulkan v1.34.1, Stand Juni 2025. Treiber und Engines haben sich seither verändert; die Zahlen gelten für diesen Stapel und dieses Datum.
Drei Läufe. Genug, um die Streuung zu zeigen, zu wenig für eine statistische Aussage über seltene Ausreißer.