holistechlabsneun Modelle
DEEN

Messung · 15. Juni 2025 · drei Läufe je Modell

Neun Modelle auf dem HP ZBook Ultra G1a

dicht besetzt gegen Mischung aus Experten

Autoren

Dipl.-Ing. Sören GebbertInstitut für holistische Technologieforschung GmbH Natalia GebbertInstitut für holistische Technologieforschung GmbH

Maschine

HP ZBook Ultra 14 Zoll G1a

SoC
AMD Ryzen AI Max+ PRO 395
GPU
Radeon 8060S
Speicher
128 GB – dedizierter Grafikspeicher im BIOS auf 512 MB gesetzt
System
Windows 11 Pro 24H2

Laufzeit – für alle Modelle dieselbe

LM Studio 0.3.16

Engine
llama.cpp Vulkan v1.34.1
Auslagerung
so viele Schichten auf der GPU, wie die Maschine zuließ
Kontext
8.192 Token, für alle Läufe gleich
KV-Cache
auf der GPU

Aufgabe

Zusammenfassen

Vorlage
englischer Wikipedia-Artikel über Platon, 27 KB
Auftrag
Einleitung aus zwei bis drei Sätzen, dazu vier Stichpunkte
Läufe
drei je Modell: einer ohne Cache, zwei mit
Modelle
9 – von 0,6 Mrd. bis über 100 Mrd. Parametern

Herkunft dieses Berichts

Beitrag von 2025

Erschienen
15. Juni 2025
Belege
Ergebnistabelle und 47 Bildschirmfotos aus LM Studio
Aufbereitung
neu gesetzt, Grafiken aus denselben Zahlen gerechnet
Nachfolger
die Messung vom 8. September 2026 auf derselben Maschine

Was diese Maschine 2025 leistete

44,0Token/s

Qwen3-0.6b Q8 das schnellste Modell im Feld

25,8Token/s

Qwen-30B-A3B Q4_K_M Faktor 5,6 gegenüber dem gleich großen QwQ 32B Q8

0,24Sekunden

Warten mit Cache statt 119,4 s ohne, bei QwQ 32B Q8

4,3Prozent

größte Streuung über drei Läufe, bei allen anderen weniger

Tempowerte sind Mittel aus den drei Läufen des jeweiligen Modells. Die Wartezeit ohne Cache stammt aus dem ersten Lauf, die mit Cache ist das Mittel der beiden folgenden. Alle Zahlen stehen in der Ergebnistabelle des Originalbeitrags.

01 · Das Feld

Neun Modelle, eine Maschine

Zwischen dem schnellsten und dem langsamsten Modell liegt Faktor 9,5: 44,0 gegen 4,6 Token je Sekunde. Beides lief auf derselben Maschine, mit derselben Aufgabe.

Neun Modelle, eine Maschine Ausgabetempo in Token je Sekunde, Mittel aus drei Läufen je Modell. HP ZBook Ultra 14 Zoll G1a · Ryzen AI Max+ PRO 395 · Radeon 8060S · 128 GB LM Studio 0.3.16, llama.cpp Vulkan v1.34.1 · Kontextfenster 8.192 Token, KV-Cache auf der GPU · gemessen am 15.6.2025 dicht Experten Qwen3-0.6b Q8 44,0 t/s Qwen-30B-A3B Q4_K_M 25,8 t/s Qwen-30B-A3B Q8 23,4 t/s Qwen3-4B Q8 19,8 t/s Nous-Hermes-2-Mixtral-8x7 Q8 10,7 t/s Gemma-3 12b 7,7 t/s Magistral-Small Q8 6,6 t/s Llama-4-Scout-17B-16e-Instruct 6,1 t/s QwQ 32B Q8 4,6 t/s Beide 30-Mrd.-Expertenmodelle schlagen jedes dichte Modell über 4 Mrd.
Eine Ausnahme fällt auf. Llama-4-Scout-17B-16e-Instruct ist ebenfalls eine Mischung aus Experten und liegt trotzdem im hinteren Drittel. Warum, steht in Kapitel 05.

02 · Bauart

Warum die Experten vorn liegen

Ein dicht besetztes Modell rechnet je Token mit allen seinen Parametern. Ein Expertenmodell speichert ebenso viele, rechnet aber nur mit einem Teil. Der Speicherbedarf richtet sich nach der ersten Zahl, das Tempo nach der zweiten.

Zwei Modelle dieses Feldes machen den Unterschied unmittelbar sichtbar, weil ihre Namen dieselbe Größenordnung nennen. Qwen-30B-A3B Q4_K_M ist eine Mischung aus Experten und erreicht 25,8 Token je Sekunde. QwQ 32B Q8 ist dicht besetzt, etwa gleich groß – und kommt auf 4,6. Das ist Faktor 5,6 zugunsten der Bauart, bei praktisch gleicher Parameterzahl.

Ohne Ausnahme gilt der Zusammenhang allerdings nicht. Llama-4-Scout-17B-16e-Instruct ist ebenfalls eine Mischung aus Experten und bleibt mit 6,1 Token je Sekunde hinter mehreren dichten Modellen zurück – aus einem Grund, der nichts mit der Bauart zu tun hat. Kapitel 05 zeigt ihn.

Ein Jahr später wurde daraus die Grundlage der nächsten Messung: Qwen3.8-Flash-Next hält 512 Experten vor und aktiviert zehn je Token. Was hier als Vorteil sichtbar wird, trägt dort ein Modell mit 176,9 Mrd. Parametern auf demselben Notebook.

03 · Der Cache

Was beim zweiten Mal übrig bleibt

Derselbe Prompt, zum zweiten Mal gestellt: aus 119,4 Sekunden Warten werden 0,24. Faktor 487 – und das Ausgabetempo bleibt dabei unverändert.

Was der Cache aus der Wartezeit macht Sekunden bis zum ersten Token, logarithmisch. Offener Kreis: ohne Cache, gefüllt: mit Cache. HP ZBook Ultra 14 Zoll G1a · Ryzen AI Max+ PRO 395 · Radeon 8060S · 128 GB LM Studio 0.3.16, llama.cpp Vulkan v1.34.1 · Kontextfenster 8.192 Token, KV-Cache auf der GPU · gemessen am 15.6.2025 0,05 s 0,1 s 0,5 s 1 s 5 s 10 s 60 s 120 s QwQ 32B Q8 Llama-4-Scout-17B-16e-Instruct Magistral-Small Q8 Qwen-30B-A3B Q4_K_M Qwen-30B-A3B Q8 Nous-Hermes-2-Mixtral-8x7 Q8 Gemma-3 12b Qwen3-4B Q8 Qwen3-0.6b Q8 Aus bis zu zwei Minuten Warten werden Bruchteile einer Sekunde.
Die Wartezeit hängt am Prompt, nicht am Modell. Liegt der verarbeitete Prompt im Cache, entfällt sie fast vollständig – in jeder Größenklasse gleichermaßen.

Für die Bedienung ist das der Unterschied zwischen brauchbar und unbrauchbar. Beim ersten Aufruf eines langen Textes wartet man; bei jeder Rückfrage zum selben Text nicht mehr. Wer ein Dokument bearbeitet, zahlt die Verarbeitung also einmal und nicht bei jeder Frage.

04 · Wiederholbarkeit

Dreimal gefragt, dreimal dieselbe Zahl

Kein Modell streut über 4,3 Prozent zwischen seinen drei Läufen. Sieben von neun bleiben unter zwei.

Drei Läufe, dieselbe Zahl Ausgabetempo der drei Läufe je Modell, als Abweichung vom Mittel dieses Modells. HP ZBook Ultra 14 Zoll G1a · Ryzen AI Max+ PRO 395 · Radeon 8060S · 128 GB LM Studio 0.3.16, llama.cpp Vulkan v1.34.1 · Kontextfenster 8.192 Token, KV-Cache auf der GPU · gemessen am 15.6.2025 dicht Experten -4 -2 0 2 4 Llama-4-Scout-17B-16e-Instruct 4,3 % Qwen-30B-A3B Q8 2,4 % Gemma-3 12b 2,0 % Qwen3-0.6b Q8 1,7 % Qwen-30B-A3B Q4_K_M 1,6 % Qwen3-4B Q8 1,6 % Nous-Hermes-2-Mixtral-8x7 Q8 1,0 % Magistral-Small Q8 0,9 % QwQ 32B Q8 0,6 % Spanne Kein Modell streut über 4,3 Prozent; sieben von neun bleiben unter 2.
Die Zahlen sind belastbar. Die größte Streuung trägt Llama-4-Scout-17B-16e-Instruct, das Modell, das als einziges nicht vollständig auf die GPU passte.

05 · Die Grenze

Wo die Maschine 2025 nicht mehr weiterkam

Acht der neun Modelle liefen vollständig auf der GPU. Beim neunten ging das nicht: Der Vulkan-Treiber gab 2025 höchstens 64 GB Grafikspeicher frei, und Llama-4-Scout brauchte mehr. Sechs seiner 48 Schichten blieben auf der CPU. Die Sensoren zeigen, was das kostet: Der GPU-Takt fällt von 2.650 auf 846 MHz und die Auslastung auf 72 Prozent, während die CPU mit 61 Prozent mitrechnet.

Der Beitrag von 2025 schloss mit der Vermutung, ein Treiber-Update könne diese Grenze aufheben. Die Messung vom 8. September 2026 auf derselben Maschine gibt darauf eine Antwort, wenn auch unter anderem Betriebssystem: Unter Linux gibt der Kernelparameter amdgpu.gttsize 110 GiB des Arbeitsspeichers für die GPU frei, und ein Modell mit 176,9 Mrd. Parametern läuft. Die Grenze lag also im Software-Stapel, nicht in der Maschine.

06 · Alle Zahlen

Die vollständige Ergebnistabelle

27 Läufe, so wie sie im Originalbeitrag stehen. Aus dieser Tabelle sind alle Grafiken dieses Berichts gerechnet.

Modell Lauf Token/s Token Warten (s) Cache
Qwen3-0.6b Q8144,474852,26nein
243,714460,06ja
343,784290,06ja
Qwen-30B-A3B Q4_K_M125,6666867,12nein
225,809470,08ja
326,077730,09ja
Qwen-30B-A3B Q8123,1266662,42nein
223,686510,08ja
323,518360,08ja
Qwen3-4B Q8119,6162710,09nein
219,856970,09ja
319,925980,09ja
Nous-Hermes-2-Mixtral-8x7 Q8110,6520838,46nein
210,752250,13ja
310,762660,13ja
Gemma-3 12b17,7532428,61nein
27,652890,17ja
37,603330,17ja
Magistral-Small Q816,6092480,20nein
26,562.5610,19ja
36,621.0410,22ja
Llama-4-Scout-17B-16e-Instruct15,9230182,54nein
26,113560,23ja
36,182860,21ja
QwQ 32B Q814,65782119,42nein
24,641.1250,24ja
34,621.2970,25ja

07 · Grenzen

Was diese Arbeit nicht zeigt

Keine Qualität. Gemessen wurde Tempo, nicht die Güte der Zusammenfassungen. Ob ein Modell die Aufgabe besser löst als ein anderes, steht hier nicht.

Ein Prompt, eine Länge. Alle Läufe verwenden denselben Text mit 8.192 Token Kontext. Über das Verhalten bei sehr langen Kontexten sagt die Messung nichts – dafür steht der Bericht von 2026.

Ein Stapel, ein Zeitpunkt. Windows 11, LM Studio 0.3.16, llama.cpp Vulkan v1.34.1, Stand Juni 2025. Treiber und Engines haben sich seither verändert; die Zahlen gelten für diesen Stapel und dieses Datum.

Drei Läufe. Genug, um die Streuung zu zeigen, zu wenig für eine statistische Aussage über seltene Ausreißer.