Donnerstag, 27. August 2026

Aube.

Nachrichten vom Fortschritt
LaborEinzelquelle

Im Test: Lokale LLMs mit MTP bis zu 250 Prozent schneller

Sprachen dieses Artikels
Original · DEENFR

Originaltext auf Deutsch. 3 Sprachen verfügbar, Ihre kommt mit einem Klick dazu.

Auf dem Test-PC stehen eine Radeon RX 9060 XT mit 16 GByte Grafikspeicher und 32 GByte DDR5-RAM. Wird dort Multi Token Prediction, kurz MTP, aktiviert, erzeugen vier getestete Large Language Models (LLMs) laut heise 25 bis 250 Prozent mehr Token pro Sekunde als ohne die Funktion. Das Versprechen lautet: mehr Tempo, ohne zusätzliche Hardware anzuschaffen.

Heise prüfte Gemma 4, Qwen3.5 und Qwen3.6 auf der Radeon-Karte. Für weitere Messungen kam eine Nvidia GeForce RTX 3090 zum Einsatz, ebenfalls mit Gemma 4 und Qwen3.6 sowie mit dem neuen Qwen3.8. Die Modelle gibt es laut Test in ausreichend kleinen Varianten, die auf gut ausgestatteten Gaming-PCs mit 16-GByte-Grafikkarten zügig laufen.

Für den Vergleich nutzte heise die KI-Engine Llama.cpp. Gemessen wurde mit zwei verschiedenen Prompts, jeweils mit und ohne MTP; zusätzlich optimierten die Tester einen Parameter. Die Ergebnisse fielen unterschiedlich aus: Bei einigen Modellen vervielfachte sich die Generierung, mindestens 25 Prozent mehr Tempo waren in den Versuchen aber immer drin.

Konkret heißt das: Wer ein unterstütztes lokales Modell auf einem passenden Gaming-PC betreibt, kann möglicherweise deutlich schneller Antworten erzeugen, ohne eine neue Grafikkarte zu kaufen. Das ist vor allem für die lokale Nutzung relevant, bei der die Rechenarbeit auf dem eigenen Rechner stattfindet. Welche Verbesserung ankommt, hängt jedoch vom Modell und weiteren Faktoren ab.

Die Grenze ist klar: MTP ist nicht für jedes lokale KI-Modell verfügbar. Die genannten Werte sind Messungen aus den heise-Versuchen und keine allgemeine Leistungszusage für jede Hardware. Für Nutzer mit Gemma 4, Qwen3.5, Qwen3.6 oder Qwen3.8 liefert der Test dennoch einen konkreten Ansatz, um vorhandene Rechenleistung besser auszunutzen.

250 ProzentMaximaler Zuwachs bei der Token-Ausgabe mit MTP

Quellen — die Originale lesen(Pariser Zeit)

heise onlineDE
0000

Weiterlesen

Kommentare

Der Thread wird geladen…

Melden Sie sich an, um einen Kommentar zu schreiben. Anmelden