Jeudi 27 août 2026

Aube.

Les nouvelles du progrès
Original et traduction

Test : les LLM locaux jusqu'à 250 % plus rapides avec MTP

Quitter la comparaison

Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.

Original · allemand
Im Test: Lokale LLMs mit MTP bis zu 250 Prozent schneller
Traduction · français
Test : les LLM locaux jusqu'à 250 % plus rapides avec MTP
Original · allemand
Vier getestete LLMs erzeugten mit MTP 25 bis 250 Prozent mehr Token pro Sekunde.
Traduction · français
Les quatre LLM testés ont généré 25 à 250 % de tokens par seconde en plus avec MTP.
Original · allemand
Gemma 4, Qwen3.5, Qwen3.6 und Qwen3.8 unterstützen die Funktion.
Traduction · français
Gemma 4, Qwen3.5, Qwen3.6 et Qwen3.8 prennent en charge cette fonction.
Original · allemand
Getestet wurde auf Radeon RX 9060 XT und GeForce RTX 3090 mit Llama.cpp.
Traduction · français
Les tests ont été réalisés sur Radeon RX 9060 XT et GeForce RTX 3090 avec Llama.cpp.
Original · allemand

Auf dem Test-PC stehen eine Radeon RX 9060 XT mit 16 GByte Grafikspeicher und 32 GByte DDR5-RAM. Wird dort Multi Token Prediction, kurz MTP, aktiviert, erzeugen vier getestete Large Language Models (LLMs) laut heise 25 bis 250 Prozent mehr Token pro Sekunde als ohne die Funktion. Das Versprechen lautet: mehr Tempo, ohne zusätzliche Hardware anzuschaffen.

Traduction · français

Le PC de test dispose d'une Radeon RX 9060 XT avec 16 GByte de mémoire graphique et de 32 GByte de RAM DDR5. Lorsque la Multi Token Prediction, ou MTP, est activée, les quatre Large Language Models (LLM) testés génèrent, selon heise, 25 à 250 % de tokens par seconde en plus qu'en son absence. La promesse est la suivante : davantage de vitesse, sans acheter de matériel supplémentaire.

Original · allemand

Heise prüfte Gemma 4, Qwen3.5 und Qwen3.6 auf der Radeon-Karte. Für weitere Messungen kam eine Nvidia GeForce RTX 3090 zum Einsatz, ebenfalls mit Gemma 4 und Qwen3.6 sowie mit dem neuen Qwen3.8. Die Modelle gibt es laut Test in ausreichend kleinen Varianten, die auf gut ausgestatteten Gaming-PCs mit 16-GByte-Grafikkarten zügig laufen.

Traduction · français

Heise a testé Gemma 4, Qwen3.5 et Qwen3.6 sur la carte Radeon. Pour d'autres mesures, une Nvidia GeForce RTX 3090 a été utilisée, également avec Gemma 4 et Qwen3.6, ainsi qu'avec le nouveau Qwen3.8. Selon le test, ces modèles existent dans des variantes suffisamment compactes pour fonctionner rapidement sur des PC gaming bien équipés de cartes graphiques de 16 GByte.

Original · allemand

Für den Vergleich nutzte heise die KI-Engine Llama.cpp. Gemessen wurde mit zwei verschiedenen Prompts, jeweils mit und ohne MTP; zusätzlich optimierten die Tester einen Parameter. Die Ergebnisse fielen unterschiedlich aus: Bei einigen Modellen vervielfachte sich die Generierung, mindestens 25 Prozent mehr Tempo waren in den Versuchen aber immer drin.

Traduction · français

Pour la comparaison, heise a utilisé le moteur d'IA Llama.cpp. Les mesures ont été effectuées avec deux prompts différents, chacun avec et sans MTP ; les testeurs ont également optimisé un paramètre. Les résultats étaient variables : pour certains modèles, la génération a été multipliée, mais les essais ont toujours obtenu au moins 25 % de vitesse supplémentaire.

Original · allemand

Konkret heißt das: Wer ein unterstütztes lokales Modell auf einem passenden Gaming-PC betreibt, kann möglicherweise deutlich schneller Antworten erzeugen, ohne eine neue Grafikkarte zu kaufen. Das ist vor allem für die lokale Nutzung relevant, bei der die Rechenarbeit auf dem eigenen Rechner stattfindet. Welche Verbesserung ankommt, hängt jedoch vom Modell und weiteren Faktoren ab.

Traduction · français

Concrètement, une personne qui utilise un modèle local compatible sur un PC gaming adapté peut éventuellement générer des réponses nettement plus rapidement, sans acheter une nouvelle carte graphique. Cela concerne surtout l'utilisation locale, dans laquelle les calculs sont effectués sur l'ordinateur de l'utilisateur. Le gain obtenu dépend toutefois du modèle et d'autres facteurs.

Original · allemand

Die Grenze ist klar: MTP ist nicht für jedes lokale KI-Modell verfügbar. Die genannten Werte sind Messungen aus den heise-Versuchen und keine allgemeine Leistungszusage für jede Hardware. Für Nutzer mit Gemma 4, Qwen3.5, Qwen3.6 oder Qwen3.8 liefert der Test dennoch einen konkreten Ansatz, um vorhandene Rechenleistung besser auszunutzen.

Traduction · français

La limite est claire : la MTP n'est pas disponible pour tous les modèles d'IA locaux. Les valeurs indiquées correspondent aux mesures des essais de heise et ne constituent pas une garantie générale de performances pour chaque matériel. Pour les utilisateurs de Gemma 4, Qwen3.5, Qwen3.6 ou Qwen3.8, le test fournit néanmoins une piste concrète pour mieux exploiter la puissance de calcul disponible.

Revenir à l’article