Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
Auf dem Test-PC stehen eine Radeon RX 9060 XT mit 16 GByte Grafikspeicher und 32 GByte DDR5-RAM. Wird dort Multi Token Prediction, kurz MTP, aktiviert, erzeugen vier getestete Large Language Models (LLMs) laut heise 25 bis 250 Prozent mehr Token pro Sekunde als ohne die Funktion. Das Versprechen lautet: mehr Tempo, ohne zusätzliche Hardware anzuschaffen.
Le PC de test dispose d'une Radeon RX 9060 XT avec 16 GByte de mémoire graphique et de 32 GByte de RAM DDR5. Lorsque la Multi Token Prediction, ou MTP, est activée, les quatre Large Language Models (LLM) testés génèrent, selon heise, 25 à 250 % de tokens par seconde en plus qu'en son absence. La promesse est la suivante : davantage de vitesse, sans acheter de matériel supplémentaire.
Heise prüfte Gemma 4, Qwen3.5 und Qwen3.6 auf der Radeon-Karte. Für weitere Messungen kam eine Nvidia GeForce RTX 3090 zum Einsatz, ebenfalls mit Gemma 4 und Qwen3.6 sowie mit dem neuen Qwen3.8. Die Modelle gibt es laut Test in ausreichend kleinen Varianten, die auf gut ausgestatteten Gaming-PCs mit 16-GByte-Grafikkarten zügig laufen.
Heise a testé Gemma 4, Qwen3.5 et Qwen3.6 sur la carte Radeon. Pour d'autres mesures, une Nvidia GeForce RTX 3090 a été utilisée, également avec Gemma 4 et Qwen3.6, ainsi qu'avec le nouveau Qwen3.8. Selon le test, ces modèles existent dans des variantes suffisamment compactes pour fonctionner rapidement sur des PC gaming bien équipés de cartes graphiques de 16 GByte.
Für den Vergleich nutzte heise die KI-Engine Llama.cpp. Gemessen wurde mit zwei verschiedenen Prompts, jeweils mit und ohne MTP; zusätzlich optimierten die Tester einen Parameter. Die Ergebnisse fielen unterschiedlich aus: Bei einigen Modellen vervielfachte sich die Generierung, mindestens 25 Prozent mehr Tempo waren in den Versuchen aber immer drin.
Pour la comparaison, heise a utilisé le moteur d'IA Llama.cpp. Les mesures ont été effectuées avec deux prompts différents, chacun avec et sans MTP ; les testeurs ont également optimisé un paramètre. Les résultats étaient variables : pour certains modèles, la génération a été multipliée, mais les essais ont toujours obtenu au moins 25 % de vitesse supplémentaire.
Konkret heißt das: Wer ein unterstütztes lokales Modell auf einem passenden Gaming-PC betreibt, kann möglicherweise deutlich schneller Antworten erzeugen, ohne eine neue Grafikkarte zu kaufen. Das ist vor allem für die lokale Nutzung relevant, bei der die Rechenarbeit auf dem eigenen Rechner stattfindet. Welche Verbesserung ankommt, hängt jedoch vom Modell und weiteren Faktoren ab.
Concrètement, une personne qui utilise un modèle local compatible sur un PC gaming adapté peut éventuellement générer des réponses nettement plus rapidement, sans acheter une nouvelle carte graphique. Cela concerne surtout l'utilisation locale, dans laquelle les calculs sont effectués sur l'ordinateur de l'utilisateur. Le gain obtenu dépend toutefois du modèle et d'autres facteurs.
Die Grenze ist klar: MTP ist nicht für jedes lokale KI-Modell verfügbar. Die genannten Werte sind Messungen aus den heise-Versuchen und keine allgemeine Leistungszusage für jede Hardware. Für Nutzer mit Gemma 4, Qwen3.5, Qwen3.6 oder Qwen3.8 liefert der Test dennoch einen konkreten Ansatz, um vorhandene Rechenleistung besser auszunutzen.
La limite est claire : la MTP n'est pas disponible pour tous les modèles d'IA locaux. Les valeurs indiquées correspondent aux mesures des essais de heise et ne constituent pas une garantie générale de performances pour chaque matériel. Pour les utilisateurs de Gemma 4, Qwen3.5, Qwen3.6 ou Qwen3.8, le test fournit néanmoins une piste concrète pour mieux exploiter la puissance de calcul disponible.