Jeudi 27 août 2026

Aube.

Les nouvelles du progrès
LaboSource unique

Test : les LLM locaux jusqu'à 250 % plus rapides avec MTP

Langues de cet articleComparer à l’original

Traduit par IA, langue d’origine : allemand — voir le texte original. 3 langues disponibles, la vôtre s’ajoute en un clic.

Le PC de test dispose d'une Radeon RX 9060 XT avec 16 GByte de mémoire graphique et de 32 GByte de RAM DDR5. Lorsque la Multi Token Prediction, ou MTP, est activée, les quatre Large Language Models (LLM) testés génèrent, selon heise, 25 à 250 % de tokens par seconde en plus qu'en son absence. La promesse est la suivante : davantage de vitesse, sans acheter de matériel supplémentaire.

Heise a testé Gemma 4, Qwen3.5 et Qwen3.6 sur la carte Radeon. Pour d'autres mesures, une Nvidia GeForce RTX 3090 a été utilisée, également avec Gemma 4 et Qwen3.6, ainsi qu'avec le nouveau Qwen3.8. Selon le test, ces modèles existent dans des variantes suffisamment compactes pour fonctionner rapidement sur des PC gaming bien équipés de cartes graphiques de 16 GByte.

Pour la comparaison, heise a utilisé le moteur d'IA Llama.cpp. Les mesures ont été effectuées avec deux prompts différents, chacun avec et sans MTP ; les testeurs ont également optimisé un paramètre. Les résultats étaient variables : pour certains modèles, la génération a été multipliée, mais les essais ont toujours obtenu au moins 25 % de vitesse supplémentaire.

Concrètement, une personne qui utilise un modèle local compatible sur un PC gaming adapté peut éventuellement générer des réponses nettement plus rapidement, sans acheter une nouvelle carte graphique. Cela concerne surtout l'utilisation locale, dans laquelle les calculs sont effectués sur l'ordinateur de l'utilisateur. Le gain obtenu dépend toutefois du modèle et d'autres facteurs.

La limite est claire : la MTP n'est pas disponible pour tous les modèles d'IA locaux. Les valeurs indiquées correspondent aux mesures des essais de heise et ne constituent pas une garantie générale de performances pour chaque matériel. Pour les utilisateurs de Gemma 4, Qwen3.5, Qwen3.6 ou Qwen3.8, le test fournit néanmoins une piste concrète pour mieux exploiter la puissance de calcul disponible.

250 %Gain maximal de génération de tokens avec MTP

Sources — lire les originaux(heure de Paris)

heise onlineDE
0000

À lire ensuite

Commentaires

Chargement du fil…

Connectez-vous pour écrire un commentaire. Se connecter