Test : les LLM locaux jusqu'à 250 % plus rapides avec MTP
Le PC de test dispose d'une Radeon RX 9060 XT avec 16 GByte de mémoire graphique et de 32 GByte de RAM DDR5. Lorsque la Multi Token Prediction, ou MTP, est activée, les quatre Large Language Models (LLM) testés génèrent, selon heise, 25 à 250 % de tokens par seconde en plus qu'en son absence. La promesse est la suivante : davantage de vitesse, sans acheter de matériel supplémentaire.
Heise a testé Gemma 4, Qwen3.5 et Qwen3.6 sur la carte Radeon. Pour d'autres mesures, une Nvidia GeForce RTX 3090 a été utilisée, également avec Gemma 4 et Qwen3.6, ainsi qu'avec le nouveau Qwen3.8. Selon le test, ces modèles existent dans des variantes suffisamment compactes pour fonctionner rapidement sur des PC gaming bien équipés de cartes graphiques de 16 GByte.
Pour la comparaison, heise a utilisé le moteur d'IA Llama.cpp. Les mesures ont été effectuées avec deux prompts différents, chacun avec et sans MTP ; les testeurs ont également optimisé un paramètre. Les résultats étaient variables : pour certains modèles, la génération a été multipliée, mais les essais ont toujours obtenu au moins 25 % de vitesse supplémentaire.
Concrètement, une personne qui utilise un modèle local compatible sur un PC gaming adapté peut éventuellement générer des réponses nettement plus rapidement, sans acheter une nouvelle carte graphique. Cela concerne surtout l'utilisation locale, dans laquelle les calculs sont effectués sur l'ordinateur de l'utilisateur. Le gain obtenu dépend toutefois du modèle et d'autres facteurs.
La limite est claire : la MTP n'est pas disponible pour tous les modèles d'IA locaux. Les valeurs indiquées correspondent aux mesures des essais de heise et ne constituent pas une garantie générale de performances pour chaque matériel. Pour les utilisateurs de Gemma 4, Qwen3.5, Qwen3.6 ou Qwen3.8, le test fournit néanmoins une piste concrète pour mieux exploiter la puissance de calcul disponible.
Commentaires
Chargement du fil…
Connectez-vous pour écrire un commentaire. Se connecter