Alibaba publie Qwen3.8-Flash, coût divisé par neuf
À 23 h, heure de Pékin, l’équipe Qwen d’Alibaba a mis Qwen3.8-Flash en ligne, en ouvrant ses poids sur Hugging Face et ModelScope. Il ne s’agit pas simplement d’un autre modèle de la gamme 3.x : Alibaba le présente comme un aperçu technique de l’architecture Qwen4 de nouvelle génération, publié en avance pour permettre aux développeurs de tester cette conception avant l’arrivée de la famille complète.
L’idée centrale du modèle repose sur le calcul sélectif. Sa conception à mélange d’experts dirige chaque token vers les experts pertinents au lieu d’exécuter tous les paramètres à chaque fois. Qwen3.8-Flash compte 125 milliards de paramètres, auxquels s’ajoute un module d’embedding N-gram de 51 milliards de paramètres, mais n’en active qu’environ 6 milliards par token. Alibaba affirme que son coût d’entraînement représente environ un neuvième de celui de Qwen3.7-Plus.
Cette empreinte active réduite s’accompagne d’une mémoire étendue : 262K tokens en natif, extensibles à 1 million grâce à YaRN. Le système d’attention GDN-plus-QSA d’Alibaba compresse les informations historiques et filtre les éléments importants du contexte grâce à un indexeur léger ; sur des séquences d’1 million de tokens, le noyau QSA atteint des accélérations annoncées allant jusqu’à 7,6 fois en préremplissage et 4,9 fois en décodage.
Et concrètement ? Les développeurs peuvent télécharger les poids, notamment une version FP8 qui réduit les obstacles au déploiement local, et expérimenter le traitement de documents longs, les charges de travail d’agents et le traitement de données par lots. Pour les utilisateurs de l’API, les tarifs commencent à 1 yuan par million de tokens d’entrée et 3 yuans par million de tokens de sortie. Alibaba présente ces tarifs comme représentant environ un tiers de ceux de V4 Flash ; l’entreprise affirme que le prix de sortie est environ trente fois inférieur à celui de nombreux modèles de pointe étrangers.
La revendication de performances est également précise, et pas seulement liée au coût de l’inférence : Alibaba annonce des scores de 58,7 sur DeepSWE 1.1, 62,5 sur SWE-bench Pro et 84,5 sur AndroidWorld, avec de meilleurs résultats en programmation et dans les tâches bureautiques que Qwen3.7-Plus. Ces mesures, ainsi que les chiffres de coût et de vitesse, proviennent de la publication de l’entreprise telle que rapportée par Pandaily ; aucun test indépendant n’est cité ici. Le modèle doit donc plutôt être décrit comme un prototype et une invitation à valider l’architecture de Qwen4, plutôt que comme un système de production finalisé.
Commentaires
Chargement du fil…
Connectez-vous pour écrire un commentaire. Se connecter