Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
At 11pm Beijing time, Alibaba’s Qwen team put Qwen3.8-Flash online, opening the weights on Hugging Face and ModelScope. It is not just another model in the 3.x line: Alibaba presents it as a technical preview of the next-generation Qwen4 architecture, released early so developers can test the design before the full family arrives.
À 23 h, heure de Pékin, l’équipe Qwen d’Alibaba a mis Qwen3.8-Flash en ligne, en ouvrant ses poids sur Hugging Face et ModelScope. Il ne s’agit pas simplement d’un autre modèle de la gamme 3.x : Alibaba le présente comme un aperçu technique de l’architecture Qwen4 de nouvelle génération, publié en avance pour permettre aux développeurs de tester cette conception avant l’arrivée de la famille complète.
The model’s central trick is selective computing. Its mixture-of-experts design routes each token to relevant experts instead of running every parameter every time. Qwen3.8-Flash has 125 billion parameters, plus a 51-billion-parameter N-gram embedding module, but activates only about 6 billion parameters per token. Alibaba says training costs about one-ninth those of Qwen3.7-Plus.
L’idée centrale du modèle repose sur le calcul sélectif. Sa conception à mélange d’experts dirige chaque token vers les experts pertinents au lieu d’exécuter tous les paramètres à chaque fois. Qwen3.8-Flash compte 125 milliards de paramètres, auxquels s’ajoute un module d’embedding N-gram de 51 milliards de paramètres, mais n’en active qu’environ 6 milliards par token. Alibaba affirme que son coût d’entraînement représente environ un neuvième de celui de Qwen3.7-Plus.
That smaller active footprint is paired with a long memory: 262K tokens natively, extendable to 1 million through YaRN. Alibaba’s GDN-plus-QSA attention system compresses historical information and filters important context through a lightweight indexer; on 1-million-token sequences, the QSA kernel reaches reported speedups of up to 7.6x in prefill and 4.9x in decoding.
Cette empreinte active réduite s’accompagne d’une mémoire étendue : 262K tokens en natif, extensibles à 1 million grâce à YaRN. Le système d’attention GDN-plus-QSA d’Alibaba compresse les informations historiques et filtre les éléments importants du contexte grâce à un indexeur léger ; sur des séquences d’1 million de tokens, le noyau QSA atteint des accélérations annoncées allant jusqu’à 7,6 fois en préremplissage et 4,9 fois en décodage.
And so what, concretely? Developers can download the weights, including an FP8 version that lowers the barrier to local deployment, and experiment with long-document processing, agent workloads and batch data handling. For API users, pricing starts at 1 yuan per million input tokens and 3 yuan per million output tokens, which Alibaba presents as roughly a third of V4 Flash; it says output pricing is roughly one-thirtieth that of many frontier overseas models.
Et concrètement ? Les développeurs peuvent télécharger les poids, notamment une version FP8 qui réduit les obstacles au déploiement local, et expérimenter le traitement de documents longs, les charges de travail d’agents et le traitement de données par lots. Pour les utilisateurs de l’API, les tarifs commencent à 1 yuan par million de tokens d’entrée et 3 yuans par million de tokens de sortie. Alibaba présente ces tarifs comme représentant environ un tiers de ceux de V4 Flash ; l’entreprise affirme que le prix de sortie est environ trente fois inférieur à celui de nombreux modèles de pointe étrangers.
The performance claim is also specific, not just cheaper inference: Alibaba reports scores of 58.7 on DeepSWE 1.1, 62.5 on SWE-bench Pro and 84.5 on AndroidWorld, with stronger coding and office-task results than Qwen3.7-Plus. Those measurements, along with the cost and speed figures, come from the company’s release as reported by Pandaily; no independent test is cited here. The model is therefore best described as a prototype and an invitation to validate Qwen4’s architecture, not as a finished production system.
La revendication de performances est également précise, et pas seulement liée au coût de l’inférence : Alibaba annonce des scores de 58,7 sur DeepSWE 1.1, 62,5 sur SWE-bench Pro et 84,5 sur AndroidWorld, avec de meilleurs résultats en programmation et dans les tâches bureautiques que Qwen3.7-Plus. Ces mesures, ainsi que les chiffres de coût et de vitesse, proviennent de la publication de l’entreprise telle que rapportée par Pandaily ; aucun test indépendant n’est cité ici. Le modèle doit donc plutôt être décrit comme un prototype et une invitation à valider l’architecture de Qwen4, plutôt que comme un système de production finalisé.