Jeudi 27 août 2026

Aube.

Les nouvelles du progrès
Original et traduction

Alibaba publie Qwen3.8-Flash, coût divisé par neuf

Quitter la comparaison

Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.

Original · anglais
Alibaba open-sources Qwen3.8-Flash at about one-ninth training cost
Traduction · français
Alibaba publie Qwen3.8-Flash, coût divisé par neuf
Original · anglais
Alibaba calls the 125B-parameter model a technical preview of its next-generation Qwen4 architecture.
Traduction · français
Alibaba présente ce modèle de 125 milliards de paramètres comme un aperçu technique de l’architecture Qwen4 de nouvelle génération.
Original · anglais
Only about 6B parameters activate per token, cutting compute while supporting 262K-token native context.
Traduction · français
Seuls environ 6 milliards de paramètres sont activés par token, ce qui réduit les calculs tout en prenant en charge un contexte natif de 262K tokens.
Original · anglais
FP8 weights are available on Hugging Face and ModelScope; API pricing starts at 1 yuan per million input tokens.
Traduction · français
Les poids FP8 sont disponibles sur Hugging Face et ModelScope ; les tarifs de l’API commencent à 1 yuan par million de tokens d’entrée.
Original · anglais

At 11pm Beijing time, Alibaba’s Qwen team put Qwen3.8-Flash online, opening the weights on Hugging Face and ModelScope. It is not just another model in the 3.x line: Alibaba presents it as a technical preview of the next-generation Qwen4 architecture, released early so developers can test the design before the full family arrives.

Traduction · français

À 23 h, heure de Pékin, l’équipe Qwen d’Alibaba a mis Qwen3.8-Flash en ligne, en ouvrant ses poids sur Hugging Face et ModelScope. Il ne s’agit pas simplement d’un autre modèle de la gamme 3.x : Alibaba le présente comme un aperçu technique de l’architecture Qwen4 de nouvelle génération, publié en avance pour permettre aux développeurs de tester cette conception avant l’arrivée de la famille complète.

Original · anglais

The model’s central trick is selective computing. Its mixture-of-experts design routes each token to relevant experts instead of running every parameter every time. Qwen3.8-Flash has 125 billion parameters, plus a 51-billion-parameter N-gram embedding module, but activates only about 6 billion parameters per token. Alibaba says training costs about one-ninth those of Qwen3.7-Plus.

Traduction · français

L’idée centrale du modèle repose sur le calcul sélectif. Sa conception à mélange d’experts dirige chaque token vers les experts pertinents au lieu d’exécuter tous les paramètres à chaque fois. Qwen3.8-Flash compte 125 milliards de paramètres, auxquels s’ajoute un module d’embedding N-gram de 51 milliards de paramètres, mais n’en active qu’environ 6 milliards par token. Alibaba affirme que son coût d’entraînement représente environ un neuvième de celui de Qwen3.7-Plus.

Original · anglais

That smaller active footprint is paired with a long memory: 262K tokens natively, extendable to 1 million through YaRN. Alibaba’s GDN-plus-QSA attention system compresses historical information and filters important context through a lightweight indexer; on 1-million-token sequences, the QSA kernel reaches reported speedups of up to 7.6x in prefill and 4.9x in decoding.

Traduction · français

Cette empreinte active réduite s’accompagne d’une mémoire étendue : 262K tokens en natif, extensibles à 1 million grâce à YaRN. Le système d’attention GDN-plus-QSA d’Alibaba compresse les informations historiques et filtre les éléments importants du contexte grâce à un indexeur léger ; sur des séquences d’1 million de tokens, le noyau QSA atteint des accélérations annoncées allant jusqu’à 7,6 fois en préremplissage et 4,9 fois en décodage.

Original · anglais

And so what, concretely? Developers can download the weights, including an FP8 version that lowers the barrier to local deployment, and experiment with long-document processing, agent workloads and batch data handling. For API users, pricing starts at 1 yuan per million input tokens and 3 yuan per million output tokens, which Alibaba presents as roughly a third of V4 Flash; it says output pricing is roughly one-thirtieth that of many frontier overseas models.

Traduction · français

Et concrètement ? Les développeurs peuvent télécharger les poids, notamment une version FP8 qui réduit les obstacles au déploiement local, et expérimenter le traitement de documents longs, les charges de travail d’agents et le traitement de données par lots. Pour les utilisateurs de l’API, les tarifs commencent à 1 yuan par million de tokens d’entrée et 3 yuans par million de tokens de sortie. Alibaba présente ces tarifs comme représentant environ un tiers de ceux de V4 Flash ; l’entreprise affirme que le prix de sortie est environ trente fois inférieur à celui de nombreux modèles de pointe étrangers.

Original · anglais

The performance claim is also specific, not just cheaper inference: Alibaba reports scores of 58.7 on DeepSWE 1.1, 62.5 on SWE-bench Pro and 84.5 on AndroidWorld, with stronger coding and office-task results than Qwen3.7-Plus. Those measurements, along with the cost and speed figures, come from the company’s release as reported by Pandaily; no independent test is cited here. The model is therefore best described as a prototype and an invitation to validate Qwen4’s architecture, not as a finished production system.

Traduction · français

La revendication de performances est également précise, et pas seulement liée au coût de l’inférence : Alibaba annonce des scores de 58,7 sur DeepSWE 1.1, 62,5 sur SWE-bench Pro et 84,5 sur AndroidWorld, avec de meilleurs résultats en programmation et dans les tâches bureautiques que Qwen3.7-Plus. Ces mesures, ainsi que les chiffres de coût et de vitesse, proviennent de la publication de l’entreprise telle que rapportée par Pandaily ; aucun test indépendant n’est cité ici. Le modèle doit donc plutôt être décrit comme un prototype et une invitation à valider l’architecture de Qwen4, plutôt que comme un système de production finalisé.

Revenir à l’article