Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
For five days, developers tested an anonymous model called Ox Alpha—“Niu Lai” in Chinese developer circles—on OpenRouter and OpenCode. It processed more than 50 trillion tokens before Zhipu AI confirmed the identity: GLM-5.3-Flash. Usage has since been more than double that of DeepSeek.
Pendant cinq jours, des développeurs ont testé sur OpenRouter et OpenCode un modèle anonyme appelé Ox Alpha — « Niu Lai » dans les cercles de développeurs chinois. Il a traité plus de 50 000 milliards de tokens avant que Zhipu AI n’en confirme l’identité : GLM-5.3-Flash. Son utilisation est depuis plus de deux fois supérieure à celle de DeepSeek.
The hardware behind that traffic is the real change. Zhipu says its inference service—the system that runs a model and generates responses—used more than 100,000 domestic chips, with hardware efficiency and per-token cost comparable to mainstream Nvidia GPUs. LatePost reported that Huawei, Moore Threads and Hygon may supply the chips, but Zhipu has not confirmed the suppliers or models.
Le matériel derrière ce trafic constitue le véritable changement. Zhipu affirme que son service d’inférence — le système qui exécute un modèle et génère des réponses — utilisait plus de 100 000 puces nationales, avec une efficacité matérielle et un coût par token comparables à ceux des GPU Nvidia courants. LatePost a rapporté que Huawei, Moore Threads et Hygon pourraient fournir ces puces, mais Zhipu n’a confirmé ni les fournisseurs ni les modèles.
Zhipu also rebuilt the software around the hardware. To scale toward a context of 1 million tokens, its team used SGLang, W8A8 quantization, mixed INT8/FP8/BF16 cache quantization and node-level tensor parallelism. Its production architecture separates multimodal encoding, prompt processing and token-by-token decoding into independently schedulable pools. Zhipu says the result improved end-to-end service performance 3x over its initial baseline on the same hardware.
Zhipu a également repensé les logiciels autour du matériel. Pour évoluer vers un contexte de 1 million de tokens, son équipe a utilisé SGLang, la quantification W8A8, une quantification mixte du cache INT8/FP8/BF16 et le parallélisme tensoriel au niveau des nœuds. Son architecture de production sépare l’encodage multimodal, le traitement des prompts et le décodage token par token en ensembles pouvant être planifiés indépendamment. Zhipu affirme que le résultat a amélioré de 3x les performances du service de bout en bout par rapport à sa référence initiale sur le même matériel.
For developers, the immediate consequence is access to a low-cost model that has already handled unusually heavy public testing. GLM-5.3-Flash has 320 billion total parameters, with 18 billion activated, and scores 57 on the Artificial Analysis Intelligence Index. Zhipu prices it at about one-tenth of GLM-5.3 and one-fortieth of Claude Opus 4.8.
Pour les développeurs, la conséquence immédiate est l’accès à un modèle peu coûteux qui a déjà supporté une phase de test public exceptionnellement intense. GLM-5.3-Flash compte 320 milliards de paramètres au total, dont 18 milliards activés, et obtient un score de 57 sur l’Artificial Analysis Intelligence Index. Zhipu le facture environ un dixième du prix de GLM-5.3 et un quarantième de celui de Claude Opus 4.8.
The claim still has boundaries. The chip identities have not been disclosed, and the efficiency and cost comparison comes from Zhipu’s technical documentation; no broader hardware equivalence is established here. But a large domestic cluster carrying real model traffic, rather than a lab demonstration, gives chip designers and model developers a concrete target: more usable AI output for less per-token cost.
Cette affirmation a toutefois ses limites. L’identité des puces n’a pas été dévoilée et la comparaison en matière d’efficacité et de coût provient de la documentation technique de Zhipu ; aucune équivalence matérielle plus large n’est établie ici. Mais un vaste cluster national prenant en charge un trafic réel de modèles, plutôt qu’une démonstration en laboratoire, offre aux concepteurs de puces et aux développeurs de modèles une cible concrète : produire davantage de résultats d’IA exploitables à moindre coût par token.