Jeudi 27 août 2026

Aube.

Les nouvelles du progrès
DéployéCorroboré · 2 sources

GLM-5.3-Flash tourne sur plus de 100 000 puces chinoises

Langues de cet articleComparer à l’original

Traduit par IA, langue d’origine : anglais — voir le texte original. 2 langues disponibles, la vôtre s’ajoute en un clic.

Pendant cinq jours, des développeurs ont testé sur OpenRouter et OpenCode un modèle anonyme appelé Ox Alpha — « Niu Lai » dans les cercles de développeurs chinois. Il a traité plus de 50 000 milliards de tokens avant que Zhipu AI n’en confirme l’identité : GLM-5.3-Flash. Son utilisation est depuis plus de deux fois supérieure à celle de DeepSeek.

Le matériel derrière ce trafic constitue le véritable changement. Zhipu affirme que son service d’inférence — le système qui exécute un modèle et génère des réponses — utilisait plus de 100 000 puces nationales, avec une efficacité matérielle et un coût par token comparables à ceux des GPU Nvidia courants. LatePost a rapporté que Huawei, Moore Threads et Hygon pourraient fournir ces puces, mais Zhipu n’a confirmé ni les fournisseurs ni les modèles.

Zhipu a également repensé les logiciels autour du matériel. Pour évoluer vers un contexte de 1 million de tokens, son équipe a utilisé SGLang, la quantification W8A8, une quantification mixte du cache INT8/FP8/BF16 et le parallélisme tensoriel au niveau des nœuds. Son architecture de production sépare l’encodage multimodal, le traitement des prompts et le décodage token par token en ensembles pouvant être planifiés indépendamment. Zhipu affirme que le résultat a amélioré de 3x les performances du service de bout en bout par rapport à sa référence initiale sur le même matériel.

Pour les développeurs, la conséquence immédiate est l’accès à un modèle peu coûteux qui a déjà supporté une phase de test public exceptionnellement intense. GLM-5.3-Flash compte 320 milliards de paramètres au total, dont 18 milliards activés, et obtient un score de 57 sur l’Artificial Analysis Intelligence Index. Zhipu le facture environ un dixième du prix de GLM-5.3 et un quarantième de celui de Claude Opus 4.8.

Cette affirmation a toutefois ses limites. L’identité des puces n’a pas été dévoilée et la comparaison en matière d’efficacité et de coût provient de la documentation technique de Zhipu ; aucune équivalence matérielle plus large n’est établie ici. Mais un vaste cluster national prenant en charge un trafic réel de modèles, plutôt qu’une démonstration en laboratoire, offre aux concepteurs de puces et aux développeurs de modèles une cible concrète : produire davantage de résultats d’IA exploitables à moindre coût par token.

plus de 100 000 puces nationalesPuces utilisées pour traiter le trafic d’inférence de GLM-5.3-Flash

Sources — lire les originaux(heure de Paris)

PandailyEN
PandailyEN
0000

À lire ensuite

Commentaires

Chargement du fil…

Connectez-vous pour écrire un commentaire. Se connecter