Le cluster IA de PaleBlueDot franchit le benchmark de NVIDIA
Un cluster du centre de données de PaleBlueDot AI a passé une semaine à fonctionner en continu à pleine charge, une pression soutenue qui peut révéler les points faibles des grands systèmes d’IA. L’entreprise affirme que son cluster NVIDIA HGX B300 a désormais obtenu le statut NVIDIA Exemplar Cloud après avoir dépassé le seuil de benchmark de NVIDIA dans chacune des recettes de test.
Le résultat couvre six charges d’entraînement de grands modèles : DeepSeek-V3, GPT-OSS, Nemotron-H, Qwen3 et deux configurations de Llama 3.1. PaleBlueDot AI affirme que chaque exécution a dépassé 98 % des performances de référence de NVIDIA, avec différentes architectures de modèles, échelles de paramètres et formats de précision numérique. NVIDIA a créé Exemplar Cloud en 2025 comme référence permettant aux acheteurs de comparer les performances des infrastructures.
Le matériel est conçu pour la partie de l’entraînement de l’IA qui se déroule entre les puces. Chaque nœud de calcul contient huit GPU NVIDIA Blackwell Ultra connectés via NVLink et NVLink Switch. Un réseau InfiniBand non bloquant à 800Gb/s — un système haut débit reliant les ordinateurs — est conçu pour éviter les goulets d’étranglement dans les communications entre les nœuds, tandis que chaque nœud peut atteindre une bande passante cumulée de calcul et de réseau de 6,4 Tb/s. Un système de stockage parallèle et un cache NVMe local de 63,36TB doivent accélérer le chargement des données et les opérations de sauvegarde des points de contrôle.
PaleBlueDot AI indique également avoir testé le calcul, le réseau, le stockage et l’ordonnancement lors d’une simulation de production ininterrompue d’une semaine. Son processus qualité comprend le rodage du matériel, la validation de nœuds individuels et des tests de cluster de longue durée, ainsi qu’une surveillance automatisée et l’isolation des nœuds défaillants. L’entreprise présente ces mesures comme un moyen de réduire les interruptions et les coûts liés à l’inactivité des entraînements.
Alors, qu’est-ce que cela change en pratique ? Pour un laboratoire d’IA ou une entreprise qui prépare un entraînement de grande ampleur, le benchmark de NVIDIA fournit un point de référence pour les achats et l’examen des budgets, tandis que le test de stabilité répond au risque d’échec d’une tâche après plusieurs jours de fonctionnement. Les chiffres sont issus de l’évaluation de NVIDIA et des propres tests de PaleBlueDot AI ; aucun essai indépendant n’est cité, et les éléments fournis n’établissent pas un déploiement client à grande échelle.
Commentaires
Chargement du fil…
Connectez-vous pour écrire un commentaire. Se connecter