La puce Jalapeño d’OpenAI devance Blackwell en inférence
Lors de Hot Chips, OpenAI a soumis son nouveau système Jalapeño à son premier test public de performances. Sur le benchmark InferenceX de Semianalysis, il a enregistré davantage de jetons par utilisateur et un débit supérieur par kilowatt qu’un système Nvidia Blackwell, selon TechCrunch. Richard Ho, responsable du matériel chez OpenAI, a présenté ce résultat comme un moyen de traiter davantage de tâches d’IA tout en renvoyant les réponses plus rapidement.
L’approche de la puce consiste à réduire les échanges de données autour de l’inférence — le traitement nécessaire pour générer la réponse d’un modèle. OpenAI affirme que Jalapeño conserve l’état du modèle, notamment le cache KV utilisé pendant la génération, à proximité des ressources qui en ont besoin, puis active la combinaison appropriée de calcul, de mémoire et de réseau pour chaque phase. Cette conception vise les délais du préremplissage, qui prépare la requête, ainsi que ceux des communications entre les composants du système.
La puce affiche un TDP de 700W, ou puissance thermique de conception. OpenAI l’a développée avec Broadcom et prévoit de faire de Jalapeño une plateforme multigénérationnelle, en coordonnant ses produits d’IA, ses modèles, ses puces et sa mémoire plutôt qu’en considérant le processeur comme un composant isolé.
Le calendrier est important. Ho estime que Jalapeño sera déployée en très faible volume à la fin 2026, avec un déploiement plus important en 2027. La comparaison du benchmark porte sur un système Nvidia Blackwell disponible aujourd’hui, tandis que d’autres processeurs pourraient avoir progressé au moment du déploiement de Jalapeño à grande échelle.
Qu’est-ce que cela change en pratique ? Si l’avantage observé sur le benchmark se confirme en dehors du test, les opérateurs d’IA pourraient gérer davantage d’utilisateurs pour chaque unité de puissance et réduire les délais de réponse. Pour l’instant, il s’agit d’un résultat de benchmark et d’un déploiement prévu, pas d’un déploiement en production à grande échelle.
Commentaires
Chargement du fil…
Connectez-vous pour écrire un commentaire. Se connecter