Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
At Hot Chips, OpenAI put its new Jalapeño system through its first public performance test. On Semianalysis’s InferenceX benchmark, it registered more tokens per user and more throughput per kilowatt than an Nvidia Blackwell system, according to TechCrunch. Richard Ho, OpenAI’s head of hardware, presented the result as a way to serve more AI work while returning answers faster.
Lors de Hot Chips, OpenAI a soumis son nouveau système Jalapeño à son premier test public de performances. Sur le benchmark InferenceX de Semianalysis, il a enregistré davantage de jetons par utilisateur et un débit supérieur par kilowatt qu’un système Nvidia Blackwell, selon TechCrunch. Richard Ho, responsable du matériel chez OpenAI, a présenté ce résultat comme un moyen de traiter davantage de tâches d’IA tout en renvoyant les réponses plus rapidement.
The chip’s approach is to reduce the traffic around inference—the processing involved in generating a model’s response. OpenAI says Jalapeño keeps model state, including the KV cache used during generation, local to the resources that need it, then activates the appropriate mix of computing, memory and networking for each phase. That design targets delays in prefill, which prepares the request, and in communication between system components.
L’approche de la puce consiste à réduire les échanges de données autour de l’inférence — le traitement nécessaire pour générer la réponse d’un modèle. OpenAI affirme que Jalapeño conserve l’état du modèle, notamment le cache KV utilisé pendant la génération, à proximité des ressources qui en ont besoin, puis active la combinaison appropriée de calcul, de mémoire et de réseau pour chaque phase. Cette conception vise les délais du préremplissage, qui prépare la requête, ainsi que ceux des communications entre les composants du système.
The hardware has a listed 700W TDP, or thermal design power. OpenAI developed it with Broadcom and plans to make Jalapeño a multigenerational platform, coordinating its AI products, models, chips and memory rather than treating the processor as an isolated component.
La puce affiche un TDP de 700W, ou puissance thermique de conception. OpenAI l’a développée avec Broadcom et prévoit de faire de Jalapeño une plateforme multigénérationnelle, en coordonnant ses produits d’IA, ses modèles, ses puces et sa mémoire plutôt qu’en considérant le processeur comme un composant isolé.
The timing matters. Ho estimated that Jalapeño would deploy in very small volumes at the end of 2026, with more significant deployment in 2027. The benchmark comparison is with an Nvidia Blackwell system available today, while other processors may have advanced by the time Jalapeño is deployed at scale.
Le calendrier est important. Ho estime que Jalapeño sera déployée en très faible volume à la fin 2026, avec un déploiement plus important en 2027. La comparaison du benchmark porte sur un système Nvidia Blackwell disponible aujourd’hui, tandis que d’autres processeurs pourraient avoir progressé au moment du déploiement de Jalapeño à grande échelle.
So what changes in practice? If the benchmark advantage holds outside the test, AI operators could handle more users for each unit of power and reduce response delays. For now, the evidence is a benchmark result and a planned deployment—not a broad production rollout.
Qu’est-ce que cela change en pratique ? Si l’avantage observé sur le benchmark se confirme en dehors du test, les opérateurs d’IA pourraient gérer davantage d’utilisateurs pour chaque unité de puissance et réduire les délais de réponse. Pour l’instant, il s’agit d’un résultat de benchmark et d’un déploiement prévu, pas d’un déploiement en production à grande échelle.