Jeudi 27 août 2026

Aube.

Les nouvelles du progrès
En productionCorroboré · 3 sources

NVIDIA met Groq 3 LPX en production pour l'inférence IA

Langues de cet articleComparer à l’original

Traduit par IA, langue d’origine : anglais — voir le texte original. 2 langues disponibles, la vôtre s’ajoute en un clic.

Un agent IA qui vérifie des fichiers, écrit et teste du code, appelle des outils et valide ses résultats se heurte à un goulot d'étranglement récurrent : générer assez rapidement les éléments de texte suivants pour maintenir le flux de travail. NVIDIA affirme que Groq 3 LPX, un accélérateur dédié à l'inférence IA, est désormais en pleine production dans le cadre de sa plateforme Vera Rubin, avec pour objectif d'augmenter la vitesse de génération de jetons de ces systèmes agentiques.

L'entreprise a annoncé 3 400 jetons de sortie par seconde sur Gemma 4 31B avec une fenêtre de contexte de 100 000 jetons, en citant des résultats de benchmark d'Artificial Analysis. NVIDIA présente ce chiffre comme un point de référence pour l'inférence agentique avec un contexte étendu et affirme que Groq 3 LPX peut réduire le temps d'exécution de certains flux de travail liés au code et améliorer la réactivité dans les usages sensibles à la latence.

La logique est simple : les systèmes agentiques génèrent souvent de nombreux jetons au fil de nombreuses étapes d'inférence, tout en travaillant avec de grandes quantités de contexte. Groq 3 LPX est conçu pour augmenter le débit de génération pour chaque utilisateur. Les systèmes Vera Rubin NVL72 sont destinés à prendre en charge à la fois l'entraînement et l'inférence, le LPX venant renforcer les performances d'inférence dans les déploiements d'usines d'IA à l'échelle du rack.

Le déploiement cloud de Nebius reste un projet. Nebius prévoit de déployer Groq 3 LPX dans Nebius Token Factory, sa plateforme d'inférence en production, afin d'offrir un débit de génération de jetons supérieur aux développeurs qui créent des applications d'IA agentique. Groq prévoit également d'en être un des premiers utilisateurs. NVIDIA décrit la plateforme Vera Rubin dans son ensemble comme regroupant sept puces et cinq types de racks, dont des composants de réseau et de stockage BlueField-4.

Alors, qu'est-ce que cela change concrètement ? Si les déploiements prévus fournissent les performances annoncées, les développeurs pourraient bénéficier d'agents plus réactifs pour les charges de travail qui appellent à plusieurs reprises des outils, inspectent des données et testent du code, en particulier lorsque les fenêtres de contexte sont grandes. La limite est tout aussi claire : le résultat de 3 400 jetons est un benchmark communiqué par NVIDIA à partir de données d'Artificial Analysis, et l'intérêt du produit variera selon le modèle, le contexte et la charge de travail.

3 400 jetons de sortie par secondeDébit de génération annoncé sur Gemma 4 31B avec un contexte de 100 000 jetons

Sources — lire les originaux(heure de Paris)

The Korea Herald — TechEN
Data Center DynamicsEN
Engineering.comEN
0000

À lire ensuite

Commentaires

Chargement du fil…

Connectez-vous pour écrire un commentaire. Se connecter