Jeudi 27 août 2026

Aube.

Les nouvelles du progrès
Original et traduction

NVIDIA met Groq 3 LPX en production pour l'inférence IA

Quitter la comparaison

Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.

Original · anglais
NVIDIA puts Groq 3 LPX into production for AI inference
Traduction · français
NVIDIA met Groq 3 LPX en production pour l'inférence IA
Original · anglais
Groq 3 LPX is now in full production as part of NVIDIA’s Vera Rubin platform.
Traduction · français
Groq 3 LPX est désormais en pleine production dans le cadre de la plateforme Vera Rubin de NVIDIA.
Original · anglais
NVIDIA reported 3,400 output tokens per second on Gemma 4 31B with a 100,000-token context.
Traduction · français
NVIDIA a annoncé 3 400 jetons de sortie par seconde sur Gemma 4 31B avec un contexte de 100 000 jetons.
Original · anglais
Nebius plans to deploy it in Token Factory, with Groq planned as an early adopter.
Traduction · français
Nebius prévoit de le déployer dans Token Factory, tandis que Groq devrait être un des premiers utilisateurs.
Original · anglais

An AI agent checking files, writing and testing code, calling tools and validating its output has one recurring bottleneck: generating the next pieces of text quickly enough to keep the workflow moving. NVIDIA says Groq 3 LPX, an accelerator for AI inference, is now in full production as part of its Vera Rubin platform, aimed at increasing token-generation speed for these agentic systems.

Traduction · français

Un agent IA qui vérifie des fichiers, écrit et teste du code, appelle des outils et valide ses résultats se heurte à un goulot d'étranglement récurrent : générer assez rapidement les éléments de texte suivants pour maintenir le flux de travail. NVIDIA affirme que Groq 3 LPX, un accélérateur dédié à l'inférence IA, est désormais en pleine production dans le cadre de sa plateforme Vera Rubin, avec pour objectif d'augmenter la vitesse de génération de jetons de ces systèmes agentiques.

Original · anglais

The company reported 3,400 output tokens per second on Gemma 4 31B with a 100,000-token context window, citing benchmark results from Artificial Analysis. NVIDIA presents that figure as a reference point for high-context agentic inference, and says Groq 3 LPX can reduce completion time for some coding workflows and improve responsiveness in latency-sensitive uses.

Traduction · français

L'entreprise a annoncé 3 400 jetons de sortie par seconde sur Gemma 4 31B avec une fenêtre de contexte de 100 000 jetons, en citant des résultats de benchmark d'Artificial Analysis. NVIDIA présente ce chiffre comme un point de référence pour l'inférence agentique avec un contexte étendu et affirme que Groq 3 LPX peut réduire le temps d'exécution de certains flux de travail liés au code et améliorer la réactivité dans les usages sensibles à la latence.

Original · anglais

The logic is straightforward: agentic systems often generate many tokens across many inference steps, while also working with large amounts of context. Groq 3 LPX is designed to raise the generation rate for individual users. Vera Rubin NVL72 systems are intended to support both training and inference, with the LPX extending inference performance in rack-scale AI factory deployments.

Traduction · français

La logique est simple : les systèmes agentiques génèrent souvent de nombreux jetons au fil de nombreuses étapes d'inférence, tout en travaillant avec de grandes quantités de contexte. Groq 3 LPX est conçu pour augmenter le débit de génération pour chaque utilisateur. Les systèmes Vera Rubin NVL72 sont destinés à prendre en charge à la fois l'entraînement et l'inférence, le LPX venant renforcer les performances d'inférence dans les déploiements d'usines d'IA à l'échelle du rack.

Original · anglais

Nebius's cloud deployment is still a plan. Nebius intends to deploy Groq 3 LPX in Nebius Token Factory, its production inference platform, to provide higher token-generation throughput for developers building agentic AI applications. Groq also plans to be an early adopter. NVIDIA describes the wider Vera Rubin platform as spanning seven chips and five rack types, including BlueField-4 networking and storage components.

Traduction · français

Le déploiement cloud de Nebius reste un projet. Nebius prévoit de déployer Groq 3 LPX dans Nebius Token Factory, sa plateforme d'inférence en production, afin d'offrir un débit de génération de jetons supérieur aux développeurs qui créent des applications d'IA agentique. Groq prévoit également d'en être un des premiers utilisateurs. NVIDIA décrit la plateforme Vera Rubin dans son ensemble comme regroupant sept puces et cinq types de racks, dont des composants de réseau et de stockage BlueField-4.

Original · anglais

So what does this change in practice? If the planned deployments deliver the stated performance, developers could get more responsive agents for workloads that repeatedly call tools, inspect data and test code, especially when context windows are large. The boundary is equally clear: the 3,400-token result is a benchmark NVIDIA reported from Artificial Analysis, and the product’s benefit will vary by model, context and workload.

Traduction · français

Alors, qu'est-ce que cela change concrètement ? Si les déploiements prévus fournissent les performances annoncées, les développeurs pourraient bénéficier d'agents plus réactifs pour les charges de travail qui appellent à plusieurs reprises des outils, inspectent des données et testent du code, en particulier lorsque les fenêtres de contexte sont grandes. La limite est tout aussi claire : le résultat de 3 400 jetons est un benchmark communiqué par NVIDIA à partir de données d'Artificial Analysis, et l'intérêt du produit variera selon le modèle, le contexte et la charge de travail.

Revenir à l’article