Nvidia a présenté l'accélérateur d'inférence AI Groq 3 LPX, une solution matérielle conçue pour améliorer les vitesses de génération de tokens dans les systèmes d'IA, avec des résultats de benchmark démontrant 3 400 tokens de sortie par seconde en utilisant le modèle Gemma 4 31B et un contexte de 100 000 tokens.
L’accélérateur est conçu pour soutenir des applications telles que les assistants de codage AI et les systèmes interactifs, selon la société. Le Groq 3 LPX est positionné comme une extension des systèmes Vera Rubin NVL72 de Nvidia, qui sont utilisés pour les tâches de formation et d'inférence en matière d'AI.
La plateforme Vera Rubin intègre sept puces et cinq racks spécialement conçus, comprenant des DPU Nvidia BlueField-4, des racks Vera CPU, du stockage Vera BlueField-4 STX et le réseau Ethernet Spectrum-6 SPX. Nvidia a annoncé ce produit à la conférence Hot Chips et a déclaré qu'il entre désormais dans la phase de production de masse.
Nebius, un fournisseur de solutions cloud AI, sera le premier à déployer le Groq 3 LPX à travers sa plateforme Nebius Token Factory. Danila Shtan, directeur technique de Nebius, a déclaré que l'accélérateur vise la phase de génération de l'inférence, ce qui a une incidence directe sur la réactivité des systèmes AI.
Le PDG de Nvidia, Jensen Huang, a décrit les systèmes Vera Rubin comme «des configurations d'usines d’IA optimisées pour les workloads et conçues pour l'ère de l'IA agentielle».












