Nvidia stellte den Groq 3 LPX AI-Inferenzbeschleuniger vor, eine Hardware-Lösung, die entwickelt wurde, um die Generierung von Token in KI-Systemen zu verbessern. Benchmark-Ergebnisse zeigen eine Outputgeschwindigkeit von 3.400 Tokens pro Sekunde bei Verwendung des Modells Gemma 4 31B mit einem Kontext von 100.000 Tokens.
Der Akcelerator wurde konzipiert, um Anwendungen wie KI-Code-Assistenten und interaktive KI-Systeme zu unterstützen, so das Unternehmen. Der Groq 3 LPX wird als Erweiterung der Nvidia-Vera Rubin NVL72-Systeme positioniert, die für KI-Trainings- und Inferenz-Workloads verwendet werden.
Die Vera Rubin-Plattform integriert sieben Chips und fünf speziell entwickelte Racks, einschließlich Nvidia BlueField-4-DPUs, Vera-CPU-Racks, Vera BlueField-4 STX-Speicher und Spectrum-6 SPX-Ethernet. Nvidia kündigte das Produkt auf der Konferenz Hot Chips an und erklärte, dass die Serienproduktion bereits gestartet ist.
Nebius, ein Anbieter von KI-Datenzentren, wird der erste sein, der Groq 3 LPX über seine Plattform Nebius Token Factory bereitstellt. Danila Shtan, CTO von Nebius, sagte, der Beschleuniger richtet sich an die Phase der Inferenz, die direkt die Responsivität von KI-Systemen beeinflusst.
Nvidias CEO Jensen Huang beschrieb die Vera-Rubin-Systeme als "Workload-optimierte KI-Werkkonfigurationen, die für die Ära der agentischen KI entwickelt wurden."












