Nvidia hat angekündigt, dass sein Groq 3 LPX Rack in voller Produktion ist, was einen wichtigen Meilenstein nach der Übernahme von Groq für 20 Milliarden Dollar darstellt. Das Groq Rack wird zusammen mit Nvidias Vera-Zentralprozessoren und Rubin-Grafikprozessoren bei neocloud Nebius eingesetzt, wobei die Bereitstellung noch in diesem Jahr erwartet wird.
Dieser Schritt hebt die steigende Nachfrage nach latenzarmer Inferenztechnologie hervor, die entscheidend für die Erstellung reaktionsschneller KI-Anwendungen, insbesondere im Bereich Codierung, ist. Nvidias Senior Director Dion Harris betonte, dass diese Technologie es Cloud-Unternehmen ermöglicht, Premium-Service-Stufen anzubieten, die auf Kunden abzielen, die latenzarme Lösungen benötigen.
Die Groq-Architektur verfügt über 500 Megabyte SRAM auf dem Chip, um Speicherengpässe zu minimieren, und Nvidias LPX-Racks werden 256 Groq 3-Chips beherbergen, die laut Benchmarks von Artificial Analysis in der Lage sind, 3.400 Tokens pro Sekunde zu liefern.
Die Wettbewerbslandschaft umfasst Advanced Micro Devices, das plant, seine Systeme mit Cerebras-Chips zu integrieren und sich auf ähnliche latenzarme Anwendungen zu konzentrieren. Harris stellte klar, dass latenzarme Chips wie Groq keine GPUs ersetzen, sondern spezifische Funktionen innerhalb von KI-Workloads erfüllen.
Nvidia erhöht auch die Lieferungen seiner Vera Rubin-Systeme, wobei CEO Jensen Huang bis 2027 kumulierte Verkäufe von 1 Billion Dollar aus aktuellen und neuen Chipgenerationen prognostiziert. Nvidia wird bald seine Ergebnisse bekannt geben, die weitere Einblicke in die Auswirkungen dieser Entwicklungen bieten werden.