Cloudera en NVIDIA versnellen Apache Spark-pipelines
Cloudera heeft de integratie van NVIDIA GPU-acceleratie voor Apache Spark 4.1 in Cloudera Data Engineering aangekondigd. Door de inzet van de NVIDIA CUDA-X cuDF-bibliotheek kunnen organisaties hun datapipelines voor AI-toepassingen drastisch versnellen en tegelijkertijd de cloudkosten in hybride IT-omgevingen verlagen, zonder dat bestaande code herschreven hoeft te worden.
De aankondiging komt op een moment dat datavoorbereiding een van de grootste knelpunten vormt bij enterprise AI-implementaties. Het klaarmaken van grootschalige data via traditionele CPU-infrastructuur duurt vaak uren. Uit recent onderzoek van Cloudera (The Great Re-Architecture Survey) blijkt dat 84 procent van de bedrijven ziet dat AI-workloads de infrastructuurkosten flink laten stijgen.
Tot vier keer snellere dataverwerking zonder codeaanpassingen
Door de integratie van de NVIDIA cuDF-plug-in biedt Cloudera tot wel vier keer snellere workloadverwerking op NVIDIA GPU's in vergelijking met traditionele CPU-omgevingen. Een belangrijk voordeel voor datateams is dat bestaande PySpark- of SQL-code niet hoeft te worden aangepast. Ook handmatige driverconfiguraties zijn niet nodig.
Organisaties kunnen de GPU-acceleratie inzetten over de volle breedte van de Cloudera Anywhere Cloud-architectuur. Dat betekent dat de prestatiewinst behouden blijft in publieke, private, soevereine en on-premises omgevingen, inclusief centrale governance en beveiliging via de Cloudera Unified Data Fabric.
De bottleneck in AI-implementatie wegnemen
“Voor veel organisaties wordt AI niet beperkt door de modellen zelf, maar door hoe snel ze ruwe data kunnen omzetten in betrouwbare, bruikbare inzichten,” licht Leo Brunnick, Chief Product Officer bij Cloudera, toe. “Het versnellen van Spark binnen Cloudera Data Engineering helpt deze bottleneck weg te nemen. Klanten stappen sneller over van datavoorbereiding naar analyses en AI, terwijl governance en beveiliging geborgd blijven.”
Pat Lee, Vice President Strategic Enterprise Partnerships bij NVIDIA, vult aan: “De beste manier om AI-implementaties te versnellen is door aan te sluiten bij hoe bedrijven vandaag de dag al werken. Met de NVIDIA AI-infrastructuur en CUDA-X-bibliotheken native geïntegreerd in Cloudera Data Engineering, verlagen bedrijven de kosten en versnellen ze hun pipelines zonder ook maar één regel code aan te passen.”
De functionaliteit is per direct beschikbaar in Cloudera Data Engineering als onderdeel van Cloudera Anywhere Cloud. Aanvullende demonstraties volgen later dit jaar tijdens NVIDIA GTC in Berlijn en Cloudera EVOLVE in New York.