AWS vernieuwt Amazon Aurora met directe datalake-integratie
Amazon Web Services (AWS) heeft een nieuwe functionaliteit aangekondigd voor Amazon Aurora PostgreSQL. Gebruikers kunnen vanaf nu rechtstreeks operationele data in hun database combineren met data die is opgeslagen in datalakes in de indelingen Apache Iceberg en Apache Parquet. De vernieuwing maakt een einde aan de noodzaak om ETL-pipelines (extract, transform, load) op te zetten om gestructureerde gegevens uit datalakes naar de operationele database te verplaatsen.
Het rechtstreeks bevragen van externe gegevensbronnen reduceert de operationele complexiteit en vereenvoudigt het bouwen van toepassingen. Ontwikkelaars kunnen via hun bestaande PostgreSQL-applicaties en -tools zowel actuele transacties als historische gegevens analyseren. Dit maakt het eenvoudiger om realtime dashboards te voeden, transacties te verrijken met historische context of AI-agenten te bouwen die realtime en gearchiveerde data moeten combineren. Aurora PostgreSQL ondersteunt bovendien het opvragen van data uit datalakes die worden beheerd in Iceberg REST Catalog (IRC)-compatibele catalogi, waardoor data over meerdere analysesystemen heen toegankelijk wordt zonder duplicatie.
Onder de motorkap speelt technologie van DuckDB een sleutelrol. Het team achter het opensourceproject DuckDB trad recent toe tot Amazon, en hun analytische engine is nu rechtstreeks ingebouwd in Aurora PostgreSQL. Hierdoor kunnen live operationele gegevens – inclusief niet-gecommitteerde wijzigingen – in één enkele SQL-query worden samengevoegd met datalake-bestanden in Amazon S3, S3 Tables en de AWS Glue Data Catalog. Query-optimalisaties zoals predicate pushdown en column pruning zorgen ervoor dat alleen relevante gegevens worden ingelezen, terwijl veelgebruikte data lokaal wordt gecasht voor snellere vervolgzoekopdrachten.
De nieuwe functie is beschikbaar voor Aurora PostgreSQL op de hoofdversies 17 (vanaf versie 17.11) en 18 (vanaf versie 18.6). Om de functionaliteit te gebruiken moeten beheerders een IAM-rol toewijzen en de extensie aurora_analytics inschakelen. Vervolgens kunnen via standaard PostgreSQL-commando's 'foreign tables' worden aangemaakt, waarbij schema's van Parquet- of Iceberg-bestanden automatisch worden uitgelezen.
AWS stelt de functionaliteit direct en zonder extra kosten beschikbaar in alle commerciële AWS-regio's en AWS GovCloud-regio's. Gebruikers betalen uitsluitend voor het incrementele Aurora-rekenvermogen dat zoekopdrachten verbruiken en de standaard S3-aanvraagkosten voor het inlezen van de datalake-bestanden.