Wprowadzenie
Apache Hudi (Hadoop Upserts Deletes and Incrementals) to platforma, która wprowadza do jezior danych możliwości znane z hurtowni i baz danych: modyfikowanie i usuwanie pojedynczych rekordów, transakcyjność, historię zmian oraz przyrostowe odczytywanie danych. Razem z Delta Lake i Apache Iceberg tworzy grupę formatów tabel określanych mianem lakehouse, ale wyróżnia się nastawieniem na aktualizacje w dużej skali, indeksowaniem rekordów oraz wbudowanymi usługami zarządzania tabelą.
Szkolenie Apache Hudi – wprowadzenie prezentuje praktyczne wykorzystanie tej platformy w kontekście przetwarzania Big Data z użyciem Apache Spark.
Podstawowe cele szkolenia
- Zapoznanie z podstawowymi pojęciami i mechanizmami Apache Hudi: kluczem rekordu, polem precombine, partycjonowaniem, osią czasu (timeline) oraz typami tabel Copy-on-Write i Merge-on-Read
- Zrozumienie, co odróżnia Hudi od Delta Lake i Apache Iceberg oraz w jakich zastosowaniach ta różnica ma znaczenie
Główne jego zalety
- Kompleksowe wprowadzenie do Hudi – po zakończonym szkoleniu wiesz, jak wygląda tabela Hudi na poziomie plików i jak przebiega zapis oraz odczyt danych
- Przedstawienie praktycznych przykładów: zapis danych, upsert, zapytania migawkowe (snapshot), podróże w czasie (time travel), usuwanie rekordów oraz analiza wyników z użyciem Spark SQL i DataFrame API
- Praktyka przed teorią – nie tylko wiesz jak, ale także dlaczego
Dla kogo?
Programiści, analitycy i inżynierowie danych, którzy znają podstawy Big Data i Apache Spark oraz chcą poznać nowoczesne formaty tabel dla jezior danych
Wymagania
- Dobra znajomość języka SQL oraz relacyjnego modelu danych
- Podstawowa znajomość Apache Spark (DataFrame API, Spark SQL) oraz języka Python
- Znajomość zagadnień Big Data, systemów plików takich jak HDFS lub magazyny obiektowe oraz formatu Parquet
- Pomocna, choć niewymagana, jest znajomość ogólnej idei formatów lakehouse
Materiały szkoleniowe
- Prezentacja
- Warsztat