Menu Zamknij

Apache Hudi – wprowadzenie

Wprowadzenie

Apache Hudi (Hadoop Upserts Deletes and Incrementals) to platforma, która wprowadza do jezior danych możliwości znane z hurtowni i baz danych: modyfikowanie i usuwanie pojedynczych rekordów, transakcyjność, historię zmian oraz przyrostowe odczytywanie danych. Razem z Delta Lake i Apache Iceberg tworzy grupę formatów tabel określanych mianem lakehouse, ale wyróżnia się nastawieniem na aktualizacje w dużej skali, indeksowaniem rekordów oraz wbudowanymi usługami zarządzania tabelą.

Szkolenie Apache Hudi – wprowadzenie prezentuje praktyczne wykorzystanie tej platformy w kontekście przetwarzania Big Data z użyciem Apache Spark.

Podstawowe cele szkolenia

  • Zapoznanie z podstawowymi pojęciami i mechanizmami Apache Hudi: kluczem rekordu, polem precombine, partycjonowaniem, osią czasu (timeline) oraz typami tabel Copy-on-Write i Merge-on-Read
  • Zrozumienie, co odróżnia Hudi od Delta Lake i Apache Iceberg oraz w jakich zastosowaniach ta różnica ma znaczenie

Główne jego zalety

  • Kompleksowe wprowadzenie do Hudi – po zakończonym szkoleniu wiesz, jak wygląda tabela Hudi na poziomie plików i jak przebiega zapis oraz odczyt danych
  • Przedstawienie praktycznych przykładów: zapis danych, upsert, zapytania migawkowe (snapshot), podróże w czasie (time travel), usuwanie rekordów oraz analiza wyników z użyciem Spark SQL i DataFrame API
  • Praktyka przed teorią – nie tylko wiesz jak, ale także dlaczego

Dla kogo?

Programiści, analitycy i inżynierowie danych, którzy znają podstawy Big Data i Apache Spark oraz chcą poznać nowoczesne formaty tabel dla jezior danych

Wymagania

  • Dobra znajomość języka SQL oraz relacyjnego modelu danych
  • Podstawowa znajomość Apache Spark (DataFrame API, Spark SQL) oraz języka Python
  • Znajomość zagadnień Big Data, systemów plików takich jak HDFS lub magazyny obiektowe oraz formatu Parquet
  • Pomocna, choć niewymagana, jest znajomość ogólnej idei formatów lakehouse

Materiały szkoleniowe