Opis szkolenia
R jest jednym z najpopularniejszych środowisk wykorzystywanych do przetwarzania, analizy i wizualizacji danych, tworzenia modeli statystycznych oraz automatyzacji raportowania.
Szkolenie zostało zaprojektowane jako spójny, praktyczny projekt analityczny. Uczestnicy przechodzą przez wszystkie etapy pracy z danymi – od konfiguracji środowiska i importu danych, przez ich czyszczenie, łączenie i analizę, aż po budowę modeli oraz przygotowanie automatycznie odświeżanego raportu.
W trakcie zajęć uczestnicy będą stopniowo tworzyć własny projekt w R na podstawie przygotowanych materiałów i zestawów danych. Każdy kolejny moduł rozwija zagadnienia poznane wcześniej, dzięki czemu uczestnicy wielokrotnie przechodzą przez najważniejsze etapy procesu analitycznego i utrwalają zdobyte umiejętności.
Materiały uzupełniane podczas ćwiczeń utworzą osobisty przewodnik po realizacji projektu analitycznego w R, który po zakończeniu szkolenia pozostanie uczestnikom jako dokumentacja poszkoleniowa.
Po ukończeniu szkolenia uczestnik będzie potrafił samodzielnie przygotować i uporządkować projekt w R, pobierać dane z różnych źródeł, przekształcać i analizować dane, przygotowywać wizualizacje oraz tworzyć powtarzalne raporty analityczne.
Zakres szkolenia
- konfiguracja środowiska R oraz RStudio/Posit,
- organizacja powtarzalnego projektu analitycznego,
- import danych z plików CSV i Excel,
- pobieranie danych z publicznych API, m.in. GUS, Eurostat i NBP,
- połączenie R z bazami danych,
- czyszczenie i przekształcanie danych,
- grupowanie, agregowanie i porównywanie danych,
- łączenie danych pochodzących z różnych źródeł,
- analiza dat i szeregów czasowych,
- przygotowywanie wykresów i wizualizacji,
- budowa rankingów oraz indeksów syntetycznych,
- podstawy modelowania statystycznego i segmentacji,
- przygotowanie raportów w Quarto lub R Markdown,
- automatyzacja analiz i eksport wyników,
- wykorzystanie narzędzi AI do kontroli kodu, dokumentowania pracy oraz wspierania interpretacji wyników,
- praktyczne ćwiczenia realizowane pod opieką prowadzącego.
Odbiorcy szkolenia
Szkolenie jest przeznaczone dla:
- osób rozpoczynających lub planujących rozpocząć pracę z językiem R,
- analityków danych, analityków biznesowych i ekonomicznych,
- osób przygotowujących cykliczne analizy, zestawienia i raporty,
- pracowników wykorzystujących w pracy dane z Excela, plików CSV, baz danych lub źródeł publicznych,
- osób chcących zautomatyzować przetwarzanie i analizowanie danych,
- osób, które chcą uporządkować swoją wiedzę i poznać pełny proces realizacji projektu analitycznego.
Od uczestników nie jest wymagana wcześniejsza znajomość języka R. Przydatna będzie natomiast podstawowa umiejętność pracy z tabelami oraz rozumienie podstawowych pojęć związanych z analizą danych.
Forma szkolenia
Szkolenie prowadzone jest w formie praktycznego warsztatu połączonego z niezbędnym wprowadzeniem teoretycznym.
Program szkolenia
1. Konfiguracja środowiska R
- omówienie środowiska R oraz RStudio/Posit,
- instalacja i aktualizacja elementów środowiska,
- tworzenie i organizacja projektu analitycznego,
- praca z projektami .Rproj,
- przygotowanie struktury folderów,
- rozdzielenie danych wejściowych, pośrednich i wynikowych,
- stosowanie ścieżek względnych,
- konwencje nazewnictwa plików i obiektów,
- instalowanie i ładowanie pakietów,
- podstawy pracy z plikami .Rprofile i .Renviron,
- wprowadzenie do Quarto i R Markdown,
- kontrolowane uruchamianie kodu,
- przygotowanie szkieletu powtarzalnego projektu analitycznego.
2Pierwsza analiza danych
- import danych z plików CSV i Excel,
- wprowadzenie do ramek danych i obiektów typu tibble,
- podstawowe typy danych w R,
- kontrola struktury wczytanego zbioru,
- sprawdzanie nazw i typów kolumn,
- identyfikowanie potencjalnych problemów jakościowych,
- wybieranie potrzebnych zmiennych,
- filtrowanie i sortowanie danych,
- obliczanie podstawowych statystyk opisowych,
- przygotowanie pierwszego wykresu,
- wykorzystanie funkcji head(), tail(), str(), summary() i glimpse(),
- podstawy pakietów readr, readxl, tibble, dplyr oraz ggplot2.
3. Czyszczenie i przekształcanie danych
- przygotowanie surowych danych do analizy,
- czyszczenie i ujednolicanie nazw kolumn,
- zmiana typów danych,
- identyfikowanie i obsługa braków danych,
- porządkowanie wartości tekstowych,
- zmiana nazw zmiennych,
- tworzenie nowych kolumn,
- transformacje warunkowe,
- wprowadzenie do operatora pipe,
- zasady organizowania danych zgodnie z koncepcją tidy data,
- rozdzielanie i łączenie kolumn,
- wykorzystanie pakietów dplyr, tidyr, stringr i janitor,
- stosowanie m.in. funkcji mutate(), rename(), case_when(), if_else(), across(), separate() i unite().
4. Agregacje, grupowanie i porównywanie danych
- różnica pomiędzy danymi jednostkowymi a zagregowanymi,
- grupowanie danych według regionów, kategorii i okresów,
- obliczanie sum, średnich, minimum i maksimum,
- liczenie obserwacji,
- tworzenie agregacji warunkowych,
- obliczanie udziałów procentowych,
- budowanie rankingów,
- sortowanie i porównywanie wyników,
- przygotowywanie tabel porównawczych,
- zmiana układu danych z szerokiego na długi i odwrotnie,
- wykorzystanie funkcji group_by(), summarise(), count(), pivot_longer() i pivot_wider(),
- kontrola poprawności poziomu agregacji.
5. Dane publiczne, API i bazy danych
- różnice pomiędzy plikiem, API i bazą danych,
- pobieranie danych ze źródeł publicznych,
- wykorzystanie danych GUS, Eurostat i NBP,
- opcjonalna praca z danymi FRED,
- podstawowe pojęcia związane z API,
- endpointy, parametry zapytań oraz metadane,
- pobieranie danych bezpośrednio do R,
- przetwarzanie danych JSON,
- podstawy łączenia R z bazą danych,
- nawiązywanie i zamykanie połączenia,
- przeglądanie dostępnych tabel,
- selektywny odczyt danych,
- filtrowanie danych przed pobraniem do R,
- praca z tabelami zdalnymi,
- zapisywanie pobranych danych lokalnie,
- wykorzystanie pakietów eurostat, bdl, rnbp, DBI, dbplyr, odbc, RSQLite, duckdb, httr2 i jsonlite.
6. Szeregi czasowe, daty i dynamika zmian
- przygotowywanie i przekształcanie zmiennych daty,
- wykorzystanie pakietu lubridate,
- praca z danymi miesięcznymi, kwartalnymi i rocznymi,
- prawidłowe sortowanie okresów,
- tworzenie opóźnień i przesunięć czasowych,
- obliczanie różnic pomiędzy okresami,
- obliczanie dynamik okres do okresu i rok do roku,
- tworzenie indeksów wartości,
- rozróżnianie poziomu zjawiska od jego dynamiki,
- analiza trendów,
- przygotowanie wykresów szeregów czasowych,
- wykorzystanie funkcji ymd(), year(), month(), quarter(), floor_date(), lag() i lead().
7. Łączenie wielu źródeł danych
- przygotowywanie danych do połączenia,
- identyfikowanie kluczy łączących tabele,
- kontrola unikalności kluczy,
- wykrywanie duplikatów,
- łączenie danych z plików, API i baz danych,
- zastosowanie różnych rodzajów połączeń,
- identyfikowanie rekordów niedopasowanych,
- sprawdzanie jakości połączenia,
- porównanie operacji wykonywanych lokalnie i po stronie bazy danych,
- podejmowanie decyzji, kiedy pobrać dane do pamięci R,
- wykorzystanie funkcji left_join(), inner_join(), anti_join(), semi_join(), distinct() i collect().
8. Budowa indeksów i rankingów
- dobór zmiennych do wskaźnika syntetycznego,
- ocena przydatności danych wejściowych,
- normalizacja i standaryzacja zmiennych,
- określanie kierunku wpływu zmiennej,
- przypisywanie wag,
- agregowanie wielu wskaźników,
- budowa prostego modelu scoringowego,
- tworzenie indeksu syntetycznego,
- przygotowanie rankingu regionów, krajów lub innych jednostek,
- analiza wpływu przyjętych wag na wynik,
- analiza wrażliwości modelu,
- interpretowanie wyników i wskazywanie ograniczeń indeksu,
- wykorzystanie funkcji scale(), rescale(), min_rank() i dense_rank().
9. Modelowanie, segmentacja i krytyka wyniku
- różnica pomiędzy korelacją a zależnością,
- podstawy modelowania statystycznego,
- budowa prostego modelu liniowego,
- interpretacja współczynników modelu,
- analiza podstawowych statystyk modelu,
- analiza reszt,
- podstawy testowania hipotez,
- porównywanie wyników pomiędzy grupami,
- wprowadzenie do segmentacji i grupowania obserwacji,
- grupowanie metodą k-średnich,
- podstawy grupowania hierarchicznego,
- wizualizacja i interpretacja segmentów,
- ocena założeń i ograniczeń modelu,
- przygotowanie krytycznego komentarza do wyników,
- wykorzystanie funkcji lm(), summary(), cor(), t.test(), aov(), kmeans() i hclust().
10. Raport, automatyzacja i wdrożenie analizy
- przekształcenie analizy roboczej w powtarzalny raport,
- przygotowanie raportu w Quarto lub R Markdown,
- organizacja kodu końcowego,
- ustawienia bloków kodu,
- parametryzacja raportu,
- automatyczne odświeżanie wyników,
- tworzenie podstawowych funkcji pomocniczych,
- kontrola błędów,
- uruchamianie całego projektu od początku,
- eksport tabel do Excela,
- eksport wykresów i wyników analizy,
- organizacja folderu z wynikami,
- dokumentowanie założeń i decyzji analitycznych,
- opisywanie ograniczeń analizy,
- wykorzystanie AI do przeglądu kodu i wyszukiwania potencjalnych błędów,
- wykorzystanie AI do przygotowania dokumentacji oraz wspierania interpretacji wyników,
- przygotowanie finalnego, możliwego do przekazania projektu analitycznego.
Prowadzący szkolenie
Piotr Woźniak
Posiada ponad 30 letnie doświadczenie zawodowe jako informatyk, analityk danych, menedżer projektów, menedżer ryzyka oraz konsultant Business Intelligence. Doświadczenie zdobywał w dużych organizacjach z branży finansów i bankowości, prowadząc szereg...
Zobacz profil →