
Gdy w grę wchodzą duże zbiory danych, wizualizacja zależności jest niemal nieodzowną częścią procesu analizy danych. W tym wpisie poruszymy podstawy najpowszechniej używanej do tego celu biblioteki, czyli Matplotlib.

Gdy w grę wchodzą duże zbiory danych, wizualizacja zależności jest niemal nieodzowną częścią procesu analizy danych. W tym wpisie poruszymy podstawy najpowszechniej używanej do tego celu biblioteki, czyli Matplotlib.

Pandas daje użytkownikowi niemal nieograniczone możliwości przetwarzania i analizy danych. W tym wpisie postaramy się przybliżyć w prosty sposób możliwości pakietu, między innymi pobieranie na różne sposoby fragmentów tabel, łączenie datasetów, grupowanie powiązanych danych czy obliczanie statystyk i przekształceń danych.

Pakiet Pandas to kolejna biblioteka, którą trzeba omówić w kontekście wprowadzenia do narzędzi związanych z podstawami Data Science w Python. Pandas świetnie nadaje się do pracy z danymi tabelarycznymi, które w przeciwieństwie do NumPy mogą posiadać kolumny różnych typów. Pozwala, między innymi, na czyszczenie, przetwarzanie czy grupowanie danych w jedno lub dwuwymiarowych tabelach.

Kolejny wpis na temat NumPy. Poruszone tu zostaną bardziej zaawansowane zagadnienia. Skupimy się nad różnicami pomiędzy ndarrays a listami znanymi z Pythona, skąd bierze się wydajność NumPy oraz jak wydajniej indeksowań i wycinać tablice.

Nazwa numpy pochodzi od "numeric python". Pakiet wykorzystywany jest powszechnie, do różnego rodzaju obliczeń matematycznych i operacjach na tablicach wielowymiarowych, również na macierzach. Pora więc przybliżyć sam pakiet, jak i jego najbardziej podstawowe możliwości w pierwszym wpisie opisującym tematy związane z data science.