Statistical Data Exploration
ZADANIA
ZADANIE 1 (06.03.2026)
Sprawdzić, czy w szczególnym przypadku dyskryminacji Fisherowskiej da
się rozdzielić rzuty klas na optymalny kierunek \(\mathbf{a}\) jeśli obserwacje spełniają
następujące cechy:
- 3 klasy,
- w każdej klasie po 30 punktów z rozkładu normalnego o macierzy \(\mathbf{S} =
\left(\begin{array}{cc}1&0\\0&1\\\end{array}\right)\),
- średnie w klasach to \(\mathbf{m}_1 =
\left(\begin{array}{c}-1\\1\\\end{array}\right)\), \(\mathbf{m}_2 =
\left(\begin{array}{c}2\\4\\\end{array}\right)\), \(\mathbf{m}_3 =
\left(\begin{array}{c}-2\\2\\\end{array}\right)\).
Wykonać odpowiedni rysunek. Wysłać zarówno kod źródłowy jak i
wynikowy rysunek w formacie PNG.
ZADANIE 2 (27.03.2026)
Klasyfikacja zbioru win :-) Dane znajduja się pod adresem,
natomiast opis do nich jest tu.
Należy:
- wczytać dane,
- nazwać kolumny (korzystając z opisu),
- sprawdzić jakie są parametry klasyfikatorów LDA, QDA i NB na pełnym
zbiorze danych (wszystkie składowe obserwacji),
- ograniczyc się do 2 pierwszych, 5 pierwszych i 10 pierwszych
składowych i sprawdzić skuteczności klasyfikatorów,
- ograniczyć się do 2 pierwszych zmiennych, podzielić zbiór (PU/PW/PT)
50/25/25 i w ten sposób dokonać wyboru spośród LDA, QDA, NB.
- ograniczyć się do 2 pierwszych zmiennych, wykonać kroswalidację w
przypadku LDA, porównac z poprzednim punktem oraz powtórnym
podstawieniem.
Jeśli nie jest powiedziane inaczej, ocenę klasyfikatora należy
wykonać przez powtórne podstawienie.
ZADANIE 3 (22.04.2026)
Należy wykorzystac zbiór danych dotyczący win (Zad
2) do przetestowania algorytmu kosztu-złożoności. W
szczególności należy:
- wczytać dane,
- nazwać kolumny (korzystając z opisu),
- stworzyć pełne drzewo (liście z elementami jednej klasy),
- narysować pełne drzewo,
- sprawdzić skuteczność pełnego drzewa przez powtórne podstawienie
oraz kroswalidację,
- wybrać drzewo optymalne (za pomocą alg. kosztu-złożoności),
narysować je i porównac wyniki jego skuteczności z pełnym drzewem,
- stworzyć drzewo dla pierwszych: dwóch, trzech, czterech, itd.
zmiennych - za każdym razem wyznaczyć drzewo optymalne,
- wykreślić skuteczność drzewa w funkcji liczby użytych zmiennych, a
także różnice rozmiaru drzewa pełnego i optymalnego.
ZADANIE 4 (08.05.2026)
Dla metody BaggingClassifier() należy wykonać podobne
obliczenia jak na zajęciach (kroswalidacja za pomocą
GridSearchCV() w przypadku 2, 5, 10, 20, 30, 50, i 100
klasyfikatorów), ale jako podstawowego klasyfikatora należy użyć metody
\(k_{nn}\). Optymalna wartość parametru
\(nn\) powinna zostać znaleziona za
pomocą przeszukiwania siatki. Należy skorzystać ze zbioru
iris.
ZADANIE 5 (29.05.2026)
Za pomocą funkcji KMeans() sprawdzić rozpoznawanie
skupień w zbiorze iris. Przetestować wszystkie kombinacje
zmiennych, tzn (0,1); (0,2); (0,3); (1,2); … ;(0,1,2); (0,1,3); …
;(0,1,2,3) gdzie liczba oznacza numer kolumny.
ZADANIE 6 (03.06.2026)
Skorzystaj ze zbioru danych “dwa okręgi”, przedstawionego na Lab. 10
i sprawdź jak będzie się zmieniać skuteczność metody LDA wykonanej na
danych przekształconych za pomocą metody kPCA w zależności od wartości
parametru \(\gamma\).