Statistical Data Exploration

ZADANIA

ZADANIE 1 (06.03.2026)

Sprawdzić, czy w szczególnym przypadku dyskryminacji Fisherowskiej da się rozdzielić rzuty klas na optymalny kierunek \(\mathbf{a}\) jeśli obserwacje spełniają następujące cechy:

  1. 3 klasy,
  2. w każdej klasie po 30 punktów z rozkładu normalnego o macierzy \(\mathbf{S} = \left(\begin{array}{cc}1&0\\0&1\\\end{array}\right)\),
  3. średnie w klasach to \(\mathbf{m}_1 = \left(\begin{array}{c}-1\\1\\\end{array}\right)\), \(\mathbf{m}_2 = \left(\begin{array}{c}2\\4\\\end{array}\right)\), \(\mathbf{m}_3 = \left(\begin{array}{c}-2\\2\\\end{array}\right)\).

Wykonać odpowiedni rysunek. Wysłać zarówno kod źródłowy jak i wynikowy rysunek w formacie PNG.

ZADANIE 2 (27.03.2026)

Klasyfikacja zbioru win :-) Dane znajduja się pod adresem, natomiast opis do nich jest tu. Należy:

  1. wczytać dane,
  2. nazwać kolumny (korzystając z opisu),
  3. sprawdzić jakie są parametry klasyfikatorów LDA, QDA i NB na pełnym zbiorze danych (wszystkie składowe obserwacji),
  4. ograniczyc się do 2 pierwszych, 5 pierwszych i 10 pierwszych składowych i sprawdzić skuteczności klasyfikatorów,
  5. ograniczyć się do 2 pierwszych zmiennych, podzielić zbiór (PU/PW/PT) 50/25/25 i w ten sposób dokonać wyboru spośród LDA, QDA, NB.
  6. ograniczyć się do 2 pierwszych zmiennych, wykonać kroswalidację w przypadku LDA, porównac z poprzednim punktem oraz powtórnym podstawieniem.

Jeśli nie jest powiedziane inaczej, ocenę klasyfikatora należy wykonać przez powtórne podstawienie.

ZADANIE 3 (22.04.2026)

Należy wykorzystac zbiór danych dotyczący win (Zad 2) do przetestowania algorytmu kosztu-złożoności. W szczególności należy:

  1. wczytać dane,
  2. nazwać kolumny (korzystając z opisu),
  3. stworzyć pełne drzewo (liście z elementami jednej klasy),
  4. narysować pełne drzewo,
  5. sprawdzić skuteczność pełnego drzewa przez powtórne podstawienie oraz kroswalidację,
  6. wybrać drzewo optymalne (za pomocą alg. kosztu-złożoności), narysować je i porównac wyniki jego skuteczności z pełnym drzewem,
  7. stworzyć drzewo dla pierwszych: dwóch, trzech, czterech, itd. zmiennych - za każdym razem wyznaczyć drzewo optymalne,
  8. wykreślić skuteczność drzewa w funkcji liczby użytych zmiennych, a także różnice rozmiaru drzewa pełnego i optymalnego.

ZADANIE 4 (08.05.2026)

Dla metody BaggingClassifier() należy wykonać podobne obliczenia jak na zajęciach (kroswalidacja za pomocą GridSearchCV() w przypadku 2, 5, 10, 20, 30, 50, i 100 klasyfikatorów), ale jako podstawowego klasyfikatora należy użyć metody \(k_{nn}\). Optymalna wartość parametru \(nn\) powinna zostać znaleziona za pomocą przeszukiwania siatki. Należy skorzystać ze zbioru iris.

ZADANIE 5 (29.05.2026)

Za pomocą funkcji KMeans() sprawdzić rozpoznawanie skupień w zbiorze iris. Przetestować wszystkie kombinacje zmiennych, tzn (0,1); (0,2); (0,3); (1,2); … ;(0,1,2); (0,1,3); … ;(0,1,2,3) gdzie liczba oznacza numer kolumny.

ZADANIE 6 (03.06.2026)

Skorzystaj ze zbioru danych “dwa okręgi”, przedstawionego na Lab. 10 i sprawdź jak będzie się zmieniać skuteczność metody LDA wykonanej na danych przekształconych za pomocą metody kPCA w zależności od wartości parametru \(\gamma\).