Περιγραφική Στατιστική [Descriptive Statistics]
Εισαγωγή
Η Περιγραφική Στατιστική αποτελεί το πρώτο στάδιο σχεδόν κάθε ανάλυσης δεδομένων. Στόχος της είναι η οργάνωση, η σύνοψη και η παρουσίαση των παρατηρήσεων με τρόπο που επιτρέπει στον ερευνητή να κατανοήσει γρήγορα τη δομή και τα βασικά χαρακτηριστικά ενός συνόλου δεδομένων.
Πριν εφαρμοστούν έλεγχοι υποθέσεων, μοντέλα παλινδρόμησης ή άλλες μέθοδοι επαγωγικής στατιστικής, είναι απαραίτητο να εξεταστούν η κατανομή των μεταβλητών, το κέντρο τους, η διασπορά, η ασυμμετρία, η παρουσία ακραίων τιμών και πιθανές σχέσεις μεταξύ των μεταβλητών.
Η περιγραφική ανάλυση πραγματοποιείται κυρίως με δύο τρόπους: μέσω πινάκων και γραφικών παραστάσεων και μέσω αριθμητικών περιγραφικών μέτρων. Η επιλογή της κατάλληλης τεχνικής εξαρτάται από το είδος της μεταβλητής και τον σκοπό της ανάλυσης.
Πίνακες Συχνοτήτων
Οι πίνακες συχνοτήτων χρησιμοποιούνται ιδιαίτερα για ποιοτικές και διακριτές ποσοτικές μεταβλητές.
Η απόλυτη συχνότητα δείχνει πόσες φορές εμφανίζεται μία συγκεκριμένη τιμή ή κατηγορία, ενώ η σχετική συχνότητα εκφράζει το ποσοστό ή την αναλογία της στο συνολικό δείγμα.
Αν μία κατηγορία εμφανίζεται nin_i φορές σε δείγμα μεγέθους nn, τότε:
fᵢ = nᵢ / n
και ως ποσοστό:
fᵢ% = 100 × fᵢ
Σε διατακτικές ή αριθμητικές μεταβλητές μπορεί επίσης να χρησιμοποιηθεί η αθροιστική συχνότητα, η οποία δείχνει πόσες παρατηρήσεις είναι μικρότερες ή ίσες από μια συγκεκριμένη τιμή.
Μέτρα Κεντρικής Τάσης
Τα μέτρα κεντρικής τάσης συνοψίζουν τη θέση γύρω από την οποία συγκεντρώνονται οι παρατηρήσεις.
Μέση Τιμή
Η αριθμητική μέση τιμή υπολογίζεται ως:
x̄ = Σxᵢ / n
Χρησιμοποιεί όλες τις παρατηρήσεις και αποτελεί βασικό μέτρο για συμμετρικές κατανομές.
Ωστόσο, επηρεάζεται από ακραίες τιμές. Για παράδειγμα, σε δεδομένα εισοδήματος ένας μικρός αριθμός πολύ υψηλών τιμών μπορεί να αυξήσει σημαντικά τον μέσο όρο.
Διάμεσος
Η διάμεσος είναι η τιμή που χωρίζει τις ταξινομημένες παρατηρήσεις σε δύο περίπου ίσα μέρη.
Είναι περισσότερο ανθεκτική στις ακραίες τιμές και επομένως ιδιαίτερα χρήσιμη όταν η κατανομή είναι ασύμμετρη. Το αρχικό αρχείο τονίζει ακριβώς αυτή την ιδιότητά της.
Επικρατούσα Τιμή
Η επικρατούσα τιμή είναι η τιμή ή κατηγορία με τη μεγαλύτερη συχνότητα.
Μπορεί να χρησιμοποιηθεί τόσο σε αριθμητικά όσο και σε κατηγορικά δεδομένα. Μια κατανομή μπορεί να είναι μονοκόρυφη, δικόρυφη ή να παρουσιάζει περισσότερες κορυφές.
Σταθμικός Μέσος
Όταν οι παρατηρήσεις έχουν διαφορετική βαρύτητα, χρησιμοποιείται ο σταθμικός μέσος:
x̄w = Σ(wᵢxᵢ) / Σwᵢ
Η μέθοδος αυτή συναντάται συχνά σε οικονομικά δεδομένα, εκπαιδευτικές βαθμολογίες και σύνθετους δείκτες.
Μέτρα Σχετικής Θέσης
Τα μέτρα σχετικής θέσης δείχνουν τη θέση μιας παρατήρησης σε σχέση με το υπόλοιπο δείγμα.
Τα τεταρτημόρια χωρίζουν τα ταξινομημένα δεδομένα σε τέσσερα τμήματα:
Q1: περίπου 25% των τιμών βρίσκεται χαμηλότερα,
Q2: αντιστοιχεί στη διάμεσο,
Q3: περίπου 75% των τιμών βρίσκεται χαμηλότερα.
Το διάστημα μεταξύ Q1 και Q3 περιλαμβάνει το κεντρικό 50% των παρατηρήσεων.
Οι Z-τιμές επιτρέπουν τη σύγκριση παρατηρήσεων που έχουν μετρηθεί σε διαφορετικές κλίμακες:
Z = (x − x̄) / s
Η Z-τιμή δείχνει πόσες τυπικές αποκλίσεις απέχει μια παρατήρηση από τον μέσο όρο.
Μέτρα Διασποράς
Τα μέτρα διασποράς περιγράφουν πόσο «απλωμένα» είναι τα δεδομένα.
Εύρος
Το εύρος είναι:
R = max − min
Είναι απλό, αλλά εξαρτάται αποκλειστικά από τις δύο ακραίες τιμές.
Ενδοτεταρτημοριακό Εύρος
Το Interquartile Range (IQR) υπολογίζεται:
IQR = Q3 − Q1
και περιγράφει τη διασπορά του κεντρικού 50% των παρατηρήσεων. Επειδή επηρεάζεται λιγότερο από ακραίες τιμές, είναι ιδιαίτερα χρήσιμο σε ασύμμετρες κατανομές.
Διακύμανση
Η δειγματική διακύμανση υπολογίζεται συνήθως ως:
s² = Σ(xᵢ − x̄)² / (n − 1)
Η χρήση του n−1n-1 παρέχει την κλασική αμερόληπτη εκτίμηση της πληθυσμιακής διακύμανσης.
Τυπική Απόκλιση
Η τυπική απόκλιση είναι:
s = √s²
και εκφράζεται στις ίδιες μονάδες με την αρχική μεταβλητή.
Μικρή τυπική απόκλιση σημαίνει ότι οι τιμές είναι σχετικά συγκεντρωμένες γύρω από τον μέσο, ενώ μεγάλη τυπική απόκλιση υποδηλώνει μεγαλύτερη μεταβλητότητα.
Συντελεστής Μεταβλητότητας
Ο συντελεστής μεταβλητότητας υπολογίζεται ως:
CV = (s / x̄) × 100%
Είναι αδιάστατος και μπορεί να χρησιμοποιηθεί για τη σύγκριση της σχετικής μεταβλητότητας μεταξύ ομάδων με διαφορετικές μονάδες ή διαφορετικά επίπεδα μέσων τιμών.
Χρειάζεται όμως προσοχή όταν ο μέσος είναι πολύ κοντά στο μηδέν, καθώς τότε το CV μπορεί να γίνει ασταθές ή παραπλανητικό.
Ασυμμετρία
Η ασυμμετρία περιγράφει τη μη συμμετρική μορφή της κατανομής.
Σε θετική ασυμμετρία, η ουρά εκτείνεται προς τις υψηλές τιμές και συχνά ισχύει:
μέση τιμή > διάμεσος > επικρατούσα τιμή
Σε αρνητική ασυμμετρία, η ουρά εκτείνεται προς τις χαμηλές τιμές και η σχέση αντιστρέφεται.
Το αρχικό αρχείο παρουσιάζει γραφικά τη θετική, την αρνητική και τη συμμετρική κατανομή.
Στη σύγχρονη πρακτική, η ασυμμετρία δεν πρέπει να αξιολογείται αποκλειστικά από έναν συντελεστή. Είναι προτιμότερο να εξετάζεται παράλληλα με ιστόγραμμα, box plot και άλλα περιγραφικά μέτρα.
Κύρτωση
Η κύρτωση σχετίζεται κυρίως με το βάρος των ουρών μιας κατανομής και την πιθανότητα εμφάνισης ακραίων τιμών.
Σε πολλά στατιστικά προγράμματα αναφέρεται η excess kurtosis, όπου η κανονική κατανομή έχει τιμή 0.
Θετικές τιμές υποδηλώνουν βαρύτερες ουρές σε σχέση με την κανονική κατανομή, ενώ αρνητικές τιμές ελαφρύτερες ουρές.
Η σύγχρονη ερμηνεία δεν περιορίζεται απλώς στο αν η κορυφή είναι «οξεία» ή «πλατιά».
Γραφικές Μέθοδοι
Η οπτικοποίηση των δεδομένων αποτελεί βασικό μέρος της διερευνητικής ανάλυσης.
Για κατηγορικές μεταβλητές χρησιμοποιούνται συνήθως ραβδογράμματα.
Για συνεχείς ποσοτικές μεταβλητές χρησιμοποιούνται κυρίως ιστογράμματα, box plots και, σε μικρότερα σύνολα, διαγράμματα μίσχου-φύλλου.
Για τη διερεύνηση σχέσης μεταξύ δύο ποσοτικών μεταβλητών χρησιμοποιείται το scatter plot.
Το αρχικό αρχείο δίνει έναν σαφή οδηγό επιλογής γραφήματος ανάλογα με τον τύπο των μεταβλητών.
Box Plot και Ακραίες Τιμές
Το box plot βασίζεται στην πενταριθμική σύνοψη:
ελάχιστη τιμή,
Q1,
διάμεσος,
Q3,
μέγιστη τιμή.
Η πιο συνηθισμένη πρακτική χρησιμοποιεί τα όρια:
Q1 − 1,5 × IQR
και
Q3 + 1,5 × IQR
για τον εντοπισμό πιθανών ακραίων παρατηρήσεων.
Σημαντικό είναι ότι μια παρατήρηση που χαρακτηρίζεται ως outlier δεν πρέπει να διαγράφεται αυτόματα. Πρέπει πρώτα να διερευνάται αν πρόκειται για λάθος καταχώρισης ή για πραγματική αλλά ακραία παρατήρηση. Το αρχικό υλικό περιγράφει αναλυτικά την κατασκευή του box plot και τα κριτήρια 1,5×IQR και 3×IQR.
Ιστόγραμμα
Το ιστόγραμμα χρησιμοποιείται για ποσοτικές μεταβλητές και παρουσιάζει την κατανομή των παρατηρήσεων σε διαστήματα.
Ένα σημαντικό σημείο είναι ότι, όταν τα διαστήματα έχουν διαφορετικό πλάτος, η συχνότητα πρέπει να αναπαρίσταται από το εμβαδό της στήλης και όχι απλώς από το ύψος της. Αυτό επισημαίνεται και στο αρχικό αρχείο.
Η επιλογή του αριθμού των κλάσεων επηρεάζει σημαντικά την εικόνα του ιστογράμματος. Κανόνες όπως ο Sturges μπορούν να χρησιμοποιηθούν ως αφετηρία, αλλά στη σύγχρονη ανάλυση συχνά προτιμώνται και άλλες μέθοδοι, όπως οι Scott και Freedman–Diaconis.
Περιγραφική και Διερευνητική Ανάλυση Δεδομένων
Η σύγχρονη Περιγραφική Στατιστική συνδέεται στενά με τη Διερευνητική Ανάλυση Δεδομένων (Exploratory Data Analysis – EDA).
Η EDA δεν περιορίζεται σε υπολογισμό αριθμητικών δεικτών. Συνδυάζει γραφήματα, περιγραφικά μέτρα και έλεγχο των δεδομένων ώστε να εντοπιστούν:
ακραίες παρατηρήσεις,
ασυνήθιστες κατανομές,
λανθασμένες τιμές,
σχέσεις μεταξύ μεταβλητών,
πιθανές μη γραμμικότητες,
και προβλήματα ποιότητας δεδομένων.
Συμπεράσματα
Η Περιγραφική Στατιστική αποτελεί τη βάση της σωστής ανάλυσης δεδομένων.
Η μέση τιμή, η διάμεσος, η τυπική απόκλιση και τα τεταρτημόρια δεν πρέπει να αντιμετωπίζονται ως απλοί αριθμοί, αλλά ως συμπληρωματικά εργαλεία περιγραφής της κατανομής.
Παράλληλα, η χρήση ιστογραμμάτων, box plots και scatter plots επιτρέπει την αναγνώριση μοτίβων που δεν είναι δυνατό να αποτυπωθούν μόνο με αριθμητικά μέτρα.
Η σύγχρονη προσέγγιση βασίζεται συνεπώς στον συνδυασμό αριθμητικής και γραφικής διερεύνησης πριν από οποιαδήποτε επαγωγική στατιστική ανάλυση.
Βιβλιογραφία
Field, A. (2018). Discovering statistics using IBM SPSS Statistics (5th ed.). SAGE Publications.
Freedman, D., Pisani, R., & Purves, R. (2007). Statistics (4th ed.). W. W. Norton.
Moore, D. S., McCabe, G. P., & Craig, B. A. (2017). Introduction to the practice of statistics (9th ed.). W. H. Freeman.
Tukey, J. W. (1977). Exploratory data analysis. Addison-Wesley.
Wilcox, R. R. (2017). Introduction to robust estimation and hypothesis testing (4th ed.). Academic Press.
Wasserman, L. (2004). All of statistics: A concise course in statistical inference. Springer.