1. Grundbegriffe

Finde hier heraus, welche Grundbegriffe Du schon kennst und mit welchen Du Dich noch beschäftigen musst. Erfahre, was die Grundbegriffe bedeuten. Nur wenn Du die Vokabeln kennst, kannst Du Dich in der Datenanalyse zurecht finden.

Lade Dir hier die Checkliste herunter und hake ab, welche Grundbegriffe Du schon kennst:

Deskriptiv – explorativ – schließend

Deskriptive Methoden werden genutzt, um die Stichprobe und mögliche Unterschiede oder Zusammenhänge zu beschreiben. Dafür berechnest Du Kennwerte wie Mittelwert, Standardabweichung, Median und Häufigkeiten. Auch die Abbildungen und Effektstärkemaße gehören zu den dekriptiven Methoden. Deskriptive Methoden werden auch beschreibende Methoden genannt.

Mit explorativen Methoden versucht man in den Daten mögliche Zusammenhänge, Unterschiede und Strukturen aufzudecken, ohne dass vorab feste Hypothesen formuliert wurden. Explorative Methoden werden auch struktur-entdeckende Methoden genannt. Die Cluster- und die Faktorenanalyse sind beispielsweise explorative Methoden.

Mit schließenden Methoden werden Zusammenhänge, Unterschiede, Effekte oder ganze Modelle auf Signifikanz geprüft und sollen bestätigt werden. Hier liegt immer eine vorab festgelegte Nullhypothese zugrunde. Schließende Methoden werden auch konfirmatorische Methoden oder struktur-prüfende Methoden genannt. Alle Signifikanztests und die statistischen Modelle wie Varianzanalysen und Regressionen und die Strukturgleichungsmodelle sind schließende Methoden.

Untersuchungsobjekt – Grundgesamtheit – Stichprobe

Das Untersuchungsobjekt ist die Einheit, die Du für Deine Datenanalyse untersuchst. Du misst an diesen Untersuchungsobjekten die Merkmale, die Du für Deine Untersuchung brauchst. Das Untersuchungsobjekt kann bei Umfragen zum Beispiel eine Person sein, in der medizinischen Forschung eine Maus oder eine Zelle oder auch Schüler*innen oder Städte oder Aktien.

Die Grundgesamtheit ist die Gesamtheit der Untersuchungsobjekte, für die Deine Forschungsfrage untersucht werden soll und für die Deine Aussagen am Ende gelten sollen. Das können also zum Beispiel Studierende sein oder auch Städte ab einer bestimmten Einwohnerzahl oder Aktien aus einem bestimmten Index zu einem bestimmten Zeitpunkt. Die Grundgesamtheit wird auch Population genannt.

Die Stichprobe ist eine Teilmenge der Grundgesamtheit. Es sind die Untersuchungsobjekte, an denen Du Deine Daten erhebst und auf denen Du Deine Forschungsfrage rechnerisch untersuchen kanst. Die Grundidee der statistischen Methoden ist, dass Deine Stichprobe zufällig aus der Grundgesamtheit gezogen wurde und die Grundgesamtheit repräsentiert. Zufällig bedeutet, dass jedes Objekt der Grundgesamtheit die gleiche Wahrscheinlichkeit hatte, in Deiner Stichprobe zu landen. Das ist in der Praxis selten der Fall.

Variable – Messniveau

Die (statistische) Variable ist das, was Du misst. Ein anderes Wort dafür ist Merkmal. Alles, was Du zur Untersuchung Deiner Fragestellungen und zur Beschreibung Deiner Stichprobe brauchst, musst Du messen, diese Merkmale also erheben.

Variablen haben unterschiedliches Messniveau. Das Messniveau Deiner Variablen zu kennen ist sehr wichtig für die richtige Durchführung der statistischen Analyse. Grob unterscheidet man zwischen nominalen, ordinalen und metrischen Variablen.

Nominale Variablen sind die, die in Kategorien erhoben werden, zum Beispiel Geschlecht als männlich, weiblich, divers. Ordinale Daten werden auch in Kategorien erhoben, aber diese Kategorien folgen einer natürlichen Rangfolge, zum Beispiel Krankheitsstadium in fünf Stufen von sehr schlecht bis sehr gut. Metrische Variablen dagegen werden auf einer (gleichabständigen) Skala gemessen, zum Beispiel das Alter in Jahren oder der Abstand zwischen zwei Städten.

Ein anderes Wort für Messniveau ist Variablentyp.

Abhängige und unabhängige Daten

​Abhängig sind Messungen dann, wenn sie am gleichen Untersuchungsobjekt erhoben wurden. Das trifft zum Beispiel für Messungen über die Zeit zu, oder wenn eine Person in unterschiedlichen Bedingungen mehrmals die gleiche Aufgabe lösen musste. Es handelt sich auch um abhängige Daten, wenn Messungen an Zwillingen oder an paarigen Körperteilen (linkes/rechtes Auge, Ohr, Bein …) durchgeführt wurden. Abhängige Daten werden auch verbundene oder gepaarte Daten genannt.

Unabhängig sind Messwerte dann, wenn sie an unterschiedlichen Untersuchungsobjekten erhoben wurden. Wenn Du zum Beispiel die Motivation einerseits bei Frauen, andererseits bei Männern erhebst, dann sind diese beiden Datensätze unverbunden, da jede Messung nur an einem Untersuchungsobjekt durchgeführt wurde. Unabhängige Daten werden auch unverbundene oder ungepaarte Daten genannt.

Für die Auswahl der statistischen Methoden ist es wichtig zu wissen, ob es sich um abhängige oder unabhängige Daten handelt. Ein Mischen von unabhängigen und abhängigen Daten ist bei den meisten statischen Methoden nicht erlaubt. Kommt so ein Mischen aufgrund des Studiendesigns vor (zum Beispiel weil die Daten eine hierarchische Struktur aufweisen wie Schüler innerhalb von Klassen), so müssen Methoden verwendet werden, die diese Struktur abbilden können (zum Beispiel gemischte Modelle). 

Abhängige und unabhängige Variable

Unabhängige Variablen in einem statistischen Modell sind diejenigen, deren Effekt oder Einfluss auf eine oder mehrere abhängige Variablen untersucht werden soll. Sie sind in expermimentellen Designs diejenigen Variablen, die verändert werden (z.B. durch eine Intervention). Sie werden auch Prädiktor oder Faktor genannt. Unabhängige Variablen können auch Kontrollvariablen sein.

Abhängige Variablen sind die Variablen in einem statistischen Modell, auf die der Einfluss der unabhängigen Variablen untersucht wird. Sie werden auch Kriterium oder Outcome genannt.

Kontrollvariable

​Kontrollvariablen sind technisch gesehen unabhängigen Variablen in einem statistischen Modell. Ihr Einfluss auf die abhängige Variable interessiert allerdings für sich genommen gar nicht. Stattdessen soll dieser Einfluss aus dem Modell und damit aus den Effekten der anderen interessierenden Variablen herausgerechnet werden. Man sagt dann auch, der Einfluss der anderen unabhängigen Variablen ist für die Kontrollvariable(n) kontrolliert. Kontrollvariablen werden auch Kovariaten genannt.

Einfaktoriell – mehrfaktoriell – univariat – bivariat – multivariat

​Mit einfaktoriellen Methoden sind statistische Modelle gemeint, bei denen nur eine unabhängige Variable verwendet wird.

Mehrfaktorielle Methoden dagegen haben mehrere unabhängige Variablen und können auch Interaktionen zwischen diesen unabhängigen Variablen enthalten.​​

Univariate Methoden werden eingesetzt, um die Variablen jeweils einzeln für sich zu untersuchen, zum Beispiel mit deskriptiven Methoden oder Verteilungsuntersuchen. Manchmal werden auch Modelle wie die Varianzanalyse oder die Regression als univariat bezeichnet, obwohl dort immer mindestens zwei Variablen verwendet werden. Man meint damit dann das einfaktorielle Modell (einfaktoriell = eine unabhängige Variable = univariat) oder auch das Modell mit nur einer abhängigen Variablen (eine abhängige Variable = univariat).

Mit dem Begriff bivariate Methoden meint man Methoden, in denen zwei Variablen für die Analyse kombiniert werden, zum Beispiel Korrelationsanalysen. 

​Multivariate Methoden sind Methoden, die mit mehr als zwei Variablen arbeiten. Damit gehören zu dieser Gruppe die oben genannten mehrfaktoriellen Methoden, die mehrere unabhängige Variablen im Modell enthalten und dadurch automatisch mit mindestens drei Variablen arbeiten (mindestens eine abhängige und mehr als eine unabhängige Variable). Zum Beispiel also die mehrfaktoriellen Varianzanalysen oder die mehrfaktoriellen Regressionsanalysen. Aber auch Methoden, die nicht zwischen unabhängigen und abhängigen Variablen unterscheiden und mit mehr als zwei Variablen arbeiten, zum Beispiel die Explorative Faktorenanalyse oder die Clusteranalyse, gehören zur Gruppe der multivariaten Methoden

Hypothesen

In Deiner Datenanalyse untersuchst Du Hypothesen. Für die Statistik entscheidend sind die Alternativ- und die Nullhypothese.

Die Nullhypothese sagt, dass es keinen Unterschied oder keinen Effekt oder keinen Zusammenhang gibt. Der Signifikanztest, den Du rechnest, versucht dann, diese Nullhypothese abzulehnen, und damit den Unterschied, Effekt oder Zusammenhang nachweisen.

Die Alternativhypothese ist das Gegenteil der Nullhypothese und formuliert das, was Du gern nachweisen möchtest: “Es gibt einen Unterschied.” “Es gibt einen Effekt.” “Es gibt einen Zusammenhang.”

Signifikanztest – signifikant

Der Signifikanztest untersucht eine Nullhypothese auf Signifikanz und versucht, sie abzulehnen. Ist der p-Wert kleiner als das Signifikanzniveau (meist 5 %), so sagen wir, der p-Wert ist signifikant. Damit wird die Nullhypothese abgelehnt und gleichzeitig die Alternativhypothese bestätigt. Also wird ein Unterschied, ein Effekt oder ein Zusammenhang als signifikant nachgewiesen.

Signifikant bedeutet »überzufällig«, das heißt, es ist mehr als Zufall, was Du da als Unterschied, Effekt oder Zusammenhang beobachtest.