Normalverteilung
Hallo Maccel,
Du schreibst: "Genau andersrum ist es doch richtig. Man nimmt die
Normalverteilung an und muß
sie g.g.f. hinterher ablehnen."
Das ist genau der zentrale Punkt in deinen Ausführungen, mit dem ich ein
Problem habe.
Bitte benenne Quellen, die belegen, dass das eine zulässige Vorgehensweise
ist.
https://de.wikipedia.org/wiki/Shapiro-Wilk-Test
Getestet wird auf die Nullhypothese H0
Ich schrieb: "Und dann noch:
https://de.wikipedia.org/wiki/Zentraler_Grenzwertsatz
Hier wird ein Grenzwert erzeugt. Das heißt da soll n-> Unendlich gehen.
Wie hoch das n in der Praxis sein muss, hängt davon ab, wie schnell das
konvergiert. Der Satz sagt nur aus, dass es irgendwann konvergiert."
Du schreibst: "Aber erklärt nicht genau dieser die Annäherung an die
Normalverteilung? "
Der Satz erklärt nichts, er beschreibt, das für n-> Unendlich eine
Annäherung an die Normalverteilung stattfindet.
Du hattest gefragt, warum denn n sehr groß sein muss, ich hatte das mit dem
zentralen Grenzwertsatz begründet.
Du kannst das auch gerne mal selbst ausprobieren: Die Summe von n
Gleichverteilungen ergibt eine Binominalverteilung.
Für n -> Unendlich nähert sich die einer Normalverteilung an.
Programmier das mal, nimm als Beispiel n Mal würfeln. Ermittele die
gemessenen Häufigkeiten.
Verwende einen geprüften Zufallszahlengenerator, bei Donald Knuth findet man
welche.
Jeder kennt das von Würfelspielen: Wie oft hat man den Eindruck, dass der
Würfel nicht korrekt ist, weil zum Beispiel jemand 3 Mal hintereinander
eine Sechs würfelt.
Man braucht sehr viele Würfe, um das zu überprüfen.
Genau dafür hatte ich mal eine Excel-tabelle gemacht. Allerdings um zu zeigen, dass dann die Fläche unter der Kurve der Verteilung die Wahrscheinlichkeit ist.
Du schreibst: "Woran machst du dass fest? Die zwei Kurven (Männer,
Frauen) sehen für sich
doch normalverteilt aus?"
Um mal polemisch zu werden: Die Gauss'sche Kurve wird als Glockenkurve
bezeichnet.
Die Glocke würde ich nicht kaufen. Ich sehe sofort, dass die Kurve schief
ist.
Es wird doch auch nur von 'annähernd' normalverteilt geschrieben. Die mögliche leichte Schiefe ändert doch nichts an der Aussage. Übrigens ist diese in den Kurven in der später zitierten ourwoarldindata daten nicht mehr sichtbar, also für mich..
Leider haben die Mittelwert und Streuung nicht angegeben.
Die findet man anderswo: Für Frauen: Mittelwert 165,4 cm Streung: 4,5cm.
Wenn man sich nicht auf das Auge, sondern auf Berechnung verlässt, fällt
sofort auf, auf dass der Mittelwert nicht mit dem Maximum zusammenfällt.
Auf welche Grafik beziehst du dich? Die in Wiki: Körpergröße? Dort tut er es! Er verschiebt sich vielleicht um 0,irgenwas nach rechts. Das liegt meiner Meinung daran, dass man den Mittelwert nicht in den Plot integriert hat und womöglich eine leichte Schiefe vorliegt (Frauen).
5 Sigma wären 22,5cm.
Damit ist Mittelwert minus 4-5 Sigma 141,9-145,3 plus 4-5 Sigma 183,5-187,9
Bei Normalverteilung sollten nur 2.867865e-7 in einem der beiden Bereiche
liegen.
Kaiserslautern hat ca. 100000 Einwohner.
Wenn ich durch die Stadt laufe, sehe ich alle Nase lang jemanden dessen
Köpergröße erkennbar in diesem Bereich liegt.
Auch im Betrieb oder beim Sport treffe ich solche Menschen.
Das Hauptproblem bei der Normalverteilung ist, dass die Wahrscheinlichkeit zu
schnell sinkt.
Du solltest deine Quelle für die Daten gegenchecken! Sigma (Frauen) ist in Europa eher bei 7 cm. Ich komme damit für dein Intervall auf
130 - 137 ccm und nach oben auf 193 - 200 cm. Die Körpergrößen könnten auch in Kaiserslautern seltener sein...
Quelle: https://ourworldindata.org/human-height
Das sieht man übrigens auch in der Graphik der Körpergrößen. Dazu braucht man
aber etwas Erfahrung.
Ich finde Körpergrößen interessant, weil die ja die Folge eines
Wachstumsprozesses ist, wie zum Beispiel auch die Sporengröße.
Jetzt komme ich noch zur Güte der statistischen Daten: Da ist zunächst ein
Mal der Nullpunkt abgeschnitten.
Eine der in "How to lie with statistics" benannten Methoden.
Welchen Nullpunkt wo? Wenn du die Wiki-Seite meinst: Ist doch egal, es geht nicht um die Extreme.
Das größere Problem ist aber folgendes: Die Statistik wurde mit Hilfe
freiwilliger Meldungen beim Mikrozensus erstellt.
Ein weiterer bekannter Trick: Diejenigen, die etwas angeben sind eine
Auswahl, die einen "Bias" ergibt, einen systematischen Fehler.
Wer seine Größe als viel zu groß oder zu klein empfindet macht keine Meldung.
Ich war als Kind selbst ungewöhnlich klein, heute bin ich nur noch klein.
Ich litt darunter.
Ich kenne mehrere Leute, die als Erwachsene ungewöhnlich klein sind und die
leider alle darunter und haben das wahrscheinlich nicht angegeben.
Das ist nicht schön und deshalb haben wir Diskriminierungsstellen. Aber die Daten sind vom statistischen Bundesamt. Willst du deren Vorgehensweise in Frage stellen?
Jetzt übertrage ich das mal auf die Sporenmessung: Was machst Du, wenn Du
etwas findest, bei dem Du nicht sicher bist, ob das eine Spore der
gesuchten Art ist?
Du hast da nur zwei schlechte Möglichkeiten.
Du misst nicht, dann machst Du einen Fehler, wenn das eine Spore der Art ist.
Du misst, dann machst Du einen Fehler, wenn es keine Spore der Art ist.
Man kann vermuten, dass das bevorzugte Vorgehen, von dem abhängt, der die
Messung macht.
Um das Problem zu umgehen, habe ich schon lange vorgeschlagen, lieber am Bild zu messen und darin grundsätzlich alle richtig liegenden Sporen zu messen (Zufall), sofern sie nicht defekt, zu jung oder offensichtlich Fremdsporen sind.
Wenn Du dann zum Beispiel geschätzte Mittelwerte und Streuungen aus
Sporenmessungen verschiedener Menschen vergleichst, die dieselbe Art vor
sich hatten, macht das ein Problem.
Du müsstest verschieden Menschen die gleichen Sporen messen lassen, um das
abzuschätzen.
Ja, man könnte ein oder mehrere Standardbilder mit Sporen verschiedener Arten und Ausprägungen zur Verfügung stellen, welche von Experten vermessen wurden. An den Ergebnissen kann sich dann jeder selbst vergleichen. Natürlich darf auf den bereitgestellten Bildern dann die Vermessung nicht sichbar sein. Damit könnte man auch sytematische Fehler erkennen.
Ich habe noch etwas zu Herrn Gosset recherchiert: William Sealy Gosset was an
English statistician, chemist and brewer who worked for Guinness.
Gosset attended Winchester College before matriculating as Winchester Scholar
in natural sciences and mathematics.
Er war also der Chefbrauer bei Guiness und hatte eine mathematische
Ausbilung.
Als Techniker würde ich ihn nicht bezeichnen.
Da er wegen seines Arbeitgebers seine Ausführung nur anonym als
"Student" veröffentlichen konnte, liegt folgendes nahe: Er
versuchte die Prozesse beim Brauen zu optimieren.
Die normale Vorgehensweise dabei ist: Wir erstellen ein dynamisches Model des
Prozesses, stellen Gleichungen auf und lassen die mathematischen Modelle
darauf los.
Wie Otto Föllinger in seiner Optimierungsvorlesung erklärt hat, hat man aber
manchmal kein gängiges mathematisches Modell.
Dann bleiben als letzte Rettung statistische Verfahren.
Haben wir ein gängiges mathematisches Modell? Ich kenne keines. Was also bleibt nach Herrn Föllinger?
Herr Gosset wusste als guter Mathematiker, dass man nur etablierte
Optimierungsansätze hat, wenn die Zufallsvariable normalverteilt ist.
Jetzt streitest du die Normalverteilung nicht mehr ab?
Also prüfte er bei seinen Messreihen, ob etwas dagegen spricht, dass sie
näherungsweise normalverteilt sind.
Wenn nein, verwendete er Optimierungsverfahren, die auf einer
Normalverteilung beruhen.
Wie gut seine Ergebnisse waren, ist vermutlich Firmengeheimnis von Guiness.
Wie sagt aber ein Dozent auf der Uni in solchen Fällen: Besser ein dreckiger
Hals als gar kein Hals.
Es ist also vollkommen in Ordnung, das zu versuchen.
Es ist aber nicht in Ordnung irgendwelche Wahrscheinlichkeiten zu benennen,
wenn ich nicht sehr sicher bin, dass Normalverteilung vorliegt.
Wie du schon schriebst, sicher kann man sich nicht sein. Muß man auch gar nicht. Man kann die Normalverteilung halt nur nicht auf einen bestimmten Niveau ablehnen. Dass ist womöglich das, was geklärt werden muss?
Dazu sollte man sehr viele Daten haben. Bei Sporenmessungen mit < 100
Messungen hat man die aber nicht.
Für die letzte Aussage hätte ich gerne eine Quelle! Einige Ausreißertests funktionieren dann schon gar nicht mehr, wie ich es in Erinnerung habe.
Auch bei medizinischen Untersuchungen mit vielleicht 1000 Probanden kann man
das nicht seriös machen.
Darum geht es hier nicht! Es sind i.d.R. andere Methoden. Hier geht es um die Schätzung der Grundgesamtheit.
Man kann Mittelwert und Streuung angeben oder Regressionsdiagramme zeigen,
alles andere ist Kaffeesatzleserei.
Ja und Nein. Ja, am präzisesten ist Mittelwert und Streuung. Für die Angabe von Populationsgrenzen benötige ich dann aber noch ein Populationsniveau, auf dem ich die Grundgesamtheit schätze.
Nein, andere statistische Werte können uns Informationen über die Güte der Verteilung und ihrer Vergleichbarkeit mit anderen Stichproben liefern.
Es geht nicht nur um Normalverteilungsannahme oder nicht. Es geht um die Falsifizierbarkeit von veröffentlichten Daten und die Vergleichbarkeit mit und von Stichproben.
Was sind denn deine Vorschläge zu Berechnungen zu diesem Thema. Wie würdest du an das Thema herangehen? Also Stichprobenvergleiche, Datennotation und -doku-mentation in Erstbeschreibungen oder Dokumentationen?
Gruß zurück, Jens