Re: Falsche Grafik! Richtige Auswertung kommt jetz

Krötenhocker, (vor 464 Tagen) @ Marcel Weymann

Hallo Marcel,

ich möchte nun auf die konkrete Auswertung eingehen, die Du mir geschickt
hast.
Du schreibst "Ach ja, nicht über die Nachkommastellen wundern. Es sind
zu viele .."
So etwas wie zu viele Nachkommastellen bei berechneten Werten gibt es nicht.
Ich vermute Du hast in der Schule wie ich auch gelernt, dass man nicht mehr
Nachkommastellen angeben soll, als man bei den Eingangsdaten angibt.
Das stammt aus Zeiten, in denen man alles per Hand rechnen musste. Bei
Verwendung von Computern ist das überholt.
Warum man das früher gemacht hat: Es dauert bis ein Mensch zum Beispiel 10000
Multiplikationen durchgeführt hat. Man hat 2 Möglichkeiten solche
Berechnungen effektiv durchzuführen: 1. Mann nimmt große n und rechnet mit
wenig Nachkommastellen.
2. Man nimmt kleinere n und rechnet mit mehr Nachkommastellen.
Die Erfahrung hat gezeigt, dass Methode 1 die besseren Resultate bringt.

Danke für die Aufklärung. Das mit den Nachkommastellen habe ich anders gelernt, aber es geht auch um den Kompromiss zwischen Leserlichkeit und Genauigkeit.
Es ist allerdings egal, wieviele ich angebe, wenn ich die Originaldaten vorhalte und die Nachkommastellen im Prog beliebig einstellbar mache.

Für die Darstellung von Messwerten gelten andere Regeln, die auch bei einer
Eichung geprüft werden.
Messwerte dürfen nicht genauer angegeben werden als die Genauigkeit, für die
das Messinstrument geeicht ist.
Für Auswertungen - wie zum Beispiel Mittelwert oder Streuung - gilt das
nicht, da dürfen zusätzliche Nachkommastellen angegeben werden.
Diese Vorgaben kann man nur verstehen, wenn man sich ein wenig mit
numerischer Mathematik befasst. Stichwort Fehlerfortplanzung

Jupp.

Ich gebe ein Beispiel, welche Fehler man sich einhandelt, wenn man zu früh
rundet: X1 = 1.231
X2 = 1.232
( X2 - X1 ) * 1000
ergibt 1 wenn ungerundet
0 wenn auf 2 Stellen gerundet.
Das ist jetzt ein Trivialbeispiel.

Ja, und es ist bei Sporenmessungungen auch egal. Wir sind hier in der Biologie. Keiner will supergenaue Zahlen lesen, weil die Unterschiede zwischen Sporemessreihen und deren Streuung um den Mittelwert größer sein kann, als man mit Nachkommastellen über 2 anzeigen sollte. Das bedeutet ja nicht, dass man nicht größerer Genauigkeit rechnet. Die Publikation und die Berechnung bleiben zwei paar Schuhe.

Es gibt aber leider auch so etwas ähnliches wie eine Rundung, wenn man eine
Gleitkommazahl im Computer speichert.
Es wird nie der tatsächliche Wert gespeichert, sondern der Wert aus dem
Wertevorrat, der ihm am nächsten ist.
Python hat 64Bit Gleitkommazahlen. Das ist zwar recht genau, aber auch damit
kann man in das Problem laufen, dass ein korrekter Algorithmus aus Gründen
der numerischen Mathematik völlig falsche Ergebnisse liefert.

Aber nicht hier! Da müsstest du dich mit Martin im Nachbarthread und der Unschärfetheorie auseinandersetzen Da bist in den Nachkommastellen.

Im Studium empfahl man darum, immer eine Probe zu machen und zeigte
abschreckende Beispiele, bei denen zum Beispiel ein Gaußscher Algorithmus
zur Lösung von n Gleichungen mit n Unbekannten Unsinn berechnete.

Genau, immer eine PROBE machen. Ich nenne das hier StichPROBE. Darauf basieren erste Scchätzungen zur Grundgesamtheit. Mit vielen Sichproben kommt man vielleicht zu neuen Erkenntnissen.

Wie oben gezeigt sind insbesondere Differenzen von fast gleichen Werten
gefährlich. Man sollte das immer im Auge behalten.
Der Varianzschätzer verwendet zum Beispiel eine Differenz.

Die Unterschiede spielen hier keine Rolle. Es werden Hypothesentests (auch mit der Varianz) auch bei nicht vorhandender Normalverteilung durchgeführt. Dazu wird immer wieder geschrieben, dass die Hyphothesentests relativ robust auf nur annähernde Normalverteilung reagieren.

Nun zu deinem Bild. Du gibst nicht an, wie groß n war.

Das stimmt, sollte aber auch nur ein Beispiel sein, was für Werte ich mit berechne. Weil du z.B. auf den Median hingewiesen hast.

Ich kann nur raten, dass es eher klein war, weil Du nur 6 Balken gebildet
hast.

Die Formel für die Balken (ich glaube du mußt nach bins suchen) findest du bei Wikipedia.

Ich habe mich hier ein wenig sachkundig über KDE Kurven gemacht:
https://de.wikipedia.org/wiki/Kerndichtesch ätzer
Auszug: "Man sieht deutlich, dass die Qualität des Kerndichteschätzers
von der gewählten Bandbreite abhängt.
Eine zu kleine Bandbreite erscheint „verwackelt“, während eine zu große
Bandbreite zu „grob“ ist."
Deine Darstellung scheint mir zu grob zu sein.

Nein, es geht um Vergleichbarkeit. Hier z.B. auch, wie kumulierte Kerndichte mit der kumulierten Normalverteilung korrespondiert. Also für mich. Wenn du gerne etwas anderes sehen möchtest, mach Vorschläge.

Wenn Du aber feiner einteilst, hast Du vermutlich eine stark
"verwackelte" Grafik, weil das n so klein ist, dass
Einzelmessungen einen zu großen Einfluss haben.

Ja, die Anzahl der Balken ist immer ein Kompromiss. Ich bleibe heutzutage lieber bei wenigeren, da ansonsten sofort nur diese Grafik Ausreißer oder Schiefe vermutet wird, wo sie nicht relevant sind/ist.

Deine Grafik zeigt übrigens deutliche Ähnlichkeiten der statistischen
Merkmale mit anderen Grafiken, die ich gesehen habe, die Sporenmessungen
wiedergeben.

So viele Möglichkeiten gibt es da ja nicht. Und es geht auch immer um Vergleichbarkeit.
Und bitte zeige oder nenne mir Beispiele! Ich bin immer auf der Suche nach Optimierungen oder anderen Sichtweisen. Es kann auch immer sein, dass ich mich in etwas verrannt habe oder etwas anders gemacht wird. Man kann nicht alles zum Thema kennen.

Die Verteilung ist deutlich schief, deshalb befinden sich auch Messwerte
außerhalb der von Dir berechneten "Konfidenzintervalls".

Hier bei der Länge ist im Boxplot einer zu sehen (nicht nach der Theorie der Normalverteilung). Aber der Plot zeigt ja nicht die Populationsgrenzen.

Sie sind allerdings deutlich erkennbar nicht weit (in Bezug auf die
geschätzte Streuung) von diesem Intervall entfernt.
Wie man dann auf den Gedanken kommt, diese Messwerte als Ausreißer
auszuschließen, kann ich nicht nachvollziehen.

Über Ausreißertests! Sind nur Theorien, aber nicht widerlegte...

Du siehst nur einen kleinen Ausschnitt und du darfst die Verteilung nicht nur anhand des Boxplots bewerten. Schiefe ergibt sich aus den Daten und ist mit angegeben. Zudem siehst du in den Boxplots die Nähe von Median und Mittelwert.

Ich würde daraus schließen, dass dein Schätzer für das Konfidenzintervall
unzureichende Ergebnisse bringt und diese darum nicht angeben.

"unzureichende Ergebnisse" bringt er für was? Da fehlt mir der Bezug.
Aber was auch immer du da sagen willst, würde mich interessieren, was du stattdessen angeben würdest?

Vielleicht gibt es irgendwo jemanden, der für beliebige Verteilungen einen
besseren Schätzer entworfen hat. Ich kenne so etwas nicht.
Zum Thema Ausreißertests möchte ich zunächst auf folgende Seite verweisen:
https://de.wikipedia.org/wiki/Ausrei ßer
Weiterhin wird hier ein Test angegeben, der ohne die Annahme Normalverteilung
auskommt: https://de.wikipedia.org/wiki/Ausrei ßertest_nach_Walsh
Hier ist explizit n=60 als nötig genannt.

Ich rechne die Ausreisser unter Normalverteilungsannahme. Ich versuche damit soviel Power wie möglich in erste Ergebnisse zu bringen.

Noch ein Nachtrag zum Buch von Werner Jurkeit.
Er zeigt unter anderem Mikrofotos verschiedener Arten, auf denen schon eine
merkliche Anzahl von Sporen pro Art abgebildet sind.
Vielleicht vermesse ich die mal irgendwann und mache statistische
Auswertungen.

Ja, und nach vielen Jahren eigener Erfahrungsammlung liest du dir dann unseren Thread noch einmal durch und du wirst dich fragen, wieso du so viel in Frage gestellt hast?

Fotos haben den großen Vorteil, dass sie still halten und dass man sie
kopieren kann.
Man kann dann vermeiden, dass eine Spore 2 Mal gemessen wird, indem man sie
auf Papier markiert.

Genau das hatte ich schon geschrieben. Ich hoffe in diesem Thread. Allerdings sind wir aus dem Papierzeitalter bei so etwas heraus. Wir benutzen heutzutage digitale Daten. Die kann man am Bildschirm vermessen. Das spart zwar einerseits Papier, aber verbraucht Energie. Der Vorteil ist, dass wir die Daten danach weniger Ressourcenverbrauchend diskutieren oder austauschen können.
Mit der zeitnahen Bilderstellung der Präparate kann man ein mögliches anderes Problem dumgehen: Sporen könnten quellen, wenn sie nicht zeitnahg vermessen werden. Exsikkate auch.

Wenn man keine Zeit mehr zum Weitermachen hat, kann man das am nächsten Tag
machen.
Ich schau mich perspektivisch auch mal nach Programmen zur Mustererkennung
um.

Da hätte ich sogar Tipps, also Sporen betreffend. Leider machen es sich die Autoren mit irgendeinem Myxomyceten dadurch einfach, dass dieser runde Sporen hat.

Marcel,es wäre diskussionsvorantreibender, wenn man nicht immer neue Schubladen aufmacht, sondern auch mal welche zumachen könnte. Du gehst auf nichts weiter ein, was ich gerne klargestellt hätte. Softwareentwickler seit 36 Jahren ohne Programmierkenntnisse z.B.? Oder wann erkennst du an, das es einen Unterschied zwichen endlicher und unendlicher Grundgesamtheit gibt? Ich habe ein wenig das Gefühl, ich werde zum Narren gehalten. Das kännte Shakespeare sein, oder? Jetzt ich:
Meine Zeit für dich ist nur dann sinnvoll, wenn du sie so wertig nimmst, wie du deine Zeit für mich mit Sinnvollem füllst.

VG, Jens


gesamter Thread: