Geburtstagsparadoxon

Die exakte Wahrscheinlichkeit gleicher Geburtstage mit reproduzierbaren Zufallsgruppen vergleichen.

About this tool

Das Modell weist jeder Person unabhängig einen Geburtstag auf einem von 365 gleich wahrscheinlichen Tagen zu. Eine Gruppe zählt als Treffer, wenn mindestens zwei Personen irgendeinen Tag teilen. Schaltjahre, saisonale Geburtenraten und Abhängigkeiten zwischen Geburtstagen werden nicht modelliert. Die Tagindizes 1–365 sind Modellkategorien, keine Kalenderdaten.

Theorie: Für 0 ≤ n ≤ 365 ist die Wahrscheinlichkeit ohne Treffer q = ∏j=0n−1(1 − j/365); die Trefferwahrscheinlichkeit ist p = 1 − q. Bei n = 0 oder 1 gilt exakt p = 0. Bei n = 23 gilt p ≈ 50,73 %. Bei n = 366 folgt p = 1 aus dem Schubfachprinzip. Für n = 365 bleibt q positiv, auch wenn Gleitkommaarithmetik p auf 1 rundet. Gerundete 100%-Werte erhalten ein ≈; q bleibt in den Theoriedetails sichtbar.

Monte Carlo: 0–366 Personen, 100–20.000 Gruppen und einen 32-Bit-Seed (0–4.294.967.295) eingeben, dann starten. Die Schätzung ist die Zahl der Gruppen mit Treffer geteilt durch die Zahl der abgeschlossenen Gruppen. Der Seed reproduziert dieselbe Folge; Pause und Fortsetzen behalten deren Position bei. Jeder Geburtstag einer Gruppe wird gezogen, auch nach dem ersten Treffer. Die letzte Gruppe zeigt nur Tage mit mindestens zwei Personen sowie die Gesamtzahl der Personen und belegten Tage. Beispiele ändern die Gruppengröße, ohne den Seed zu ändern.

Unsicherheit: Nur ein vollständig abgeschlossener Lauf zeigt das zweiseitige nominale 95%-Wilson-Intervall. Mit M Gruppen, k Treffern, p̂ = k/M und z = 1,959963984540054 ist sein Mittelpunkt (p̂ + z²/(2M))/(1 + z²/M); seine halbe Breite ist z√(p̂(1−p̂)/M + z²/(4M²))/(1 + z²/M). Dies ist ein näherungsweises frequentistisches Intervall, keine Zusicherung, dass jeder Lauf den theoretischen Wert enthält. Es gilt für die vor Beginn gewählte Gruppenzahl, nicht als simultanes Konfidenzband beim laufenden Beobachten oder Pausieren. In den deterministischen Modellfällen n = 0, 1 und 366 ersetzt der bekannte exakte Wert die Wilson-Unsicherheit.

Ansicht und Bedienung: ○ markiert die Theorie, × die Stichprobenschätzung; der orange Balken am Ende zeigt das Wilson-Intervall. Eine Schätzung neben dem theoretischen Wert ist gewöhnliche Zufallsschwankung und nicht automatisch ein Fehler. Die Unsicherheit bezieht sich auf wiederholte ideale unabhängige Ziehungen; eine reproduzierbare Pseudozufallsfolge beweist keine statistische Unabhängigkeit. Jede Parameteränderung leert den Lauf, auch fertige Ergebnisse. Wiederholen verwendet denselben Seed und wiederholt deshalb das Ergebnis. Zurücksetzen behält die Eingaben, Navigation erhält gültige Eingaben, und die Rückkehr startet keine Ziehung.

Quellen: MIT 6.041/6.431, Recitation 4 (2010), Aufgabe 1; NIST/SEMATECH e-Handbook §7.2.4.1, Wilson-Konfidenzintervall.