TL;DR: Eine saubere N=1-Beobachtung hat eine Variable, 2–4 Wochen Baseline, eine Beobachtungsphase mit biologisch angemessener Dauer (2 Wochen für Schlaf, 12 Wochen für den Vitamin-D-Serumspiegel), einen Washout bei reversiblen Veränderungen und standardisierte Messungen. Ohne Baseline und Washout werden Placebo und Rauschen gemessen. Ohne lange Phasen wird Anpassung statt Effekt erfasst.
Dieser Artikel ist rein informativ und ersetzt keine ärztliche Beratung. Einnahme, Dosis und Therapie von Medikamenten, Nahrungsergänzungen oder Hormonen gehören ärztlich abgeklärt; die ärztlich festgelegte Dosis ist maßgeblich. Zu Peptiden und nicht zugelassenen Stoffen gibt dieser Artikel ausdrücklich keine Empfehlung zur Anwendung.
Was N=1 wirklich bedeutet
N=1 heißt: Eine einzelne Person ist gleichzeitig Studienleiter, Studienteilnehmer und Datenanalyst. Eine Person, eine konkrete Frage, eine strukturierte Beobachtung. Die Methode ist ein Fundament der Self-Tracking-Community, von Cortisol-Messungen über CGM-Auswertungen bis zu Schlafdaten. Sie ist methodisch anspruchsvoller, als oft angenommen wird.
Das Ziel ist nicht, allgemeingültige Aussagen zu treffen, sondern den persönlichen Verlauf verlässlich einzuordnen. Eine große Studie zeigt den Durchschnittseffekt über viele Menschen. Eine N=1-Auswertung zeigt, wie sich die eigenen Werte verhalten.
Ein Durchschnittswert aus einer Studie sagt dabei nichts darüber, wie stark ein Effekt im Einzelfall ausfällt: Er kann größer sein, kleiner oder gar nicht vorhanden. Ohne Methodik bleibt es bei „ich glaube, es wirkt“, und das ist keine belastbare Grundlage für gesundheitliche Entscheidungen. Solche Entscheidungen treffen Betroffene gemeinsam mit ihrer Ärztin oder ihrem Arzt.
Warum Einzelfälle täuschen
Vor jeder Auswertung lohnt der Blick auf die sechs klassischen Fehlerquellen. Jede von ihnen kann einen nicht existenten Effekt vortäuschen.
Regression zur Mitte. Beginnt eine Beobachtung in einer Phase, in der es einem schlecht geht, bewegt sich der Zustand mit hoher Wahrscheinlichkeit Richtung Durchschnitt, unabhängig von jeder Maßnahme. Genau diese Bewegung wird dann fälschlich der Maßnahme zugeschrieben.
Placebo-Effekt. In Schmerz-, Schlaf- und Stimmungsforschung erklären Placebos 20 bis 40 Prozent des gemessenen Effekts. Die Erwartung, dass etwas hilft, produziert messbare biologische Veränderungen.
Confirmation Bias. Daten, die die eigene Hypothese stützen, fallen stärker auf. Eine gute Schlafnacht wird notiert, die schlechte Nacht zwei Tage später wird vergessen oder auf „zu viel Kaffee“ geschoben.
Novelty-Effekt. Alles Neue verändert kurzfristig Verhalten und Aufmerksamkeit. Eine neue Abendroutine wirkt die ersten zwei Wochen, danach verschwindet der Effekt häufig wieder.
Confounder. Jahreszeit, Training, Schlafqualität, beruflicher Stress, Alkohol, Urlaub, Menstruationszyklus. Jede dieser Variablen kann die Messgrößen stärker beeinflussen als die beobachtete Veränderung.
Messrauschen. Wearables haben typische Abweichungen von 5 bis 15 Prozent. Der Blutdruck schwankt tagesabhängig um 10 bis 20 mmHg. Blutzucker-Messungen variieren nach Tageszeit, Mahlzeit und Schlaf. Einzelmessungen sind fast immer irreführend.
Für tiefere Methodik zur Datenqualität gibt es den Guide zu Wearable-Datenqualität.
Grundprinzipien für verlässliche N=1-Auswertungen
Fünf Prinzipien machen aus einer Selbstbeobachtung eine Auswertung, die eine belastbare Aussage zulässt.
1. Eine Variable gleichzeitig
Methodisch gilt: Nicht mehrere Dinge parallel verändern, etwa ein neues Trainingsprogramm und neue Schlafzeiten zugleich. Jede Veränderung braucht eine komplette Phase, bevor die nächste beginnt. Das ist langsam, aber es ist die einzige Anordnung, die Rückschlüsse auf Ursachen erlaubt. Änderungen an Medikation oder Nahrungsergänzung gehören nicht in Eigenregie, sondern in ärztliche Absprache.
2. Baseline-Phase (2–4 Wochen)
Vor jeder Beobachtung wird der Ist-Zustand erfasst: subjektive Messgrößen (Schlafqualität 1–10, Energie 1–10) und objektive (HRV, Schlafdauer, Gewicht, Blutwerte). Üblich sind mindestens 14 Datenpunkte, besser 21. Ohne Baseline ist unklar, was sich überhaupt verändert hat. Als Orientierung dient die Biomarker-Baseline-Checkliste.
3. Beobachtungsphase mit biologisch sinnvoller Dauer
Die häufigste Fehlerquelle sind zu kurze Phasen. Biologische Systeme brauchen Zeit zur Anpassung. Ein Überblick über typische Zeiträume, in denen sich Messgrößen laut Studienlage verändern können:
| Messgröße | Typischer Zeitraum |
|---|---|
| Schlafparameter (Einschlafzeit, Tiefschlaf) | 2–4 Wochen |
| HRV | 6–8 Wochen |
| Ferritin | 8–12 Wochen |
| Blutfette (LDL, Triglyceride) | 8–12 Wochen |
| Trainingsanpassung (Kraft) | 12 Wochen |
| Vitamin-D-Serumspiegel | 12 Wochen bis Plateau |
Wird nach 10 Tagen ein „Effekt“ sichtbar, ist das fast immer Placebo oder Rauschen.
4. Washout-Phase (bei reversiblen Veränderungen)
Nach der Beobachtungsphase folgen 2 bis 4 Wochen ohne die Veränderung. Beobachtet wird, ob die Messgrößen zur Baseline zurückkehren. Wenn ja, ist das ein starker Hinweis, dass der Verlauf tatsächlich mit der Veränderung zusammenhing. Wenn nicht, hat sich entweder etwas anderes geändert, oder der Effekt ist nicht reversibel (z. B. Trainingsanpassung).
5. Standardisierte Messung
Gleiche Uhrzeit, gleiche Bedingungen, gleiches Vorgehen. Konkret:
- HRV: morgens direkt nach dem Aufwachen, 5 Minuten im Liegen, vor dem Trinken
- Blutdruck: 7-Tage-Mittelwert aus je zwei Messungen morgens und abends
- Gewicht: morgens nüchtern nach dem Toilettengang, gleiche Waage
- Blutzucker (CGM): als Vergleich der nüchterne Morgenwert
- Bluttests: gleiches Labor, gleiche Abnahmebedingungen (siehe Blutabnahme)
Design-Muster für N=1
Drei Designs decken 90 Prozent aller sinnvollen Selbstbeobachtungen ab.
A) ABA-Design (Baseline → Veränderung → Washout). Das einfachste Muster. Es zeigt, ob die Messgröße reversibel auf die Veränderung reagiert. Pro Phase 4 bis 12 Wochen. Geeignet für erste Auswertungen einer Lifestyle-Änderung.
B) ABAB-Design (mehrfach abwechselnd). Der methodische Goldstandard für N=1. Der Zyklus wird einmal wiederholt, was das Risiko senkt, dass ein Confounder den Effekt erklärt. Steigt die Messgröße in beiden B-Phasen und sinkt sie in beiden A-Phasen, ist das starke Evidenz. Gesamtdauer: 16 bis 48 Wochen.
C) Multiple-Crossover mit verblindeter Sequenz. Aus der klinischen Forschung bekannt: Die Beteiligten kennen die Reihenfolge der Phasen nicht. Das eliminiert Placebo-Effekte, ist aber organisatorisch aufwändig. Bei Substanzen gehört es in einen ärztlich oder wissenschaftlich begleiteten Rahmen, nicht in den Selbstversuch.
Vier Beispiele für Messdesigns
Beispiel 1: Abendroutine und Schlafqualität
- Messgrößen: Sleep Score (Wearable), Tiefschlaf-Minuten, Einschlafzeit, subjektive Erholung (1–10)
- Baseline: 2 Wochen ohne Änderung
- Beobachtungsphase: 4 Wochen mit veränderter Abendroutine
- Washout: 2 Wochen zurück zur ursprünglichen Routine
- Auswertung: Mittelwert ± Standardabweichung pro Phase, Vergleich B vs. A1 und A2
Beispiel 2: Kaffee-Cutoff
- Messgrößen: Einschlafzeit, nächtliche HRV, Wake After Sleep Onset (WASO)
- Fragestellung: Geht ein letzter Kaffee um 14 Uhr mit anderen HRV-Werten einher als um 18 Uhr?
- Design: 3 Wochen 14-Uhr-Cutoff, 3 Wochen 18-Uhr-Cutoff, Wiederholung in umgekehrter Reihenfolge
- Auswertung: HRV-Mittelwert pro Bedingung, Differenz als Effektgröße
Beispiel 3: Cortisol im Zeitverlauf
- Messgrößen: Serum-Cortisol morgens (Labor), Speichel-Tagesprofil (4 Messpunkte), subjektiver Stress (1–10)
- Baseline: Blutabnahme und Speichel-Profil in Woche 0
- Verlaufskontrolle: Blutabnahme und Speichel-Profil in Woche 8
- Optional: 4 Wochen später erneute Messung
- Einordnung: Die Interpretation der Laborwerte erfolgt ärztlich
Beispiel 4: CGM-Auswertung mit Mahlzeitenreihenfolge
- Messgrößen: Glukose-Peak, Time in Range (70–140 mg/dl), Area Under Curve 2 h postprandial
- Fragestellung: Geht die Reihenfolge Gemüse → Protein → Kohlenhydrate mit einem anderen Glukose-Peak einher als die umgekehrte Reihenfolge?
- Design: Gleiche Mahlzeit an 7 Tagen in Reihenfolge A, 7 Tagen in Reihenfolge B
- Auswertung: Mittelwert Glukose-Peak A vs. B, Standardabweichung
Dieses Beispiel zeigt: N=1 muss nicht immer Wochen dauern. Für Kurzzeit-Messgrößen wie postprandiale Glukose reicht ein Tagesvergleich. Mehr zur Methodik steht im Insight-Sprint-Leitfaden.
Statistische Auswertung
Ein Statistik-Studium ist für die Auswertung eines N=1 nicht nötig. Vier Werkzeuge reichen für fast alle Fälle.
1. Mittelwert und Standardabweichung pro Phase. Für jede Phase (A1, B1, A2, B2) werden Durchschnitt und Standardabweichung der Messgröße berechnet. Eine Differenz zwischen zwei Phasen gilt als bedeutsam, wenn sie größer ist als die doppelte Standardabweichung der Baseline.
2. Visuelle Inspektion. Eine Laufgrafik mit allen Datenpunkten und markierten Phasengrenzen zeigt Trends oft früher als die Statistik. Ein Sprung in der B-Phase und ein Rückgang in A2 sind visuell überzeugend.
3. Rangkorrelation nach Spearman. Sie zeigt Trends innerhalb einer Phase. Steigt die HRV in Woche 1 bis 4 der B-Phase kontinuierlich, ergibt das eine positive Korrelation zwischen Zeit und Messgröße.
4. t-Test bei ausreichend Datenpunkten. Bei über 30 Messungen pro Phase (typisch bei täglichen Wearable-Daten) kann ein gepaarter t-Test gerechnet werden. p-Werte unter 0,05 sind ein Hinweis, aber im N=1-Kontext kein strenger Beweis.
Wichtig: Signifikante Statistik erfordert viele Datenpunkte. Oft genügt eine saubere Grafik plus Mittelwertvergleich. Die Statistik sollte nicht überfrachtet werden.
Häufige Fehler
Sechs Fehler treten bei fast allen Einsteigern auf.
- Zu kurze Beobachtungsphase. Nach 10 Tagen Schlüsse ziehen, obwohl etwa der Vitamin-D-Serumspiegel noch nicht einmal die Hälfte des Plateaus erreicht hat.
- Mehrere Änderungen gleichzeitig. Neue Gewohnheiten, neues Training und neue Schlafzeiten zugleich. Keine Aussage möglich.
- Einzelmessung statt Wochen-Mittelwert. Ein HRV-Wert sagt nichts. Der 7-Tage-Mittelwert sagt viel.
- Kein Washout. Ohne Washout lassen sich Placebo und Novelty nicht ausschließen.
- Subjektive Messgrößen ohne Verblindung. Wer weiß, dass eine Maßnahme erwartet wird, fühlt sich häufig besser. Das ist ein bekannter Erwartungseffekt.
- Social-Media-Hype als „Evidenz“. Ein Instagram-Post mit Vorher-Nachher-Foto ersetzt kein Experiment. Viele N=1 aus Communities sind schlecht dokumentiert und publication-biased.
Zur Einordnung von Kombinationen mehrerer Ergänzungen und ihrer Wechselwirkungen gibt es den Guide zur Supplement-Stack-Iteration. Auch dort gilt: Einnahme und Kombination gehören ärztlich abgeklärt.
Dokumentation
Die beste Methodik ist ohne saubere Dokumentation wertlos. Ein Logbuch gehört zu jedem N=1.
Üblicherweise erfasst werden täglich:
- Datum und Uhrzeit der beobachteten Veränderung
- Beschwerden oder Nebenwirkungen (GI-Beschwerden, Kopfschmerzen, Hautveränderungen), die ärztlich besprochen werden sollten
- Kontextvariablen: Schlafdauer, Trainingsintensität (1–10), Stress (1–10), Alkohol (Einheiten)
- Besondere Ereignisse (Krankheit, Reise, besonderer Stress)
Exportierbare Daten sind Pflicht. Ein CSV-Export aus dem Tracking-Tool erlaubt später eine saubere Analyse in Spreadsheets oder Statistik-Software. lab2go unterstützt diesen Export für Biomarker und Supplement-Logs. Für Langzeit-Biomarker-Tracking gibt es den Guide zum langfristigen Biomarker-Tracking.
Ethik und Sicherheit
Nicht jede Selbstbeobachtung ist harmlos. Vier Grundsätze dienen dem Schutz vor unnötigem Risiko.
Keine Risiko-Experimente ohne ärztliche Begleitung. Off-Label-Medikamente, Peptide, injizierbare Substanzen und Hormontherapien (TRT, SERMs) gehören in ärztliche Hand, auch wenn sie online erhältlich sind. Dieser Artikel gibt keine Empfehlung zur Anwendung solcher Stoffe.
Abbruchkriterien vorab definieren. Bei welchem Wert oder Symptom wird abgebrochen und ärztlicher Rat eingeholt? Beispiele für Anlässe zur ärztlichen Abklärung: Leberwerte über dem Zweifachen der Norm, Blutdruck über 160/100, Ruheherzfrequenz über 80 bpm, anhaltende Kopfschmerzen über 3 Tage.
Baseline-Blutwerte vor pharmakologischen Maßnahmen. Leberwerte, Nierenwerte, großes Blutbild, CRP, Hormonstatus. Ohne diese Basis ist nicht erkennbar, ob eine später auffällige Laborwertänderung schon vorher bestand. Ob und wann sie erhoben werden, entscheidet die behandelnde Ärztin oder der behandelnde Arzt.
Kontrollintervalle einhalten. Bei Maßnahmen mit Risikoprofil sind Kontrollen alle 4 bis 8 Wochen üblich, nicht erst am Ende, und gehören in ärztliche Hand.
Community und Evidenz-Aggregation
Einzelne N=1 sind Anekdoten. Viele N=1 mit sauberer Methodik können zu Quasi-Evidenz werden. Die Quantified-Self-Bewegung und Wissensplattformen wie Examine.com sammeln solche Daten.
Zwei Warnungen: Publikationsbias existiert auch bei Selbstbeobachtungen. Wer veröffentlicht gerne, dass sich bei ihm nichts verändert hat? Positive Ergebnisse werden häufiger geteilt. Zweitens ersetzt Social-Media-Hype keine wissenschaftliche Einordnung. PubMed und Examine.com bleiben die besseren Referenzen für die Studienlage und erwartbare Effekte.
Eine eigene saubere N=1-Auswertung ist wertvoll, besonders wenn auch Null-Ergebnisse festgehalten werden. Das fördert bessere Methodik.
lab2go als N=1-Plattform
Für eine saubere N=1-Auswertung braucht es vier Komponenten: Biomarker-Trends, Supplement-Log, Kontextwerte, Korrelationen. lab2go deckt Biomarker-Trends, Supplement-Log und Kontextwerte ab; Korrelationen rechnest du selbst.
- Biomarker-Trends: Jeder Bluttest wird im Zeitverlauf gespeichert. So ist sofort sichtbar, wie sich ein Wert wie Vitamin D über die Phasen entwickelt.
- Supplement-Log: Einträge mit Datum und Zeitpunkt, als CSV exportierbar.
- Kontextwerte: HRV, Schlaf, Ruheherzfrequenz oder Trainingsintensität lassen sich als Tageswert manuell eintragen, auf derselben Zeitachse wie die Laborwerte.
- Korrelationen selbst prüfen: Supplement-Log und Biomarker-Trend nebeneinander ansehen und die Auswertung selbst vornehmen.
Ein Blick auf die Features oder die Pläne und Preise zeigt, wie sich Selbstbeobachtungen strukturiert abbilden lassen. lab2go ist ein Tracking-Werkzeug und liefert keine ärztliche Beurteilung.
Fazit: Drei Bausteine einer sauberen N=1-Auswertung
- Eine Frage. Nicht drei. Eine Lifestyle-Variable, eine konkrete Messgröße.
- Drei Phasen. Baseline 2–4 Wochen, Beobachtung mit biologisch sinnvoller Dauer, Washout 2–4 Wochen. Vorab festhalten, was gemessen wird und welches Ergebnis als Treffer gilt.
- Tägliche Dokumentation. Datum, Kontext, CSV-Export am Ende, Mittelwerte pro Phase vergleichen.
Als Einstieg in die Datenerfassung eignet sich die Biomarker-Baseline-Checkliste.
Dieser Artikel ist rein informativ und ersetzt keine ärztliche Beratung. Einnahme, Dosis und Therapie gehören ärztlich abgeklärt; bei pharmakologischen oder invasiven Maßnahmen ist immer ärztlicher Rat einzuholen. Zu Peptiden und nicht zugelassenen Stoffen erfolgt keine Empfehlung zur Anwendung. Self-Tracking ergänzt die Medizin, es ersetzt sie nicht.
FAQ zum Artikel
- Wie lange dauert ein N=1-Experiment methodisch mindestens?
- Das hängt von der Messgröße ab. Der Vitamin-D-Serumspiegel braucht laut Studienlage etwa 12 Wochen bis zum Plateau, Ferritin reagiert in 8 bis 12 Wochen, HRV-Änderungen zeigen sich in 6 bis 8 Wochen, Schlafparameter in 2 bis 4 Wochen. Als Faustregel sollte jede Phase mindestens so lang sein wie die halbe biologische Anpassungszeit. Kürzere Beobachtungen produzieren fast immer Rauschen statt Signal.
- Reicht subjektives Besserfühlen als Beleg für eine Wirkung?
- Nein. Placebo-Effekte erklären in vielen Kontexten 20 bis 40 Prozent der subjektiven Besserung. Dazu kommen Novelty-Effekt, Confirmation Bias und Regression zur Mitte. Ohne Baseline, definierte Messgrößen und eine Washout-Phase lässt sich nicht unterscheiden, ob eine Maßnahme oder die eigene Erwartung zu einer Veränderung geführt hat. Eine einzige Messung ist kein Experiment.
- Was ist ein ABA-Design?
- ABA steht für Baseline (A), Veränderung (B) und Rückkehr zur Baseline (A). Jede Phase dauert je nach Messgröße 4 bis 12 Wochen. Weicht die Messgröße in der B-Phase deutlich vom Baseline-Niveau ab und geht in der zweiten A-Phase wieder zurück, ist das ein Indiz für einen echten Zusammenhang. Das ABAB-Design wiederholt diesen Zyklus und reduziert das Risiko von Störfaktoren zusätzlich.
- Wie viele Messpunkte sind für eine sinnvolle Auswertung nötig?
- Für tägliche Messgrößen wie HRV oder Schlaf werden pro Phase mindestens 14 Datenpunkte empfohlen, besser 21 bis 28. Für wöchentliche Messgrößen wie Nüchternglukose oder Blutdruck genügen oft 7 bis 14 Messungen pro Phase. Bei Laborwerten reicht häufig eine Messung pro Phase, wenn die Phasen lang genug sind. Einzelmessungen sind nie aussagekräftig, üblich ist der Wochen-Mittelwert.
- Welche Rolle spielt Verblindung bei Selbstbeobachtungen?
- Für viele N=1-Auswertungen genügt ein sauberes ABAB-Design ohne Verblindung. Bei subjektiven Messgrößen wie Energie, Stimmung oder Erholung ist Verblindung methodisch wertvoll, weil sie Erwartungseffekte ausschließt. Im Selbstversuch ist sie nur eingeschränkt umsetzbar; bei Substanzen gehört sie in einen ärztlich oder wissenschaftlich begleiteten Rahmen.
- Warum werden mehrere gleichzeitige Veränderungen kritisch gesehen?
- Sobald zwei Variablen gleichzeitig verändert werden, lässt sich ein Effekt nicht mehr zuordnen. Verbessert sich beispielsweise der Schlaf, nachdem mehrere Gewohnheiten gleichzeitig angepasst wurden, bleibt offen, welche davon eine Rolle gespielt hat. Für eine saubere Zuordnung gilt methodisch: eine Variable pro Beobachtung. Änderungen an Medikation oder Nahrungsergänzung gehören ohnehin ärztlich abgeklärt.
- Wie werden Kontextvariablen dokumentiert?
- Üblich ist ein tägliches Logbuch mit Datum, Schlafdauer, Trainingsintensität, Alkohol, Stress und besonderen Ereignissen. In lab2go lassen sich solche Variablen strukturiert erfassen und später als Filter nutzen. Wichtig ist Konsistenz: jeden Tag dieselben Felder, auch wenn nichts Besonderes war. Lücken beeinträchtigen die Auswertbarkeit.
- Welche Statistik wird zur Auswertung verwendet?
- Für die meisten N=1-Auswertungen genügt der Vergleich von Mittelwerten und Standardabweichung pro Phase. Eine Differenz, die größer ist als die doppelte Standardabweichung der Baseline, gilt als bedeutsam. Die Rangkorrelation nach Spearman zeigt Trends innerhalb einer Phase. Ein t-Test setzt über 30 Datenpunkte pro Phase voraus, was bei Wearable-Daten meist erreicht wird. Für viele Fragen genügt eine saubere Laufgrafik.
- Wann sollte eine Selbstbeobachtung ärztlich abgeklärt werden?
- Immer dann, wenn Medikamente, Peptide, injizierbare Substanzen, Hormontherapien, hoch wirksame Stoffe oder Maßnahmen mit bekannten Risiken wie einer Leberbelastung im Spiel sind. Einnahme, Dosis und Therapie gehören in ärztliche Hand; diese Seite gibt dazu keine Empfehlung zur Anwendung. Ärztinnen und Ärzte legen vorab Abbruchkriterien fest und veranlassen vor jeder pharmakologischen Maßnahme ein Basis-Blutbild.
- Wie werden Null-Ergebnisse eingeordnet?
- Als vollwertige Ergebnisse. Null-Ergebnisse sind methodisch ebenso aussagekräftig wie Treffer. In Online-Communities werden sie selten geteilt, was die wahrgenommene Evidenz verzerrt (Publikationsbias). Wenn ein Wert über acht Wochen unverändert bleibt, ist auch das eine echte Information, die sich im eigenen Verlauf festhalten lässt.
Dieser Artikel dient ausschließlich der allgemeinen Information und ersetzt keine individuelle ärztliche Beratung, Diagnose oder Behandlung. Besprich Änderungen an Ernährung, Supplementierung oder Medikation mit einer qualifizierten medizinischen Fachperson.
Maritta Schmid, Heilpraktikerin (Erlaubnis nach dem Heilpraktikergesetz), Erlaubnis nach dem Heilpraktikergesetz, erteilt vom Gesundheitsamt Heilbronn (Februar 2010), Aufsicht: Landratsamt Ostalbkreis – Gesundheitsamt Aalen
Heilpraktikerin & Gründerin
Schwäbisch Gmünd, Deutschland
Verknüpft Gesundheitsdaten, Technologie und praktische Routinen für echte Verhaltensänderung.