TL;DR: Una observación N=1 limpia tiene una variable, 2–4 semanas de baseline, una fase de observación de duración biológicamente adecuada (2 semanas para sueño, 12 semanas para la vitamina D sérica), un washout para cambios reversibles y mediciones estandarizadas. Sin baseline ni washout se mide placebo y ruido. Sin fases largas se capta adaptación en lugar de efecto.
Este artículo tiene fines exclusivamente informativos y no sustituye el consejo médico. La toma, la dosis y la terapia de medicamentos, suplementos o hormonas deben consultarse con un médico; la dosis establecida por el médico es la que cuenta. Sobre péptidos y sustancias no autorizadas, este artículo no hace expresamente ninguna recomendación de uso.
Qué significa realmente N=1
N=1 quiere decir que una sola persona es a la vez responsable del estudio, participante y analista de datos. Una persona, una pregunta concreta, una observación estructurada. El método es un pilar de la comunidad de self-tracking, desde mediciones de cortisol y evaluaciones con CGM hasta datos de sueño. Es metodológicamente más exigente de lo que a menudo se supone.
El objetivo no es generar conclusiones generales, sino situar de forma fiable la evolución personal de los valores. Un gran estudio muestra el efecto medio sobre muchas personas. Una evaluación N=1 muestra cómo se comportan los propios valores.
Un promedio de un estudio no dice nada sobre la intensidad de un efecto en un caso individual: puede ser mayor, menor o inexistente. Sin metodología se queda en “creo que funciona”, y eso no es una base sólida para decisiones de salud. Esas decisiones se toman junto con el médico.
Por qué los casos aislados engañan
Antes de cualquier evaluación conviene conocer las seis fuentes clásicas de error. Cada una puede simular un efecto inexistente.
Regresión a la media. Si una observación comienza en una fase de malestar, el estado probablemente vuelva hacia la media, independientemente de cualquier medida. Ese retorno se atribuye entonces erróneamente a la medida.
Efecto placebo. En investigación sobre dolor, sueño y ánimo, los placebos explican del 20 al 40 por ciento del efecto medido. La expectativa de que algo ayuda produce cambios biológicos medibles.
Sesgo de confirmación. Los datos que apoyan la propia hipótesis llaman más la atención. La buena noche se anota; la mala dos días después se olvida o se atribuye al café.
Efecto novedad. Todo lo nuevo cambia a corto plazo el comportamiento y la atención. Una nueva rutina nocturna funciona las dos primeras semanas y luego el efecto suele desaparecer.
Factores de confusión. Estación, entrenamiento, calidad del sueño, estrés laboral, alcohol, vacaciones, ciclo menstrual. Cada una de estas variables puede influir en las medidas más que el cambio observado.
Ruido de medición. Los wearables tienen típicamente 5 a 15 por ciento de desviación. La presión arterial varía 10 a 20 mmHg a lo largo del día. La glucosa varía según hora, comida y sueño. Las mediciones únicas casi siempre engañan.
Para metodología más profunda sobre calidad de datos, véase la guía sobre calidad de datos de wearables.
Principios básicos para evaluaciones N=1 fiables
Cinco principios convierten una autoobservación en una evaluación que permite una afirmación sólida.
1. Una variable a la vez
Metodológicamente no se cambian varias cosas en paralelo, por ejemplo un nuevo programa de entrenamiento y nuevos horarios de sueño a la vez. Cada cambio necesita una fase completa antes del siguiente. Es lento, pero es la única disposición que permite razonar sobre causas. Los cambios en medicación o suplementos no corresponden a la iniciativa propia, sino a la consulta médica.
2. Fase baseline (2–4 semanas)
Antes de cada observación se registra el estado actual: medidas subjetivas (calidad del sueño 1–10, energía 1–10) y objetivas (VFC, duración del sueño, peso, valores sanguíneos). Lo habitual son al menos 14 puntos, mejor 21. Sin baseline no está claro qué ha cambiado realmente. La checklist de línea base de biomarcadores sirve de orientación.
3. Fase de observación de duración biológicamente sensata
El error más común son las fases demasiado cortas. Los sistemas biológicos necesitan tiempo para adaptarse. Resumen de los periodos típicos en los que, según la literatura, pueden cambiar las medidas:
| Medida | Periodo típico |
|---|---|
| Parámetros de sueño (latencia, sueño profundo) | 2–4 semanas |
| VFC | 6–8 semanas |
| Ferritina | 8–12 semanas |
| Lípidos sanguíneos (LDL, triglicéridos) | 8–12 semanas |
| Adaptación al entrenamiento (fuerza) | 12 semanas |
| Vitamina D sérica | 12 semanas hasta la meseta |
Si aparece un “efecto” tras 10 días, casi siempre es placebo o ruido.
4. Fase de washout (para cambios reversibles)
Tras la fase de observación vienen 2 a 4 semanas sin el cambio. Se observa si las medidas vuelven a la baseline. Si lo hacen, es un indicio fuerte de que la evolución estaba realmente ligada al cambio. Si no, o bien algo más ha cambiado o el efecto no es reversible (por ejemplo, adaptación al entrenamiento).
5. Medición estandarizada
Misma hora, mismas condiciones, mismo procedimiento. En concreto:
- VFC: por la mañana justo al despertar, 5 minutos tumbado, antes de beber
- Presión arterial: media de 7 días con dos mediciones por la mañana y dos por la noche
- Peso: por la mañana en ayunas tras ir al baño, misma báscula
- Glucosa (CGM): como comparación, el valor matinal en ayunas
- Análisis de sangre: mismo laboratorio, mismas condiciones de extracción (véase extracción de sangre)
Patrones de diseño para N=1
Tres diseños cubren el 90 por ciento de las autoobservaciones sensatas.
A) Diseño ABA (baseline → cambio → washout). El patrón más simple. Muestra si la medida responde de forma reversible al cambio. 4 a 12 semanas por fase. Adecuado para una primera evaluación de un cambio de estilo de vida.
B) Diseño ABAB (alternancia múltiple). El estándar de oro metodológico para N=1. El ciclo se repite una vez, lo que reduce el riesgo de que un factor de confusión explique el efecto. Si la medida sube en ambas fases B y baja en ambas A, es evidencia fuerte. Duración total: 16 a 48 semanas.
C) Crossover múltiple con secuencia ciega. Conocido de la investigación clínica: los participantes no conocen el orden de las fases. Elimina el efecto placebo pero requiere más organización. Con cualquier sustancia corresponde a un entorno con supervisión médica o científica, no al autoexperimento.
Cuatro ejemplos de diseños de medición
Ejemplo 1: rutina nocturna y calidad del sueño
- Medidas: Sleep score (wearable), minutos de sueño profundo, latencia de sueño, recuperación subjetiva (1–10)
- Baseline: 2 semanas sin cambios
- Fase de observación: 4 semanas con una rutina nocturna modificada
- Washout: 2 semanas de vuelta a la rutina original
- Análisis: Media ± desviación estándar por fase, comparar B vs. A1 y A2
Ejemplo 2: cutoff de café
- Medidas: Latencia de sueño, VFC nocturna, Wake After Sleep Onset (WASO)
- Pregunta: ¿Se asocia un último café a las 14 h con valores de VFC distintos que a las 18 h?
- Diseño: 3 semanas con cutoff 14 h, 3 semanas con cutoff 18 h, repetición en orden inverso
- Análisis: Media de VFC por condición, diferencia como tamaño de efecto
Ejemplo 3: cortisol a lo largo del tiempo
- Medidas: Cortisol sérico matinal (laboratorio), perfil salival diurno (4 puntos), estrés subjetivo (1–10)
- Baseline: Análisis de sangre y perfil salival en la semana 0
- Control de seguimiento: Análisis de sangre y perfil salival en la semana 8
- Opcional: Nueva medición 4 semanas después
- Interpretación: Los valores de laboratorio los interpreta un médico
Ejemplo 4: evaluación con CGM y orden de las comidas
- Medidas: Pico de glucosa, tiempo en rango (70–140 mg/dl), área bajo la curva 2 h postprandial
- Pregunta: ¿Se asocia el orden verduras → proteína → carbohidratos con un pico de glucosa distinto al del orden inverso?
- Diseño: Misma comida durante 7 días en orden A, 7 días en orden B
- Análisis: Pico medio A vs. B, desviación estándar
Este ejemplo lo muestra: N=1 no siempre requiere semanas. Para medidas de corto plazo como la glucosa postprandial basta comparar día a día. Más metodología en el método sprint insight.
Evaluación estadística
No hace falta una carrera de estadística para evaluar un N=1. Cuatro herramientas cubren casi todos los casos.
1. Media y desviación estándar por fase. Para cada fase (A1, B1, A2, B2) se calcula la media de la medida y su desviación estándar. Una diferencia entre dos fases se considera relevante si supera el doble de la desviación estándar de la baseline.
2. Inspección visual. Una serie temporal con todos los puntos y los límites de fase marcados muestra a menudo tendencias antes que la estadística. Un salto en la fase B y una caída en A2 resultan visualmente convincentes.
3. Correlación de Spearman. Muestra tendencias dentro de una fase. Si la VFC sube continuamente de la semana 1 a la 4 de la fase B, hay correlación positiva entre tiempo y medida.
4. Test t con suficientes datos. Con más de 30 mediciones por fase (típico con datos diarios de wearable) puede hacerse un test t pareado. Valores p por debajo de 0,05 son un indicio, pero no una prueba estricta en el contexto N=1.
Importante: una estadística significativa requiere muchos datos. A menudo basta una gráfica limpia más comparación de medias. No conviene sobrecargar la estadística.
Errores frecuentes
Seis errores aparecen en casi todos los principiantes.
- Fase de observación demasiado corta. Sacar conclusiones a los 10 días, aunque la vitamina D sérica, por ejemplo, ni siquiera haya alcanzado la mitad de la meseta.
- Varios cambios a la vez. Nuevos hábitos, nuevo entrenamiento y nuevos horarios de sueño a la vez. Sin conclusión posible.
- Medición única en lugar de media semanal. Un valor de VFC no dice nada. La media de 7 días dice mucho.
- Sin washout. Sin washout no se pueden descartar placebo y novedad.
- Medidas subjetivas sin cegamiento. Quien sabe que se espera que una medida ayude suele sentirse mejor. Es un conocido efecto de expectativa.
- Hype de redes sociales como “evidencia”. Un antes-después de Instagram no reemplaza un experimento. Muchos N=1 de comunidad están mal documentados y tienen sesgo de publicación.
Para situar combinaciones de varios suplementos y sus interacciones, véase la guía sobre iteración de stacks de suplementos. También allí rige: la toma y las combinaciones deben consultarse con un médico.
Documentación
La mejor metodología no vale nada sin documentación limpia. Un diario forma parte de todo N=1.
Lo habitual es registrar a diario:
- Fecha y hora del cambio observado
- Molestias o efectos secundarios (molestias GI, cefaleas, cambios cutáneos) que conviene comentar con un médico
- Variables de contexto: duración del sueño, intensidad del entrenamiento (1–10), estrés (1–10), alcohol (unidades)
- Eventos especiales (enfermedad, viaje, estrés inusual)
Los datos exportables son obligatorios. La exportación CSV de la herramienta de seguimiento permite un análisis posterior en hojas de cálculo o software estadístico. lab2go soporta esta exportación para biomarcadores y logs de suplementos. Para seguimiento a largo plazo véase la guía sobre seguimiento de biomarcadores a largo plazo.
Ética y seguridad
No toda autoobservación es inocua. Cuatro principios protegen de riesgos innecesarios.
Ningún experimento de riesgo sin supervisión médica. Medicamentos fuera de indicación, péptidos, sustancias inyectables y terapias hormonales (TRT, SERMs) corresponden al ámbito médico, aunque puedan comprarse en línea. Este artículo no hace ninguna recomendación de uso de tales sustancias.
Definir criterios de parada de antemano. ¿Con qué valor o síntoma se interrumpe y se busca consejo médico? Ejemplos de motivos de revisión médica: enzimas hepáticas por encima del doble del límite, presión arterial por encima de 160/100, frecuencia cardiaca en reposo por encima de 80 lpm, cefaleas persistentes más de 3 días.
Valores sanguíneos de baseline antes de medidas farmacológicas. Hígado, riñón, hemograma completo, CRP, estado hormonal. Sin esta base no es posible saber si una alteración posterior ya estaba. Si se solicitan y cuándo lo decide el médico responsable.
Respetar los intervalos de control. En medidas con perfil de riesgo son habituales controles cada 4 a 8 semanas, no solo al final, y corresponden al ámbito médico.
Comunidad y agregación de evidencia
Un N=1 aislado es anécdota. Muchos N=1 con metodología limpia pueden llegar a cuasi-evidencia. El movimiento Quantified Self y plataformas de conocimiento como Examine.com recopilan estos datos.
Dos advertencias: el sesgo de publicación también existe en la autoobservación. ¿Quién publica con gusto que no cambió nada? Los resultados positivos se comparten más. Segundo: el hype en redes no sustituye una base científica. PubMed y Examine.com siguen siendo las mejores referencias para el estado de la investigación y los efectos esperables.
Un N=1 propio y limpio es valioso, sobre todo si también se registran los resultados nulos. Eso empuja hacia una metodología mejor.
lab2go como plataforma N=1
Una evaluación N=1 limpia necesita cuatro componentes: tendencias de biomarcadores, log de suplementos, valores de contexto, correlaciones. lab2go cubre las tendencias de biomarcadores, el log de suplementos y los valores de contexto; las correlaciones las construyes tú.
- Tendencias de biomarcadores: cada análisis se guarda en el tiempo. Se ve al instante cómo evoluciona un valor como la vitamina D a lo largo de las fases.
- Log de suplementos: entradas con fecha y hora, exportables como CSV.
- Valores de contexto: VFC, sueño, frecuencia cardiaca en reposo o intensidad de entrenamiento se introducen manualmente como valor diario, en la misma línea temporal que los análisis.
- Comprobar las correlaciones por tu cuenta: consulta el log de suplementos y la tendencia de biomarcadores uno junto al otro y haz tú mismo el análisis.
Un vistazo a las funciones o a los planes y precios muestra cómo estructurar las autoobservaciones. lab2go es una herramienta de seguimiento y no ofrece valoración médica.
Conclusión: tres piezas de una evaluación N=1 limpia
- Una pregunta. No tres. Una variable de estilo de vida, una medida concreta.
- Tres fases. Baseline 2–4 semanas, observación de duración biológicamente sensata, washout 2–4 semanas. Anotar de antemano qué se mide y qué cuenta como éxito.
- Documentación diaria. Fecha, contexto, exportación CSV al final, comparar medias por fase.
Como punto de partida para el registro de datos sirve la checklist de línea base de biomarcadores.
Este artículo tiene fines exclusivamente informativos y no sustituye el consejo médico. La toma, la dosis y la terapia deben consultarse con un médico; ante medidas farmacológicas o invasivas, buscar siempre consejo médico. Sobre péptidos y sustancias no autorizadas no se hace ninguna recomendación de uso. El self-tracking complementa la medicina. No la reemplaza.
Preguntas frecuentes
- ¿Cuánto debe durar metodológicamente un experimento N=1?
- Depende de la medida. Según la literatura, la vitamina D sérica necesita unas 12 semanas para alcanzar la meseta, la ferritina responde en 8 a 12 semanas, los cambios de VFC aparecen en 6 a 8 semanas y los parámetros de sueño en 2 a 4 semanas. Como regla orientativa, cada fase debería durar al menos la mitad del tiempo de adaptación biológica. Observaciones más cortas casi siempre producen ruido en lugar de señal.
- ¿Basta con sentirse mejor como prueba de un efecto?
- No. En muchos contextos los efectos placebo explican del 20 al 40 por ciento de la mejora subjetiva. A ello se suman el efecto novedad, el sesgo de confirmación y la regresión a la media. Sin baseline, medidas definidas y fase de washout no es posible distinguir si un cambio se debe a una medida o a la propia expectativa. Una sola medición no es un experimento.
- ¿Qué es un diseño ABA?
- ABA significa baseline (A), cambio (B) y regreso a la baseline (A). Cada fase dura de 4 a 12 semanas según la medida. Si la medida se desvía claramente de la baseline en B y vuelve en la segunda fase A, es un indicio de una asociación real. El diseño ABAB repite este ciclo y reduce aún más el riesgo de factores de confusión.
- ¿Cuántos puntos de medida hacen falta para un análisis útil?
- Para medidas diarias como VFC o sueño se recomiendan al menos 14 puntos por fase, idealmente 21 a 28. Para medidas semanales como glucosa en ayunas o presión arterial suelen bastar de 7 a 14 mediciones por fase. En valores de laboratorio, una medición por fase suele bastar si las fases son lo bastante largas. Las mediciones únicas nunca son significativas; lo habitual es la media semanal.
- ¿Qué papel tiene el cegamiento en la autoobservación?
- En muchas evaluaciones N=1 basta un diseño ABAB limpio sin cegamiento. Para medidas subjetivas como energía, ánimo o recuperación, el cegamiento es metodológicamente valioso porque excluye los efectos de expectativa. En el autoexperimento solo es viable en parte; con cualquier sustancia corresponde a un entorno con supervisión médica o científica.
- ¿Por qué se ven con criterio crítico varios cambios simultáneos?
- En cuanto se cambian dos variables a la vez, el efecto ya no se puede atribuir. Si el sueño mejora tras ajustar varios hábitos al mismo tiempo, queda abierto cuál de ellos influyó. Para una atribución limpia rige una variable por observación. Los cambios en medicación o suplementos deben consultarse con un médico en cualquier caso.
- ¿Cómo se documentan las variables de contexto?
- Lo habitual es un registro diario con fecha, duración del sueño, intensidad de entrenamiento, alcohol, estrés y eventos especiales. En lab2go estas variables se pueden registrar de forma estructurada y usar después como filtros. Lo clave es la consistencia: los mismos campos cada día, aunque no haya nada especial. Los huecos perjudican el análisis.
- ¿Qué estadística se usa para la evaluación?
- Para la mayoría de las evaluaciones N=1 basta comparar medias y desviación estándar por fase. Una diferencia mayor que el doble de la desviación estándar de la baseline se considera relevante. La correlación de rangos de Spearman muestra tendencias dentro de una fase. Un test t requiere más de 30 puntos por fase, algo que los datos de wearable suelen permitir. Para muchas preguntas una gráfica limpia basta.
- ¿Cuándo debe consultarse con un médico una autoobservación?
- Siempre que intervengan medicamentos, péptidos, sustancias inyectables, terapias hormonales, principios activos potentes o medidas con riesgos conocidos como la carga hepática. La toma, la dosis y la terapia corresponden a la esfera médica; esta página no hace ninguna recomendación de uso. Los médicos definen criterios de parada de antemano y solicitan un hemograma basal antes de cualquier medida farmacológica.
- ¿Cómo se interpretan los resultados nulos?
- Como resultados completos. Los resultados nulos son metodológicamente tan informativos como los positivos. Las comunidades en línea raramente los comparten, lo que distorsiona la evidencia percibida (sesgo de publicación). Si un valor permanece sin cambios durante ocho semanas, también eso es información real que conviene registrar en el propio historial.
Este artículo tiene únicamente fines informativos generales y no sustituye el asesoramiento, diagnóstico o tratamiento médico individual. Consulta cualquier cambio en tu alimentación, suplementación o medicación con un profesional sanitario cualificado.
Maritta Schmid, Heilpraktikerin (autorización según la Heilpraktikergesetz alemana; profesional sanitaria no médica), Autorización según la Heilpraktikergesetz, emitida por el Gesundheitsamt Heilbronn (febrero de 2010), Autoridad supervisora: Landratsamt Ostalbkreis – Gesundheitsamt Aalen
Heilpraktikerin & Fundadora
Schwäbisch Gmünd, Alemania
Conecta datos de salud, tecnología y rutinas prácticas para un cambio de comportamiento real.