Intervalo de confianza vs valor p: qué reportar de verdad en tu tesis (2026)
Hay pocas frases más repetidas en la metodología cuantitativa que «p < .05, por lo tanto el resultado es significativo». Y pocas tan mal comprendidas. El valor p no mide la probabilidad de que tu hipótesis sea verdadera, no mide el tamaño del efecto, no garantiza que el resultado sea replicable y, lo que es más importante para la redacción de tu tesis, no es suficiente por sí solo para justificar ninguna conclusión sustantiva.
Desde la 7.ª edición del Manual de Publicaciones de la APA (2020), los reportes estadísticos en ciencias sociales deben incluir intervalos de confianza y tamaños del efecto junto al valor p. Los tribunales de tesis con experiencia metodológica saben esto, y los capítulos de resultados que sólo reportan p-valores son señal inmediata de que el análisis estadístico no está suficientemente fundamentado. Este artículo explica qué son exactamente estas dos medidas, en qué se diferencian, cómo interpretarlas conjuntamente y qué exige APA 7 que aparezca en tu tesis.
Qué es el valor p y qué mide realmente
El valor p es la probabilidad de obtener un resultado igual o más extremo que el observado en la muestra, asumiendo que la hipótesis nula es verdadera y que el diseño del estudio no tiene sesgos sistemáticos. Expresado de otra forma: si no hubiera ningún efecto real en la población (H₀ verdadera), ¿con qué frecuencia obtendríamos por azar un resultado tan extremo como el que hemos obtenido?
Un p = .03 significa que, si la hipótesis nula fuera verdadera, habría un 3% de probabilidad de obtener ese resultado o uno más extremo. Como esa probabilidad está por debajo del umbral convencional de .05, se rechaza la hipótesis nula y se dice que el resultado es «estadísticamente significativo».
Nótese lo que el valor p no dice:
- No dice que la hipótesis nula sea falsa con un 95% de certeza.
- No dice que la hipótesis alternativa sea verdadera.
- No dice nada sobre el tamaño o la importancia del efecto.
- No dice nada sobre la replicabilidad del resultado.
El umbral de .05 es una convención histórica establecida por Fisher en los años 1920 y no tiene ningún fundamento lógico o matemático que lo haga superior a .04 o .06. La American Statistical Association publicó en 2016 y 2019 sendas declaraciones instando a la comunidad científica a abandonar el uso del umbral de .05 como frontera dicotómica entre «significativo» y «no significativo». Para una introducción metodológica rigurosa al problema de investigación que subyace al mal uso del p-valor, el recurso de Metodologías de la Investigación sobre metodología general ofrece contexto valioso sobre cómo enmarcar correctamente las hipótesis antes de elegir el estadístico de prueba.
Los cuatro errores de interpretación del p-valor más comunes
| Error | Formulación errónea | Formulación correcta |
|---|---|---|
| Probabilidad inversa | «p = .03 significa que hay un 97% de probabilidad de que H₀ sea falsa» | «Si H₀ fuera verdadera, habría un 3% de probabilidad de obtener este resultado o uno más extremo» |
| Efecto importante | «El resultado es significativo, por lo tanto el efecto es grande» | «El resultado es estadísticamente significativo, pero el tamaño del efecto es pequeño (d = 0.18)» |
| Replicabilidad | «p = .04 garantiza que el resultado se replicará» | «El p-valor no informa sobre la probabilidad de replicación» |
| Nulo vs. real | «p = .12, por lo tanto no hay efecto» | «El resultado no alcanza el umbral convencional de significación con esta muestra, lo que puede reflejar falta de potencia estadística» |
Qué es el intervalo de confianza al 95%
Un intervalo de confianza al 95% (IC 95%) es un procedimiento de estimación que, si se aplicara repetidamente con muestras del mismo tamaño del mismo universo, produciría intervalos que contendrían el parámetro poblacional verdadero en el 95% de las ocasiones.
Tres precisiones importantes sobre los IC:
- No es una probabilidad para el IC ya calculado: una vez calculado el IC [2.3, 4.7], el verdadero parámetro o está dentro o no está; no hay probabilidad del 95% para ese intervalo específico. El 95% se refiere al procedimiento, no al intervalo.
- La amplitud indica precisión: un IC estrecho ([2.3, 2.8]) indica estimación precisa (muestra grande, poco error de muestreo). Un IC amplio ([−1.2, 6.3]) indica estimación imprecisa (muestra pequeña, mucha incertidumbre).
- La posición relativa al cero es informativa: si el IC para una diferencia o un coeficiente incluye el 0, el resultado no alcanza significación estadística al nivel del 5%, lo que es consistente con p ≥ .05.

IC vs. p-valor: qué aporta cada uno
El IC y el valor p son complementarios, no alternativos. El IC incluye toda la información del valor p (si el IC no incluye el valor nulo, el resultado es significativo) más información adicional sobre la magnitud y la precisión del efecto.
| Dimensión | Valor p | IC 95% |
|---|---|---|
| ¿Significación estadística? | Sí (directamente) | Sí (si no incluye 0) |
| Magnitud del efecto | No | Sí (ancho del IC) |
| Precisión de la estimación | No | Sí (amplitud del IC) |
| Dirección del efecto | No | Sí (signo y posición) |
| Interpretable sin estadístico | No | Parcialmente |
Significación estadística vs. relevancia práctica: el tamaño del efecto
Con muestras muy grandes, casi cualquier diferencia resulta estadísticamente significativa, aunque sea trivial. Con muestras pequeñas, efectos importantes pueden no alcanzar significación. Esta dependencia del valor p respecto al tamaño muestral hace que por sí solo sea un indicador insuficiente de la importancia de un resultado. El complemento necesario es el tamaño del efecto: una medida estandarizada que cuantifica la magnitud del efecto independientemente del tamaño muestral.
Los estadísticos de tamaño del efecto más habituales en tesis universitarias son:
- d de Cohen: para comparación de medias (t-test, ANOVA post-hoc). Umbrales de Cohen (1988): pequeño = 0.20, mediano = 0.50, grande = 0.80.
- r de Pearson: para correlaciones. Pequeño = 0.10, mediano = 0.30, grande = 0.50.
- η² o η² parcial: para ANOVA. Pequeño = 0.01, mediano = 0.06, grande = 0.14.
- f² de Cohen: para regresión múltiple. Pequeño = 0.02, mediano = 0.15, grande = 0.35.
- V de Cramér: para chi-cuadrado con tablas > 2×2.
Para la prueba chi-cuadrado específicamente, el artículo sobre la prueba chi-cuadrado en el TFG desarrolla la interpretación del tamaño del efecto con V de Cramér con ejemplos detallados. Para el ANOVA de un factor, el artículo sobre ANOVA de un factor en el TFG incluye el cálculo de η² con ejemplos de SPSS y JASP.
Si tu tesis usa un diseño de investigación mixto o la revisión sistemática como metodología, el artículo sobre cómo hacer una revisión sistemática con PRISMA 2020 paso a paso explica cómo reportar el tamaño del efecto combinado en meta-análisis, incluyendo el IC del efecto global.
Qué exige APA 7 que reportes
La 7.ª edición del Manual de la APA (2020, Sección 6.24) establece explícitamente:
«Proporciona los intervalos de confianza de todos los estadísticos muestrales que se presentan, incluyendo las estimaciones de tamaño del efecto, así como los valores p […] Los intervalos de confianza son la forma más informativa de presentar los resultados estadísticos.»
En la práctica, el reporte APA 7 para los análisis más frecuentes incluye:
| Análisis | Estadísticos mínimos a reportar |
|---|---|
| t-test para muestras independientes | M, SD para cada grupo; t(gl), p, d de Cohen, IC 95% para la diferencia de medias |
| Correlación de Pearson | r(gl), p, IC 95% para r |
| ANOVA de un factor | F(gl₁, gl₂), p, η², IC 95% para η² |
| Regresión lineal múltiple | B, SE(B), β, t, p, IC 95%[B] por predictor; R², R² adj., F del modelo |
| Chi-cuadrado | χ²(gl), p, N, V de Cramér |
Una regla práctica: APA 7 usa el punto como separador decimal (no la coma), omite el cero antes del punto decimal para valores acotados entre 0 y 1 (p, β, R², r) y reporta p < .001 en lugar del valor exacto cuando éste es inferior a ese umbral. Para los IC, el formato es: IC 95% [límite inferior, límite superior] o se puede integrar en el texto como «d = 0.42, IC 95% [0.18, 0.66]».
Sobre cómo integrar estos estadísticos en la narrativa del capítulo de resultados, el artículo sobre correlación de Pearson vs. Spearman en el TFG incluye ejemplos concretos de redacción en APA 7 con salidas de SPSS y JASP anotadas.
Ejemplos de reporte correcto
Para una comparación de medias (t-test):
«Se compararon las puntuaciones medias de autoeficacia entre el grupo experimental (M = 4.23, SD = 0.61) y el grupo control (M = 3.87, SD = 0.72). La diferencia fue estadísticamente significativa, t(118) = 2.87, p = .005, d = 0.54, IC 95% [0.11, 0.61].»
Para una correlación:
«Se encontró una correlación positiva y estadísticamente significativa entre el tiempo de estudio semanal y la puntuación en el examen, r(98) = .42, p < .001, IC 95% [.24, .57].»
Para ANOVA:
«El análisis de varianza indicó diferencias significativas entre grupos, F(2, 147) = 8.34, p < .001, η² = .10, IC 95% [.03, .18], lo que indica un tamaño del efecto mediano.»
Una referencia fundamental para entender el debate contemporáneo sobre el uso y abuso del valor p en ciencias sociales es el recurso metodológico de la Universidad de Valencia sobre estadística inferencial, intervalos de confianza y su relación con la práctica científica, que recorre los argumentos técnicos con rigor y accesibilidad.
Preguntas frecuentes
¿Qué mide realmente el valor p?
El valor p mide la probabilidad de obtener un resultado igual o más extremo que el observado, asumiendo que la hipótesis nula es verdadera. No mide la probabilidad de que la hipótesis sea falsa ni el tamaño del efecto. Un p < .05 solo indica que el resultado sería improbable si no hubiera efecto real, según el umbral convencional de significación.
¿Qué es un intervalo de confianza al 95%?
Es un rango de valores construido mediante un procedimiento que, si se aplicara repetidamente con muestras del mismo tamaño, produciría intervalos que contendrían el parámetro poblacional verdadero en el 95% de las ocasiones. La amplitud del IC indica la precisión de la estimación: ICs estrechos indican estimación precisa; ICs amplios indican mucha incertidumbre.
¿Qué diferencia hay entre significación estadística y relevancia práctica?
Un resultado puede ser estadísticamente significativo pero prácticamente irrelevante si el tamaño del efecto es muy pequeño: con muestras grandes, hasta diferencias triviales resultan significativas. La relevancia práctica se evalúa con el tamaño del efecto (d de Cohen, η², f², etc.), no con el valor p. APA 7 exige reportar ambos.
¿Por qué APA 7 prioriza los intervalos de confianza?
Porque el IC aporta más información en una sola cifra: indica el signo y la magnitud del efecto, su precisión y permite juzgar la relevancia práctica. El valor p solo dice si el efecto es ‘significativo’ según un umbral arbitrario, pero no dice cuánto es ese efecto ni con qué precisión se estima. APA 7 (2020) indica explícitamente que los IC son «la forma más informativa de presentar los resultados estadísticos».
¿Cómo se interpreta un IC 95% que incluye el cero?
Si el IC 95% para una diferencia, un coeficiente o una correlación incluye el 0, el resultado no alcanza significación estadística al nivel del 5%, lo que es consistente con p ≥ .05. Un IC muy amplio que incluye el 0 puede indicar que la muestra es demasiado pequeña para estimar el efecto con suficiente precisión.
¿Qué estadísticos debo reportar junto al valor p en la tesis?
Según APA 7: el estadístico de prueba con sus grados de libertad (t, F, χ²), el valor p, el tamaño del efecto (d de Cohen, r, η², f²) y el IC 95% para el parámetro de interés. Para regresión también se añaden B, SE(B) y β. Omitir el tamaño del efecto o el IC es la razón más frecuente de que los resultados de una tesis requieran revisión estadística.
Referencias
- American Psychological Association. (2020). Publication manual of the American Psychological Association (7.ª ed.). APA. https://doi.org/10.1037/0000165-000
- Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2.ª ed.). Lawrence Erlbaum Associates.
- Wasserstein, R. L., & Lazar, N. A. (2016). The ASA statement on p-values: Context, process, and purpose. The American Statistician, 70(2), 129–133. https://doi.org/10.1080/00031305.2016.1154108
- Cumming, G. (2014). The new statistics: Why and how. Psychological Science, 25(1), 7–29.
Escribe tu TFG o tesis con IA
Pasa de la teoría a tu documento terminado
Tesify estructura, redacta y formatea tu TFG, TFM o tesis en normas APA y Vancouver, con bibliografía automática y verificación antiplagio integrada. Regístrate gratis, sin tarjeta.

Leave a Reply