Prueba de Kruskal-Wallis en el TFG: alternativa no paramétrica al ANOVA y post hoc de Dunn (2026)
Cuando en tu TFG necesitas comparar tres o más grupos independientes pero los datos no cumplen el supuesto de normalidad, el ANOVA de un factor no es aplicable. La prueba de Kruskal-Wallis es exactamente la herramienta que necesitas: un contraste no paramétrico basado en rangos que permite detectar diferencias entre grupos sin asumir ninguna distribución concreta. Tanto SPSS como Jamovi y R la calculan en segundos, pero interpretarla correctamente —incluyendo el estadístico H, las comparaciones múltiples de Dunn y el tamaño del efecto— requiere entender la lógica que hay detrás.
Esta guía está orientada a estudiantes de grado y posgrado que deben justificar sus decisiones metodológicas ante un tribunal. Encontrarás la fórmula del estadístico H, los supuestos reales de la prueba, cómo ejecutar el post hoc de Dunn con corrección de Bonferroni y cómo reportar los resultados con rigor en el capítulo de resultados de tu trabajo.
Cuándo usar la prueba de Kruskal-Wallis
La pregunta clave en el análisis estadístico de tu TFG no es «¿qué prueba conozco mejor?», sino «¿qué prueba es apropiada para mis datos?». El árbol de decisión estándar te llevará a la prueba de Kruskal-Wallis cuando se cumplan estas tres condiciones simultáneamente:
- Tienes tres o más grupos independientes que deseas comparar (para dos grupos, el equivalente no paramétrico es la prueba U de Mann-Whitney).
- La variable dependiente es ordinal, de intervalo o de razón, pero no sigue una distribución normal en al menos uno de los grupos, o el tamaño de la muestra es demasiado reducido para asumir normalidad con garantías.
- Las observaciones dentro de cada grupo son independientes entre sí. Si hay medidas repetidas sobre los mismos sujetos, la alternativa es la prueba de Friedman.
Una situación habitual en TFGs de Ciencias de la Salud, Psicología o Educación: mides la satisfacción percibida (escala Likert de 5 puntos) en tres grupos de usuarios sometidos a diferentes intervenciones. La escala Likert es ordinal, los grupos son pequeños y la prueba de Shapiro-Wilk indica violación de normalidad. Ese es el escenario clásico para Kruskal-Wallis. Si quieres profundizar en qué prueba elegir según la naturaleza de tus variables, el artículo sobre cómo elegir la prueba estadística correcta para el TFG con árbol de decisión te ofrece una guía paso a paso.
Supuestos de la prueba
Decir que Kruskal-Wallis es «no paramétrico» no significa que carezca de supuestos. Entenderlos evita errores de aplicación que un revisor o un tribunal detectarían de inmediato.
| Supuesto | Descripción | Cómo verificarlo |
|---|---|---|
| Independencia | Cada observación pertenece a un único grupo y no está relacionada con ninguna otra observación, ni dentro ni entre grupos. | Diseño del estudio: muestreo aleatorio, sin medidas repetidas. |
| Escala mínima ordinal | La variable dependiente debe poder ordenarse. Los datos nominales puros no son válidos. | Revisión del instrumento de medida. |
| Distribución similar | Para interpretar los resultados como diferencias de mediana (no solo de rango medio), las distribuciones de los grupos deben tener forma similar (aunque no necesariamente normal). | Inspección visual de histogramas o boxplots por grupo. |
| Tamaño muestral | Con grupos muy pequeños (n < 5 por grupo), la aproximación chi-cuadrado del estadístico H pierde precisión. En esos casos, conviene usar tablas de valores críticos exactos. | Recuento de casos por grupo antes del análisis. |
La prueba no exige homogeneidad de varianzas (contrariamente al ANOVA paramétrico, que requiere la condición de homocedasticidad verificada mediante la prueba de Levene). Este es uno de sus principales puntos a favor cuando trabajas con muestras pequeñas o datos con distribuciones asimétricas.
El estadístico H: cálculo e interpretación
El fundamento de la prueba de Kruskal-Wallis consiste en sustituir los valores originales por sus rangos. En lugar de comparar medias aritméticas, la prueba compara las sumas de rangos de cada grupo. Si los grupos son iguales, las sumas de rangos deberían distribuirse de forma similar entre ellos.
Procedimiento de asignación de rangos
- Combina todas las observaciones de todos los grupos en un único conjunto y ordénalas de menor a mayor.
- Asigna rango 1 al valor más pequeño, rango 2 al siguiente, y así sucesivamente hasta el valor más grande (rango N).
- Si existen empates (varios casos con el mismo valor), asigna a cada uno el rango promedio de las posiciones que habrían ocupado. Por ejemplo, si dos casos empatan en las posiciones 4 y 5, ambos reciben el rango 4,5.
- Suma los rangos de las observaciones de cada grupo por separado (R₁, R₂, …, Rk).
Fórmula del estadístico H
El estadístico H se expresa como:
Donde:
- N = número total de observaciones en todos los grupos.
- k = número de grupos.
- nᵢ = número de observaciones en el grupo i.
- Rᵢ = suma de rangos del grupo i.
Cuando hay empates, se aplica un factor de corrección que ajusta el denominador de H. La mayoría del software estadístico (SPSS, Jamovi, R) lo aplica automáticamente, pero es importante que lo menciones en la sección de análisis de datos de tu TFG si la proporción de empates es elevada.
Distribución del estadístico y decisión
Bajo la hipótesis nula (todos los grupos proceden de la misma distribución), H sigue aproximadamente una distribución chi-cuadrado con k−1 grados de libertad. El p-valor resultante indica la probabilidad de obtener un valor de H tan extremo o más extremo si H₀ fuera cierta. Si p < α (habitualmente 0,05), se rechaza la hipótesis nula y se concluye que al menos un grupo difiere significativamente de los demás.
Recuerda que rechazar H₀ no indica qué grupos difieren: solo señala que la distribución de rangos no es idéntica en todos los grupos. Para localizar las diferencias concretas es necesario el análisis post hoc.
Post hoc de Dunn y corrección de Bonferroni
El test de Dunn es el procedimiento post hoc no paramétrico más utilizado tras un resultado significativo de Kruskal-Wallis. Realiza comparaciones por pares entre todos los grupos, calculando para cada par una estadística Z basada en la diferencia de sus rangos medios estandarizada por el error estándar esperado.
Por qué se necesita la corrección por comparaciones múltiples
Si tienes k grupos, el número de comparaciones por pares es k(k−1)/2. Con tres grupos, son 3 comparaciones; con cinco grupos, son 10. Realizar cada comparación al nivel α = 0,05 sin corrección infla la tasa de error de tipo I global (la probabilidad de al menos un falso positivo). La corrección de Bonferroni es el método más conservador y extendido: multiplica cada p-valor por el número de comparaciones (o equivalentemente, divide α entre ese número). Otras alternativas como la corrección de Benjamini-Hochberg son menos conservadoras y se utilizan cuando interesa controlar la tasa de falsos descubrimientos en lugar de la tasa de error familiar.
Procedimiento del test de Dunn en la práctica
- Ejecuta la prueba de Kruskal-Wallis y confirma que p < 0,05.
- Solicita el post hoc de Dunn en el software (en SPSS está integrado en «Pruebas no paramétricas para muestras independientes»; en Jamovi, activa la opción «All pairs» dentro de Dunn’s test).
- Lee los p-valores ajustados (Bonferroni) para cada par de grupos.
- Marca como significativas las comparaciones donde p ajustado < 0,05.
Si tu TFG incluye comparaciones similares de dos grupos en otras variables, la guía sobre cómo hacer la prueba t de Student en SPSS y Jamovi paso a paso te ayudará a contextualizar los procedimientos paramétricos equivalentes para el caso de dos grupos.
Tamaño del efecto para cada par en el post hoc
Tras el test de Dunn, puedes calcular el tamaño del efecto para cada comparación por pares mediante:
Donde Z es el estadístico Z del test de Dunn y N es el número total de observaciones. Los umbrales de interpretación de r son los propuestos para la correlación biserial de rangos: r ≈ 0,10 efecto pequeño; r ≈ 0,30 efecto mediano; r ≥ 0,50 efecto grande (Cohen, 1988).
Tamaño del efecto: épsilon cuadrado (ε²)
Reportar únicamente el p-valor es insuficiente en cualquier TFG o tesis actual. Los comités editoriales, tutores y tribunales esperan que acompañes la significación estadística con una medida del tamaño del efecto, que informa sobre la magnitud práctica de las diferencias encontradas, con independencia del tamaño muestral.
Para la prueba de Kruskal-Wallis, la medida recomendada en la literatura metodológica reciente es el épsilon cuadrado (ε²), que se interpreta como la proporción de variabilidad en los rangos que es explicada por la pertenencia al grupo:
Donde H es el estadístico de Kruskal-Wallis, k el número de grupos y N el total de observaciones. El valor oscila entre 0 y 1. Algunos autores prefieren el eta cuadrado basado en rangos (η²H), que utiliza la fórmula H/(N²−1)·(N+1), aunque ε² es considerado más adecuado para muestras pequeñas por ser más conservador. Si necesitas determinar de antemano cuántos participantes requiere tu estudio para detectar ese efecto con suficiente potencia, la guía sobre cómo calcular el tamaño muestral con G*Power para análisis de potencia a priori explica el procedimiento completo.
| Valor de ε² | Interpretación convencional |
|---|---|
| 0,01 – 0,06 | Efecto pequeño |
| 0,06 – 0,14 | Efecto mediano |
| > 0,14 | Efecto grande |
Estos umbrales son análogos a los propuestos por Cohen para el η² en el ANOVA paramétrico. No obstante, la interpretación debe siempre contextualizarse en el ámbito disciplinar y en las características concretas del estudio.
Ejecución en SPSS, Jamovi y R
En SPSS
- Ve a Analizar → Pruebas no paramétricas → Muestras independientes.
- En la pestaña Campos, arrastra la variable dependiente a «Contrastar» y la variable de agrupación a «Grupos».
- En la pestaña Configuración, activa la opción de comparaciones por pares (Bonferroni).
- Ejecuta y haz doble clic sobre el gráfico de «Resumen de prueba de hipótesis» para acceder al visor de modelos con los resultados post hoc.
- El ε² no lo calcula SPSS automáticamente; deberás calcularlo a mano o con una hoja de cálculo usando el valor de H y los tamaños de grupo.
En Jamovi
- Ve a ANOVA → ANOVA de una vía (no paramétrico) → Prueba de Kruskal-Wallis.
- Añade la variable dependiente y el factor de agrupación.
- Activa «Comparaciones post hoc de Dunn» y selecciona la corrección de Bonferroni.
- Jamovi incluye directamente el tamaño del efecto ε² en la tabla de resultados.
En R
El paquete coin proporciona la versión exacta, mientras que la función base kruskal.test() ofrece la aproximación asintótica. Para el post hoc de Dunn con corrección de Bonferroni, el paquete dunn.test o la función dunnTest() del paquete FSA son las opciones más citadas en publicaciones académicas.
Si también estás usando SPSS o Jamovi para validar escalas de medida en tu TFG, la guía sobre cómo calcular el alfa de Cronbach en Jamovi y SPSS complementa el análisis de fiabilidad previo a los contrastes de grupos.
Cómo reportar los resultados en el TFG
La redacción de los resultados estadísticos debe ser precisa, reproducible y comprensible para un lector que no ha ejecutado los análisis. A continuación se muestra un ejemplo de párrafo de resultados bien estructurado:
Se realizó una prueba de Kruskal-Wallis para comparar la satisfacción percibida (escala ordinal 1-5) entre los tres grupos de intervención (n₁ = 28, n₂ = 31, n₃ = 27). El resultado fue estadísticamente significativo, H(2) = 8,43, p = 0,015. El tamaño del efecto fue mediano (ε² = 0,09). Las comparaciones post hoc de Dunn con corrección de Bonferroni indicaron que el grupo de intervención intensiva presentó rangos significativamente superiores respecto al grupo control (p ajustado = 0,012), mientras que las diferencias entre el grupo de intervención moderada y el control no alcanzaron significación (p ajustado = 0,087).
Los elementos que no pueden faltar en el informe son:
- El nombre de la prueba y el tipo de corrección post hoc aplicada.
- El estadístico H con los grados de libertad entre paréntesis: H(gl).
- El p-valor exacto (salvo que sea inferior a 0,001, en cuyo caso se indica p < 0,001).
- El tamaño del efecto (ε² o η²H) con su interpretación cualitativa.
- Los p-valores ajustados de cada comparación significativa en el post hoc.
Si tu TFG incluye una hipótesis estadística formal que necesitas redactar antes del análisis, el artículo sobre cómo formular hipótesis y preguntas de investigación en el TFG te explica cómo hacerlo siguiendo los estándares académicos. Asimismo, si necesitas contrastar variables categóricas en lugar de ordinales, la guía sobre cómo hacer una prueba de chi-cuadrado en SPSS paso a paso cubre el procedimiento equivalente para datos de frecuencias.
Kruskal-Wallis frente a ANOVA: tabla comparativa
| Característica | ANOVA de un factor | Kruskal-Wallis |
|---|---|---|
| Supuesto de normalidad | Necesario (Shapiro-Wilk, K-S) | No requerido |
| Supuesto de homocedasticidad | Necesario (prueba de Levene) | No requerido |
| Escala mínima de medida | Intervalo / razón | Ordinal |
| Estadístico de contraste | F | H (aprox. χ²) |
| Potencia estadística | Mayor cuando se cumplen los supuestos | Ligeramente menor (≈ 95% de la potencia del ANOVA) |
| Post hoc habitual | Tukey, Bonferroni, Scheffé | Dunn (Bonferroni), Conover, Nemenyi |
| Tamaño del efecto | η² o ω² | ε² o η²H |
Una precisión importante: aunque la prueba de Kruskal-Wallis tiene una eficiencia asintótica de aproximadamente el 95% respecto al ANOVA cuando los datos son normales, no debes recurrir a ella simplemente para «evitar problemas». Si tus datos cumplen los supuestos del ANOVA, el test paramétrico sigue siendo la opción más potente. Kruskal-Wallis es la elección correcta cuando la violación de supuestos es real y verificada, no una precaución innecesaria. Cuando el diseño incluye una covariable continua que conviene controlar, la alternativa paramétrica a considerar es el ANCOVA: análisis de covarianza con supuesto de pendientes homogéneas en SPSS.
Preguntas frecuentes
¿Se puede usar Kruskal-Wallis con solo dos grupos?
Técnicamente sí, pero no es la opción habitual. Para dos grupos independientes, la prueba específica es la U de Mann-Whitney, que es matemáticamente equivalente a Kruskal-Wallis con k = 2. Se recomienda usar Mann-Whitney directamente en el caso de dos grupos para mantener la nomenclatura estándar reconocible por cualquier revisor.
¿Qué ocurre si la prueba de Kruskal-Wallis da significativo pero ningún par del post hoc de Dunn lo es?
Es una situación posible y se debe a la diferencia en el poder de las pruebas. El test de Kruskal-Wallis considera todos los grupos a la vez, mientras que el post hoc de Dunn con Bonferroni es más conservador al ajustar por múltiples comparaciones. En ese caso, debes reportar que la prueba global fue significativa pero que las comparaciones por pares, tras el ajuste, no alcanzaron significación individualmente. Esto no invalida los resultados; indica que las diferencias, aunque presentes, pueden estar distribuidas de forma difusa entre los grupos.
¿Cuántas observaciones mínimas necesito por grupo para aplicar Kruskal-Wallis?
La aproximación chi-cuadrado del estadístico H es razonablemente precisa cuando cada grupo tiene al menos 5 observaciones. Con grupos más pequeños, la distribución exacta difiere de la chi-cuadrado y los p-valores pueden ser imprecisos. Para muestras muy pequeñas, algunos paquetes estadísticos (como el paquete coin en R) ofrecen p-valores exactos basados en permutaciones, que son más fiables en esos casos.
¿Kruskal-Wallis compara medianas o rangos medios?
Técnicamente, Kruskal-Wallis compara las distribuciones de rangos, no las medianas en sentido estricto. La interpretación en términos de medianas solo es válida si las distribuciones de los grupos tienen la misma forma (aunque no sean normales). Si las formas difieren considerablemente, es más correcto hablar de diferencias en las distribuciones de rangos que en las medianas. En la práctica académica, muchos textos simplifican la interpretación hablando de medianas, pero conviene añadir una nota metodológica cuando las formas difieren de manera evidente.
¿Es obligatorio reportar el tamaño del efecto en el TFG?
Desde las revisiones de la normativa APA (6ª y 7ª edición) y las recomendaciones de múltiples guías de escritura científica, el tamaño del efecto se considera un elemento esencial en cualquier informe de resultados cuantitativos. No existe una obligación legal, pero los tutores y tribunales con formación metodológica lo exigirán. Un TFG que solo reporta p-valores y omite ε² o r corre el riesgo de recibir críticas en la defensa por no distinguir entre significación estadística y relevancia práctica.
Escribe tu TFG o tesis con IA
Pasa de la teoría a tu documento terminado
Tesify estructura, redacta y formatea tu TFG, TFM o tesis en normas APA y Vancouver, con bibliografía automática y verificación antiplagio integrada. Regístrate gratis, sin tarjeta.
Leave a Reply