Modelos multinivel (jerárquicos) en la tesis 2026: cuándo usarlos con datos anidados y cómo interpretarlos
Tienes datos de alumnos de distintos colegios, pacientes de varios hospitales o empleados de diferentes empresas, y tu director te pregunta si has controlado la estructura anidada de la muestra. Si no sabes qué responder, este artículo es para ti. Los modelos multinivel jerárquicos (HLM, por sus siglas en inglés, o MLM en la literatura en español) nacieron precisamente para responder a esa situación: cuando las observaciones no son independientes porque pertenecen a grupos con características propias, aplicar una regresión ordinaria viola supuestos fundamentales y puede producir estimaciones sesgadas y errores estándar incorrectos.
Esta guía cubre todo lo que necesita un tesista de máster o doctorado: la lógica de los datos anidados, el coeficiente de correlación intraclase (ICC), la diferencia entre interceptos aleatorios y pendientes aleatorias, los supuestos del modelo, el software disponible y cómo reportar los resultados con las normas APA 7.
Qué son los modelos multinivel y por qué importan en la tesis
Los modelos multinivel —también llamados modelos lineales jerárquicos (HLM), modelos mixtos o modelos de efectos aleatorios— son una familia de técnicas estadísticas diseñadas para analizar datos con estructura jerárquica o anidada. La idea central es que los datos de nivel inferior (p. ej., estudiantes) están agrupados dentro de unidades de nivel superior (p. ej., aulas), y esa pertenencia genera dependencia entre las observaciones del mismo grupo.
En la regresión ordinaria por mínimos cuadrados (OLS), uno de los supuestos irrenunciables es la independencia de los residuos: se asume que el error de cada observación no guarda relación con el de las demás. Cuando los datos están anidados, este supuesto se viola sistemáticamente: dos alumnos del mismo aula comparten profesor, recursos y entorno, de modo que sus resultados tienden a parecerse más entre sí que a los de alumnos de otras aulas. Ignorar esa dependencia produce errores estándar artificialmente pequeños, intervalos de confianza demasiado estrechos y p-valores inflados —esto es, mayor probabilidad de declarar efectos significativos que en realidad no lo son.
Los modelos multinivel resuelven este problema descomponiendo la varianza total en componentes de varianza atribuibles a cada nivel del modelo. Al mismo tiempo, permiten incluir predictores tanto a nivel individual (nivel 1) como a nivel de grupo (nivel 2), y estimar si los efectos de esos predictores varían entre grupos. Esta flexibilidad los ha convertido en el estándar metodológico en investigación educativa, psicológica, epidemiológica y organizacional.
Qué son los datos anidados y cuándo aparecen
Se habla de datos anidados o agrupados cuando existe una estructura de pertenencia de varios niveles. Los ejemplos más habituales en tesis de ciencias sociales y de la salud son:
- Alumnos (nivel 1) dentro de aulas o colegios (nivel 2): investigación educativa y psicología escolar.
- Pacientes (nivel 1) dentro de centros sanitarios o equipos de enfermería (nivel 2): epidemiología clínica y ciencias de la salud.
- Empleados (nivel 1) dentro de departamentos u organizaciones (nivel 2): psicología organizacional y recursos humanos.
- Medidas repetidas (nivel 1) dentro de individuos (nivel 2): estudios longitudinales de cualquier disciplina.
- Barrios (nivel 2) dentro de ciudades (nivel 3): sociología urbana y criminología.
El tercer caso —medidas repetidas anidadas dentro de personas— merece mención especial en el contexto de la tesis. Cuando sigues a los mismos participantes a lo largo del tiempo y registras varias observaciones por persona, las observaciones de la misma persona están correlacionadas entre sí. Un modelo multinivel de dos niveles donde el nivel 1 son las ocasiones de medida y el nivel 2 son los individuos permite estimar tanto la trayectoria media de cambio (efecto fijo) como la variabilidad individual en esas trayectorias (efectos aleatorios).
Para decidir si tu tesis necesita este enfoque, conviene revisar desde el diseño el tipo de metodología y la estructura de los datos antes de recoger la muestra, porque el diseño muestral determina directamente el tipo de análisis adecuado. Si todavía estás eligiendo entre técnicas cuantitativas, la guía sobre cómo elegir la prueba estadística correcta con un árbol de decisión sitúa los modelos multinivel dentro del mapa general de opciones según el tipo de datos y diseño.
El coeficiente de correlación intraclase (ICC): el indicador clave
El coeficiente de correlación intraclase (ICC, del inglés Intraclass Correlation Coefficient) es la primera estadística que debes calcular cuando sospechas que tus datos tienen estructura anidada. El ICC cuantifica qué proporción de la varianza total del resultado se debe a diferencias entre grupos, y no a diferencias entre individuos dentro de los grupos.
Se calcula a partir del modelo nulo (también llamado modelo vacío o de intercepto aleatorio sin predictores), que descompone la varianza total en varianza entre grupos (τ₀₀) y varianza dentro de grupos (σ²):
El ICC toma valores entre 0 y 1. Un ICC de 0 indica que los grupos no aportan varianza alguna —las observaciones son independientes y un modelo de regresión ordinaria es adecuado—. Un ICC de 1 indica que toda la variabilidad se debe a diferencias entre grupos. En la práctica:
| Valor ICC | Interpretación | Implicación para el análisis |
|---|---|---|
| 0 – 0.05 | Agrupamiento mínimo | OLS puede ser suficiente; valorar contexto |
| 0.05 – 0.15 | Agrupamiento moderado | HLM recomendable; ignorarlo sesga los errores estándar |
| 0.15 – 0.30 | Agrupamiento considerable | HLM necesario; el diseño de nivel 2 importa mucho |
| > 0.30 | Agrupamiento alto | HLM indispensable; los efectos de grupo dominan |
Un ICC alto no es un problema estadístico: es información sustantiva. Si el 30 % de la varianza en rendimiento académico se debe al centro educativo de pertenencia, eso ya es un hallazgo relevante en sí mismo —y precisamente el tipo de hallazgo que un modelo multinivel permite capturar y reportar con rigor.
Interceptos aleatorios vs. pendientes aleatorias
Una vez confirmado que el agrupamiento es relevante, debes decidir qué partes del modelo permites que varíen entre grupos. Aquí está la distinción conceptual más importante de toda la metodología multinivel:
Modelo de intercepto aleatorio (random intercept model)
En este modelo, cada grupo tiene su propia línea de base (intercepto), pero se asume que el efecto de los predictores (la pendiente) es idéntico en todos los grupos. Es el punto de partida lógico: los grupos difieren en su nivel medio del resultado, pero la relación entre el predictor X y el resultado Y es la misma en todos ellos.
En notación matricial sencilla, el submodelo de nivel 1 es:
Y el submodelo de nivel 2 permite que el intercepto varíe:
donde γ₀₀ es el intercepto promedio global y u₀j es la desviación aleatoria del grupo j respecto a ese promedio, con u₀j ~ N(0, τ₀₀).
Modelo de pendiente aleatoria (random slope model)
En este modelo se permite que también la pendiente (el efecto de X sobre Y) varíe entre grupos. Es la opción apropiada cuando tienes razones teóricas o empíricas para creer que la relación entre el predictor y el resultado no es homogénea en todos los grupos —por ejemplo, que el efecto de una intervención educativa difiere según el colegio, o que la relación entre apoyo social y bienestar varía entre departamentos de una empresa.
Esto introduce un componente de varianza adicional (τ₁₁) y una covarianza entre el intercepto y la pendiente (τ₀₁). Un τ₀₁ positivo indica que los grupos con mayor nivel de base en el resultado también muestran una relación más fuerte entre X e Y; un τ₀₁ negativo, lo contrario.
Interacciones entre niveles (cross-level interactions)
Una de las grandes ventajas de los modelos multinivel es que permiten estimar interacciones entre variables de distintos niveles. Si tienes una variable de nivel 2 (p. ej., el tipo de liderazgo en la empresa) y quieres saber si modera el efecto de una variable de nivel 1 (p. ej., la autonomía percibida) sobre el resultado, el modelo de pendiente aleatoria con predictor de nivel 2 sobre esa pendiente es el mecanismo formal para comprobarlo. Este tipo de hipótesis —frecuentes en psicología organizacional, pedagogía y salud pública— son inabordables con una regresión simple o incluso con un ANOVA convencional. Para diseños en los que la covariable de nivel 1 requiere control estadístico sin formar parte de la estructura anidada, el ANCOVA con supuesto de pendientes homogéneas es la alternativa complementaria que debes conocer antes de decidir entre ambos enfoques.
Cuando eliges la prueba estadística apropiada para tu diseño, la distinción entre datos independientes y anidados es tan decisiva como el tipo de variable de resultado; puedes revisar la lógica de cómo seleccionar la prueba estadística correcta en el TFG para situar los modelos multinivel dentro del árbol de decisión general.
Supuestos de los modelos multinivel
Los modelos multinivel lineales comparten parte de los supuestos de la regresión OLS, pero los extienden a los distintos niveles. Los principales son:
- Normalidad de los residuos de nivel 1 (eij): se asume que los errores dentro de los grupos se distribuyen normalmente con media cero y varianza σ².
- Normalidad de los efectos aleatorios de nivel 2 (u₀j, u₁j): las desviaciones de grupo respecto a los efectos medios se distribuyen normalmente con media cero y matriz de varianza-covarianza G.
- Independencia entre niveles: los residuos de nivel 1 no están correlacionados con los efectos aleatorios de nivel 2.
- Homocedasticidad dentro de grupos: la varianza de los residuos de nivel 1 es constante (salvo que se especifique un modelo de varianza heterogénea).
- Linealidad: la relación entre predictores y resultado es lineal en los parámetros (como en OLS).
- Número suficiente de grupos de nivel 2: como regla orientativa, se recomienda disponer de al menos 20-30 unidades de nivel 2 para que las estimaciones de los componentes de varianza sean estables. Con menos grupos, las estimaciones de los efectos aleatorios son imprecisas y los tests pueden comportarse mal. La planificación del tamaño muestral para HLM debe hacerse antes de la recogida de datos: la guía sobre cómo calcular el tamaño muestral con G*Power para análisis de potencia a priori incluye los pasos específicos para diseños multinivel.
Verificar estos supuestos implica examinar los residuos de cada nivel mediante gráficos Q-Q, diagramas de dispersión de residuos contra valores ajustados, y pruebas como Shapiro-Wilk sobre los efectos aleatorios estimados. La mayoría de los programas estadísticos habituales generan estos diagnósticos de forma automática.
Software: R, SPSS, Stata, MLwiN y HLM
En 2026 hay varias opciones maduras para ajustar modelos multinivel. La elección depende de tu disciplina, la disponibilidad institucional y tu nivel de programación:
| Software | Función / paquete | Coste | Fortaleza principal |
|---|---|---|---|
| R | lme4 (lmer / glmer) | Gratuito | Flexibilidad total, comunidad enorme, reproducible |
| SPSS | MIXED / GENLINMIXED | De pago (licencia) | Interfaz gráfica familiar para ciencias sociales |
| Stata | mixed / melogit | De pago (licencia) | Muy usado en epidemiología y economía |
| MLwiN | Nativo | Gratuito para universidades UK; licencia fuera | Especializado; modelos bayesianos MCMC |
| HLM 8 | Nativo (SSI) | De pago | Pensado específicamente para HLM; output didáctico |
Para la mayoría de tesis en universidades españolas, la combinación R + lme4 + el paquete lmerTest (que añade los p-valores de Satterthwaite a la salida de lme4) es la opción más reproducible, gratuita y alineada con las exigencias de transparencia metodológica actuales. Si tu departamento trabaja con SPSS, el procedimiento MIXED es perfectamente válido y genera diagnósticos completos.
Para quienes provienen de una tradición más cuantitativa en economía o ciencias sociales, los modelos multinivel comparten familia con la regresión por efectos fijos y efectos aleatorios habitual en econometría; si ya tienes experiencia con modelos econométricos aplicados al TFG, la transición conceptual al HLM es relativamente directa.
Cómo construir el modelo paso a paso
La práctica recomendada en la literatura es construir el modelo de forma incremental, comparando modelos sucesivos mediante el test de razón de verosimilitudes (LRT, likelihood ratio test) o los criterios de información AIC y BIC.
Paso 1: Modelo nulo (vacío)
Sin predictores. Su único objetivo es obtener el ICC y confirmar que existe agrupamiento suficiente para justificar el HLM. En R con lme4:
Paso 2: Modelo de intercepto aleatorio con predictores de nivel 1
Se añaden las variables predictoras de nivel individual. La pendiente de esas variables es fija (igual para todos los grupos), pero los interceptos varían:
Paso 3: Modelo de pendiente aleatoria
Si la teoría sugiere que el efecto del predictor de nivel 1 varía entre grupos, se libera la pendiente:
Paso 4: Añadir predictores de nivel 2 e interacciones entre niveles
Se incluyen variables de grupo como predictores de los interceptos o las pendientes aleatorias:
En cada paso se comparan los modelos con anova(modelo_anterior, modelo_nuevo) en R. Un chi-cuadrado significativo (con los grados de libertad correspondientes a los parámetros añadidos) justifica la complejidad añadida. Una vez fijada la estructura de efectos aleatorios óptima, se reajusta el modelo final con REML = TRUE para obtener estimaciones imparciales de los componentes de varianza.
Este proceso de construcción incremental es análogo al que se sigue en otros diseños cuantitativos: igual que en la regresión lineal múltiple convencional se verifican los supuestos antes de interpretar los coeficientes, en HLM se verifica primero la estructura de efectos aleatorios antes de centrarse en los efectos fijos.
Cómo reportar los resultados en APA 7
El reporte de un modelo multinivel en una tesis debe incluir, como mínimo, los siguientes elementos:
- Justificación del HLM: indica el ICC del modelo nulo y el resultado del LRT que descarta el modelo de un nivel.
- Descripción de la estructura del modelo: número de niveles, unidades de análisis en cada nivel (p. ej., N = 342 alumnos en J = 24 aulas), variables de cada nivel.
- Tabla de efectos fijos: coeficiente γ, error estándar, grados de libertad (método de Satterthwaite o Kenward-Roger), estadístico t y valor p.
- Tabla de efectos aleatorios / componentes de varianza: varianza del intercepto (τ₀₀), varianza de la pendiente si la hay (τ₁₁), covarianza (τ₀₁) y varianza residual de nivel 1 (σ²).
- ICC final: del modelo nulo y, si procede, pseudo-R² para cuantificar la varianza explicada por los predictores en cada nivel.
- Criterios de ajuste: AIC y BIC del modelo final.
- Software utilizado: nombre, versión y referencia. Ejemplo: «Los análisis se realizaron con el paquete lme4 (versión 1.1-35) para R (R Core Team, 2024)».
Sobre los componentes de varianza, una forma clara es: «La varianza entre centros (τ₀₀ = 0.18) representó el 21 % de la varianza total (ICC = 0.21), indicando una heterogeneidad entre centros metodológicamente relevante.»
Cuando diseñas el capítulo de análisis de datos, conviene tener en cuenta también qué otras pruebas complementan al HLM. Por ejemplo, si parte de tu muestra tiene diseño transversal con variables categóricas, la prueba chi-cuadrado puede ser pertinente para analizar tablas de contingencia de variables de nivel 2. Del mismo modo, si combinas un diseño de medidas repetidas con grupos de control e intervención, un diseño de caso único N=1 puede complementar el análisis poblacional ofreciendo evidencia idiográfica. Cuando los datos de nivel 1 no cumplen el supuesto de normalidad y los grupos son más de dos, la prueba de Kruskal-Wallis como alternativa no paramétrica al ANOVA puede servir para análisis exploratorios previos al ajuste del modelo multinivel. Y si el objetivo incluye verificar si el modelo resulta adecuado para describir el conjunto de datos, la comparación con el enfoque de análisis de datos mediante herramientas como SPSS o R puede orientar sobre la mejor estrategia de presentación.
Preguntas frecuentes sobre los modelos multinivel
¿Cuántas unidades de nivel 2 necesito para ajustar un modelo multinivel?
No existe un número mínimo universal, pero la recomendación más extendida en la literatura metodológica es disponer de al menos 20-30 grupos de nivel 2 para que las estimaciones de los componentes de varianza sean suficientemente precisas. Con menos grupos, los efectos aleatorios son difíciles de estimar con fiabilidad y los tests de significación sobre los componentes de varianza pueden resultar conservadores o comportarse de forma irregular. Con grupos de nivel 2 muy pocos (menos de 10), considera alternativas como la corrección de Huber-White para errores estándar robustos o el uso de efectos fijos de grupo.
¿Qué diferencia hay entre un modelo de efectos fijos y un modelo multinivel?
El modelo de efectos fijos de grupo (introducir una variable dummy por cada grupo) controla perfectamente la heterogeneidad no observada entre grupos, pero consume muchos grados de libertad y no permite estimar el efecto de variables de nivel 2 que no varían dentro de cada grupo. El modelo multinivel (efectos aleatorios) asume que los grupos son una muestra de una distribución superpoblacional mayor, lo que permite estimar efectos de variables de nivel 2 y generalizar más allá de los grupos específicos de la muestra. La elección entre ambos depende de los supuestos teóricos y se puede contrastar formalmente con el test de Hausman.
¿Se puede aplicar el modelo multinivel con variables de resultado no continuas?
Sí. Los modelos lineales mixtos generalizados (GLMM) extienden el HLM a resultados binarios (logístico multinivel), de recuento (Poisson o binomial negativa multinivel) y ordinales (modelos de umbral multinivel). En R se ajustan con la función glmer() del paquete lme4. El ICC se interpreta de forma análoga, aunque su cálculo requiere ajustes específicos según la distribución de la variable de resultado (p. ej., la varianza de nivel 1 en una distribución logística es π²/3 ≈ 3.29).
¿Qué es el “efecto de diseño” (design effect, DEFF) y cómo se relaciona con el ICC?
El efecto de diseño cuantifica cuánto se infla el error de muestreo por la agrupación respecto a lo que se obtendría con muestreo aleatorio simple. Se calcula como DEFF = 1 + (n̄ – 1) × ICC, donde n̄ es el número medio de observaciones por grupo. Si DEFF = 2, los errores estándar de OLS están subestimados en un factor de √2 ≈ 1.41. Esto ilustra por qué los efectos pueden parecer significativos cuando en realidad no lo son si no se modeliza la estructura anidada.
¿Cómo se reporta el ICC del modelo nulo en la tesis?
El ICC se suele reportar en la sección de resultados, antes de presentar los modelos con predictores. Un formato habitual es: «El modelo nulo reveló una varianza entre centros de τ₀₀ = 0.23 y una varianza residual de σ² = 0.86, con un ICC = 0.21, indicando que el 21 % de la varianza en [variable resultado] es atribuible a diferencias entre centros. Este valor justifica el uso de modelos multinivel para el análisis de los datos.» A continuación se presenta el test de razón de verosimilitudes que compara el modelo nulo con el de un solo nivel.
¿Es necesario centrar las variables predictoras en los modelos multinivel?
El centrado es especialmente importante en HLM porque afecta a la interpretación de los interceptos y a la separación entre efectos within y between. Hay dos opciones principales: el centrado en la gran media (grand-mean centering), que facilita la interpretación del intercepto como el valor predicho para una observación en el promedio de toda la muestra; y el centrado en la media del grupo (group-mean centering), que elimina completamente la varianza entre grupos de la variable predictora de nivel 1 y hace que su coeficiente capture el efecto puramente within. La elección debe estar justificada teóricamente en el capítulo de metodología de la tesis.
Escribe tu TFG o tesis con IA
Pasa de la teoría a tu documento terminado
Tesify estructura, redacta y formatea tu TFG, TFM o tesis en normas APA y Vancouver, con bibliografía automática y verificación antiplagio integrada. Regístrate gratis, sin tarjeta.
Leave a Reply