, ,

Regresión lineal múltiple en la tesis: supuestos, interpretación y reporte APA (2026)

Regresión lineal múltiple en la tesis: supuestos, interpretación y reporte APA (2026)

Cuando el análisis estadístico de una tesis busca predecir una variable a partir de varias variables explicativas, la regresión lineal múltiple es, con mucha diferencia, el modelo más frecuente en ciencias sociales, educación, psicología y ciencias de la salud. Sin embargo, también es el modelo que con más frecuencia se aplica mal: sin verificar los supuestos, sin reportar los estadísticos que exige APA, sin distinguir el coeficiente B del coeficiente β ni explicar qué significa realmente el valor de R². El tribunal lo nota.

Esta guía recorre los cinco supuestos que hay que verificar antes de interpretar cualquier resultado, explica la interpretación sustantiva de cada estadístico clave y detalla el formato de reporte que exigen las normas APA 7 en 2026. El objetivo es que puedas construir y presentar tu modelo de regresión con la solidez metodológica de un estadístico, aunque sea la primera vez que lo haces.

Respuesta rápida: La regresión lineal múltiple requiere verificar cinco supuestos (linealidad, normalidad de residuos, homocedasticidad, independencia y no multicolinealidad). El reporte APA 7 exige presentar B, SE, β, t, p e IC95% para cada predictor, más R², R² ajustado y F del modelo. Nunca se interpreta β sin antes haber confirmado que los supuestos se cumplen razonablemente.

Cuándo se usa la regresión lineal múltiple

La regresión lineal múltiple es apropiada cuando se cumplen dos condiciones: (1) la variable dependiente (Y) es continua (o al menos de escala de intervalo); (2) se quiere estudiar el efecto de dos o más variables independientes (X₁, X₂, … Xₖ) sobre Y, controlando por el resto de predictores. Las preguntas típicas que responde son:

  • «¿En qué medida la motivación, el tiempo de estudio y el nivel socioeconómico predicen el rendimiento académico?»
  • «¿Qué proporción de la varianza del bienestar psicológico se explica por variables de autoeficacia, apoyo social y regulación emocional?»
  • «¿Qué predictor contribuye más, de forma independiente, a la variable dependiente una vez controladas las demás variables?»

Si la variable dependiente es categórica (sí/no, aprobado/suspendido, pertenencia a un grupo), el modelo adecuado es la regresión logística, no la lineal. Si sólo hay un predictor, basta con la regresión lineal simple. Para decidir qué prueba estadística usar en cada situación, el árbol de decisión de qué prueba estadística usar en tu TFG en 2026 ofrece una guía sistemática paso a paso.

Comprender la distinción entre las variables independientes (predictores) y la variable dependiente (criterio) es el primer paso antes de cualquier análisis. El blog de Marca Investigación tiene una explicación accesible sobre variables independientes, dependientes e intervinientes que conviene repasar si hay dudas conceptuales antes de plantear el modelo.

Los cinco supuestos del modelo

El modelo de regresión lineal múltiple clásico (OLS, mínimos cuadrados ordinarios) descansa sobre cinco supuestos. Violarlos no invalida necesariamente el modelo, pero sí limita la validez de las inferencias y puede invalidar los errores estándar y los intervalos de confianza.

1. Linealidad

La relación entre cada predictor Xᵢ y la variable dependiente Y debe ser lineal. Se verifica mediante gráficos de dispersión de los residuos frente a los valores ajustados (el gráfico no debe mostrar ningún patrón curvilíneo sistemático) y mediante gráficos de dispersión de Y frente a cada Xᵢ individualmente. Si la relación es claramente no lineal, considerar transformar las variables (raíz cuadrada, logaritmo) o añadir términos cuadráticos.

2. Normalidad de los residuos

Los residuos del modelo deben seguir una distribución normal. Se verifica mediante el histograma de residuos tipificados (debería tener forma de campana), el gráfico Q-Q de probabilidad normal (los puntos deben seguir la diagonal) y pruebas formales como Kolmogorov-Smirnov o Shapiro-Wilk. Importante: el supuesto es sobre los residuos, no sobre las variables originales. Con muestras grandes (n > 200), la regresión es bastante robusta a desviaciones moderadas de la normalidad gracias al teorema central del límite.

3. Homocedasticidad

La varianza de los residuos debe ser constante a lo largo de todos los valores de los predictores (varianza homogénea u homocedasticidad). Se detecta visualmente en el gráfico de residuos estandarizados frente a valores ajustados: si la nube de puntos tiene forma de embudo que se ensancha, hay heterocedasticidad. El test de Levene o el test de Breusch-Pagan permiten la verificación formal. Si hay heterocedasticidad, se puede usar regresión con errores estándar robustos (White).

4. Independencia de los residuos

Los residuos deben ser independientes entre sí: el error de una observación no debe predecir el error de otra. Este supuesto es especialmente relevante en datos longitudinales o datos recogidos de grupos jerárquicamente organizados (estudiantes dentro de aulas, pacientes dentro de hospitales). Se verifica con el estadístico Durbin-Watson, que debe estar próximo a 2 (valores < 1 o > 3 indican autocorrelación problemática). Si los datos tienen estructura de grupos, considerar el uso de modelos mixtos o multinivel.

5. No multicolinealidad

Los predictores no deben estar fuertemente correlacionados entre sí. La multicolinealidad no sesga los coeficientes, pero infla sus errores estándar, haciendo que predictores con efecto real aparezcan como no significativos. Se detecta mediante el Factor de Inflación de la Varianza (VIF): valores VIF > 10 indican multicolinealidad grave; el umbral conservador de VIF > 5 es preferible en tesis. También puede usarse la tolerancia = 1/VIF (valores < 0,10 son preocupantes). Si hay multicolinealidad, las opciones son: eliminar uno de los predictores redundantes, combinarlos en un índice compuesto o usar regresión ridge.

Infografía interactiva sobre los supuestos básicos de la estadística multivariable, incluyendo normalidad, homocedasticidad, multicolinealidad y linealidad. Fuente: Genially — Estadística Multivariable y Supuestos básicos

Cómo verificar cada supuesto en SPSS y JASP

Supuesto SPSS JASP
Linealidad Gráficos → Parciales; Diagrama de dispersión Residuos/Ajustados Regression → Plots → Residuals vs Fitted
Normalidad residuos Guardar residuos tipificados → Histograma + K-S Regression → Assumption Checks → Q-Q plot
Homocedasticidad Diagrama dispersión *ZRESID / *ZPRED Regression → Breusch-Pagan test
Independencia Estadísticos → Durbin-Watson Regression → Durbin-Watson
No multicolinealidad Estadísticos → Diagnóstico de colinealidad → VIF Regression → Collinearity diagnostics → VIF

Para elegir el programa con el que ejecutar el modelo, la comparativa entre SPSS, Jamovi y PSPP como software estadístico para el TFG detalla precio, funciones y curva de aprendizaje de cada opción, con un benchmark del mismo dataset que incluye la regresión.

Interpretación de B, β y R²

Coeficiente B (no estandarizado)

B es el cambio esperado en Y por cada unidad de incremento en Xᵢ, manteniendo constantes el resto de predictores. B está en las unidades originales de las variables, lo que lo hace interpretable sustantivamente pero no comparable entre predictores con escalas distintas. Por ejemplo, si la escala de motivación va de 1 a 5 y la variable de tiempo de estudio se mide en horas semanales, los valores de B para ambos predictores no son directamente comparables.

Coeficiente β (estandarizado)

β es el coeficiente que se obtiene cuando todas las variables se han estandarizado (convertido a puntuaciones z con media 0 y desviación típica 1). Permite comparar la contribución relativa de cada predictor dentro del mismo modelo: el predictor con el β de mayor valor absoluto es el que más peso tiene en la predicción de Y, controladas las demás variables. Es el coeficiente que se reporta para responder a la pregunta «¿qué predictor es el más importante?».

Precaución: β no es directamente comparable entre modelos distintos (con distintas muestras o distintos predictores). Sólo es válido para comparar predictores dentro del mismo modelo. No usar β para comparar la importancia relativa de un predictor en el modelo A frente al modelo B.

R² (coeficiente de determinación)

R² indica qué proporción de la varianza total de Y es explicada por el conjunto de predictores del modelo. Oscila entre 0 y 1 (o equivalentemente entre 0% y 100%). Un R² de 0,35 significa que el modelo explica el 35% de la varianza de la variable dependiente. La interpretación de si ese valor es alto o bajo depende del campo disciplinar: en psicología clínica y educación, valores de R² entre 0,10 y 0,35 son habituales y metodológicamente aceptables; en modelos de predicción física o económica, se esperan valores más altos.

R² ajustado y tamaño del efecto f²

R² aumenta automáticamente cada vez que se añade un predictor al modelo, aunque ese predictor no contribuya realmente a explicar Y. Por eso APA 7 recomienda reportar siempre el R² ajustado, que penaliza la inclusión de predictores innecesarios y es más honesto con el ajuste real del modelo en la población. Con pocos predictores y muestra grande, R² y R² ajustado son casi iguales; la diferencia crece a medida que el número de predictores aumenta y la muestra disminuye.

El tamaño del efecto f² de Cohen para la regresión se calcula como f² = R² / (1 − R²). Cohen (1988) estableció los umbrales convencionales: f² = 0,02 (pequeño), f² = 0,15 (mediano) y f² = 0,35 (grande). Este estadístico se utiliza también para el cálculo de potencia estadística a priori. Para profundizar en la interpretación del tamaño del efecto en el contexto del TFG, el artículo sobre el tamaño del efecto d de Cohen en el TFG: datos y cálculo para 2026 ofrece una guía con datos actualizados. Para entender la relación entre el tamaño del efecto y la significación estadística, el artículo sobre intervalo de confianza vs. valor p en la tesis desarrolla este debate con detalle.

Reporte APA 7: tabla y texto

Según las directrices de APA (2020, Sección 7.21), el reporte de una regresión múltiple en la tesis debe incluir obligatoriamente:

En la tabla de coeficientes:

  • Para cada predictor: B, SE(B), β, t, p, IC95%[B]
  • Para el modelo: R², R² ajustado, F(gl₁, gl₂), p

Ejemplo de tabla mínima conforme a APA 7:

Tabla X. Resultados del análisis de regresión lineal múltiple para la predicción de [Variable Y]
Predictor B SE B β t p IC 95% [B]
Constante 2.14 0.38 5.63 < .001 [1.39, 2.89]
Predictor 1 0.45 0.09 .38 5.00 < .001 [0.27, 0.63]
Predictor 2 0.21 0.07 .22 3.00 .003 [0.07, 0.35]
Nota. R² = .31, R² adj. = .29, F(2, 147) = 33.05, p < .001. Los valores p son bilaterales. IC = intervalo de confianza.

En el texto: el reporte narrativo mínimo en APA 7 sigue la estructura: «Se realizó un análisis de regresión lineal múltiple para predecir [Y] a partir de [X₁, X₂, X₃]. El modelo resultó estadísticamente significativo, F(k, n−k−1) = XX.XX, p < .001, R² = .XX, R² adj. = .XX, lo que indica que el modelo explica el XX% de la varianza de [Y]. El predictor de mayor peso fue [X₁], β = .XX, t(n−k−1) = XX.XX, p < .001, IC95%[B] = [x, y]».

Nótese que APA 7 usa el punto decimal (no la coma), no añade el cero antes del punto para valores que no pueden superar 1 (como p, β o R²: se escribe «.38», no «0.38»), y reporta p < .001 en lugar del valor exacto cuando éste es inferior a ese umbral.

Para ver un caso aplicado de principio a fin, con un dataset real y la salida de SPSS comentada, el artículo sobre la regresión múltiple en el TFG con SPSS, paso a paso e interpretación de resultados complementa esta guía de supuestos y reporte con un ejemplo trabajado completo.

Errores frecuentes en tesis

  • Interpretar β sin verificar los supuestos: si hay multicolinealidad grave, los β son inestables e ininterpretables. La verificación de supuestos siempre precede a la interpretación.
  • Confundir B con β: B no sirve para comparar la importancia relativa de predictores con escalas distintas. Ese es el papel de β.
  • Reportar sólo p sin B ni β: APA 7 es explícita: el valor p por sí solo no es suficiente. Se necesitan los coeficientes, sus errores estándar y los intervalos de confianza.
  • No reportar R² ajustado: R² sin ajustar sobreestima sistemáticamente el ajuste del modelo en la población. Siempre reportar los dos.
  • Interpretar R² como causalidad: R² sólo mide asociación predictiva, no causalidad. La discusión debe ser cuidadosa al generalizar los hallazgos.
  • Incluir demasiados predictores: la regla N:k (mínimo 10-20 casos por predictor) debe respetarse para que las estimaciones sean estables.

La guía metodológica de muestreo y tamaño de muestra para tesis puede ayudarte a calcular el tamaño muestral necesario para que tu modelo de regresión tenga la potencia estadística adecuada.

Preguntas frecuentes

¿Cuándo se usa la regresión lineal múltiple en una tesis?

Se usa cuando se quiere predecir o explicar una variable dependiente continua a partir de dos o más variables independientes, controlando mutuamente sus efectos. Es adecuada para preguntas del tipo «¿en qué medida X₁, X₂ y X₃ predicen Y?» o «¿cuánto explican esas variables la varianza de Y?».

¿Cuáles son los cinco supuestos de la regresión lineal múltiple?

Los cinco supuestos son: (1) Linealidad entre predictores y variable dependiente. (2) Normalidad de los residuos. (3) Homocedasticidad (varianza constante de residuos). (4) Independencia de los residuos (no autocorrelación). (5) No multicolinealidad (predictores no fuertemente correlacionados entre sí).

¿Cómo se detecta la multicolinealidad?

Mediante el Factor de Inflación de la Varianza (VIF). Un VIF > 10 indica multicolinealidad grave; el umbral conservador VIF > 5 es preferible. La tolerancia (1/VIF) < 0,10 también es señal de alarma. Tanto SPSS como JASP calculan el VIF automáticamente en la tabla de coeficientes.

¿Qué significa R² en la regresión múltiple?

R² indica qué proporción de la varianza de la variable dependiente es explicada conjuntamente por todos los predictores del modelo. Un R² = 0,35 significa que el modelo explica el 35% de la varianza de Y. APA 7 recomienda reportar siempre el R² ajustado junto al R² sin ajustar.

¿Cómo se reporta una regresión múltiple en APA 7?

El reporte mínimo incluye: tabla con B, SE(B), β, t, p e IC95%[B] para cada predictor; R², R² ajustado y F con grados de libertad y valor p para el modelo completo. APA 7 recomienda además reportar el tamaño del efecto f² de Cohen. El cero se omite antes del punto decimal para valores acotados entre 0 y 1.

¿Cuántas observaciones necesito para una regresión múltiple?

La regla empírica habitual es de 10-20 observaciones por predictor (regla N:k). Con 5 predictores, se necesitan entre 50 y 100 casos mínimo. Para un cálculo preciso ajustado al nivel de R² esperado y a la potencia estadística deseada, se recomienda usar G*Power antes de recoger los datos.

Referencias

  • American Psychological Association. (2020). Publication manual of the American Psychological Association (7.ª ed.). APA. https://doi.org/10.1037/0000165-000
  • Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2.ª ed.). Lawrence Erlbaum Associates.
  • Field, A. (2018). Discovering statistics using IBM SPSS Statistics (5.ª ed.). Sage.

Escribe tu TFG o tesis con IA

Pasa de la teoría a tu documento terminado

Tesify estructura, redacta y formatea tu TFG, TFM o tesis en normas APA y Vancouver, con bibliografía automática y verificación antiplagio integrada. Regístrate gratis, sin tarjeta.

Leave a Reply

Your email address will not be published. Required fields are marked *

Escribe tu TFG o tesis con Tesify — gratis Probar gratis