Regresión logística en la tesis: cómo interpretar los odds ratio (2026)
Has ejecutado el modelo en SPSS o R, tienes una tabla llena de coeficientes y odds ratio, y ahora necesitas explicar en el capítulo de resultados qué significa realmente cada número. La regresión logística en la tesis es una de las técnicas estadísticas más usadas cuando la variable dependiente es dicotómica —aprobó/suspendió, abandonó/continuó, enfermo/sano— y su correcta interpretación, especialmente la del odds ratio (OR), es también uno de los puntos donde más errores aparecen en defensas y artículos.
Un error frecuente es tratar el OR como si fuera directamente una probabilidad o un riesgo relativo, cuando en realidad expresa una razón de posibilidades (odds), un concepto relacionado pero matemáticamente distinto. Esta guía explica cuándo aplicar el modelo, cómo leer el OR y su intervalo de confianza, qué papel juega el valor p, y qué supuestos hay que comprobar antes de confiar en los resultados.
Respuesta rápida: La regresión logística se usa cuando la variable dependiente es dicotómica (dos categorías). El odds ratio (OR) indica cuánto cambian las posibilidades del evento por cada unidad de aumento del predictor: OR>1 indica mayor probabilidad, OR<1 menor y OR=1 ausencia de asociación. El efecto es significativo si su intervalo de confianza del 95% no incluye el valor 1.
¿Cuándo usar regresión logística en tu tesis?
La regresión logística binaria es el modelo adecuado cuando tu variable dependiente tiene exactamente dos categorías: sí/no, éxito/fracaso, presente/ausente. A diferencia de la regresión lineal, que asume una relación continua y una distribución normal de los residuos, la regresión logística modela la probabilidad de pertenecer a una de las dos categorías a partir de un conjunto de variables predictoras, que pueden ser continuas, categóricas o una combinación de ambas. Es, por tanto, una técnica propia del análisis cuantitativo, distinta de enfoques interpretativos como el análisis temático de Braun y Clarke que se aplica a datos cualitativos.
Ejemplos habituales en tesis de ciencias sociales, salud y educación incluyen: predecir el abandono universitario (abandona/no abandona) a partir de variables socioeconómicas, predecir el éxito de un tratamiento (responde/no responde) a partir de variables clínicas, o predecir la intención de voto (vota/no vota) a partir de variables demográficas. Cuando la variable dependiente tiene más de dos categorías no ordenadas, el modelo apropiado es la regresión logística multinomial; cuando las categorías tienen un orden natural (bajo/medio/alto), corresponde la regresión logística ordinal. Confundir estos tres modelos es un error metodológico que suele señalarse en la revisión de tesis.

¿Qué es el odds ratio y cómo se interpreta?
El odds ratio no es una probabilidad ni un riesgo relativo, aunque coloquialmente se usen como sinónimos. El “odds” (razón de posibilidades) de un evento es el cociente entre la probabilidad de que ocurra y la probabilidad de que no ocurra. El odds ratio compara esa razón entre dos grupos, o expresa cuánto cambia esa razón por cada unidad de incremento en una variable predictora continua.
| Valor del OR | Interpretación |
|---|---|
| OR = 1 | El predictor no está asociado con el evento; las posibilidades no cambian |
| OR > 1 | El predictor se asocia con mayores posibilidades del evento (por ejemplo, OR = 2 indica que las posibilidades del evento se duplican por cada unidad de incremento en el predictor, manteniendo constantes las demás variables del modelo) |
| OR < 1 | El predictor se asocia con menores posibilidades del evento (por ejemplo, OR = 0,5 indica que las posibilidades del evento se reducen a la mitad por cada unidad de incremento en el predictor) |
| OR muy cercano a 1 con IC amplio | Asociación débil o incierta; el tamaño muestral puede ser insuficiente para estimar el efecto con precisión |
Para variables predictoras categóricas, el OR se interpreta siempre en relación con una categoría de referencia. Por ejemplo, si “sexo” se codifica con “mujer” como referencia, un OR de 1,8 para “hombre” significa que, en este modelo, los hombres tienen unas posibilidades del evento 1,8 veces mayores que las mujeres, manteniendo el resto de variables constantes.
Intervalo de confianza y valor p: ¿cuándo es significativo un OR?
Reportar solo el OR puntual sin su intervalo de confianza es una omisión frecuente y problemática, porque el IC comunica la precisión de la estimación, algo que el valor p por sí solo no transmite. La regla práctica es la siguiente: si el intervalo de confianza del 95% del OR no incluye el valor 1, el efecto se considera estadísticamente significativo al nivel convencional de 0,05. Si el intervalo incluye el 1 —por ejemplo, un IC 95% de [0,85 – 2,10]— no se puede descartar que no exista asociación real, incluso si el OR puntual es mayor que 1.
El valor p asociado a cada coeficiente (habitualmente mediante el test de Wald) indica la probabilidad de observar un efecto igual o más extremo que el estimado si la hipótesis nula (OR = 1) fuera cierta. Conviene reportar siempre ambos elementos —IC 95% y valor p— en la tabla de resultados, y no limitarse a marcar los coeficientes “significativos” con asteriscos sin explicar la magnitud práctica del efecto. Un error habitual en tesis es interpretar un valor p pequeño como evidencia de una asociación “fuerte”, cuando en realidad la significación estadística depende también del tamaño muestral y no sustituye a la magnitud del efecto que aporta el propio OR.
Ejemplo con tabla de resultados
Supongamos una tesis que modela la probabilidad de abandono en el primer año de un grado universitario (0 = continúa, 1 = abandona) a partir de tres predictores: nota media de acceso, trabajar mientras se estudia (sí/no) y recibir beca (sí/no).
| Predictor | OR | IC 95% | Valor p | Interpretación |
|---|---|---|---|---|
| Nota media de acceso | 0,62 | [0,48 – 0,80] | < 0,001 | Por cada punto adicional en la nota de acceso, las posibilidades de abandono se reducen (efecto significativo, IC no incluye 1) |
| Trabajar mientras se estudia (sí vs. no) | 1,95 | [1,20 – 3,18] | 0,007 | Trabajar se asocia con casi el doble de posibilidades de abandono respecto a no trabajar (efecto significativo) |
| Recibir beca (sí vs. no) | 0,88 | [0,55 – 1,41] | 0,594 | El IC incluye el 1; no hay evidencia suficiente de asociación con el abandono en este modelo |
Los datos de esta tabla son ilustrativos, con fines pedagógicos, y no proceden de un estudio empírico publicado.
En la redacción del capítulo de resultados, cada fila de esta tabla se traduce en una frase interpretativa completa, no solo en la lectura del número. Por ejemplo: “La nota media de acceso se asoció significativamente con menor probabilidad de abandono (OR = 0,62; IC 95% [0,48-0,80]; p < 0,001), mientras que trabajar durante los estudios se asoció con mayor probabilidad de abandono (OR = 1,95; IC 95% [1,20-3,18]; p = 0,007). La variable beca no mostró una asociación estadísticamente significativa (OR = 0,88; IC 95% [0,55-1,41]; p = 0,594)”.
Supuestos del modelo que debes comprobar
- Independencia de las observaciones: cada caso debe ser independiente de los demás; datos jerárquicos o repetidos requieren modelos alternativos (por ejemplo, modelos mixtos).
- Ausencia de multicolinealidad severa entre predictores: se comprueba habitualmente con el factor de inflación de la varianza (VIF); valores VIF elevados indican que los predictores están demasiado correlacionados entre sí para estimar coeficientes fiables.
- Linealidad del logit: las variables predictoras continuas deben relacionarse linealmente con el logaritmo de las posibilidades (logit), no necesariamente con la variable dependiente en su escala original; se comprueba con el test de Box-Tidwell u observando gráficos residuales.
- Tamaño muestral suficiente: una recomendación habitual en la literatura metodológica es contar con al menos diez casos del grupo minoritario por cada predictor incluido en el modelo, aunque esta es una guía orientativa y no una regla estricta universal.
- Ausencia de valores atípicos influyentes: conviene revisar estadísticos de influencia (como la distancia de Cook) para detectar casos que distorsionen desproporcionadamente el modelo.
Además de comprobar estos supuestos, es habitual reportar el ajuste global del modelo mediante el estadístico de Hosmer-Lemeshow o mediante pseudo-R² (como el de Nagelkerke), y comparar el modelo completo frente a un modelo nulo mediante la prueba de razón de verosimilitud (likelihood ratio test). Si tu tesis combina esta técnica con un cuestionario, recuerda también comprobar la fiabilidad de tus escalas —por ejemplo, calculando el alfa de Cronbach en SPSS o jamovi— antes de incluir esas variables como predictores en el modelo.

Errores comunes al interpretar el OR
- Confundir odds ratio con riesgo relativo: ambos coinciden numéricamente solo cuando el evento es muy poco frecuente; en eventos comunes (por ejemplo, con una prevalencia superior al 10%), el OR sobreestima el riesgo relativo y no deben usarse como sinónimos.
- Interpretar el OR como un porcentaje directo: un OR de 1,95 no significa “95% más de riesgo” en el sentido de riesgo absoluto, sino que las posibilidades (odds) son casi el doble.
- Omitir el intervalo de confianza: reportar solo el OR puntual sin su IC 95%, lo que impide valorar la precisión de la estimación.
- No comprobar los supuestos del modelo: ejecutar la regresión logística directamente sin verificar multicolinealidad, linealidad del logit o tamaño muestral adecuado.
- Igualar significación estadística con relevancia práctica: un valor p pequeño con un OR cercano a 1 puede ser estadísticamente significativo en muestras muy grandes sin representar un efecto de magnitud relevante para la pregunta de investigación.
Preguntas frecuentes
¿Qué diferencia hay entre odds ratio y riesgo relativo?
El riesgo relativo compara probabilidades directamente, mientras que el odds ratio compara razones de posibilidades (odds). Ambos coinciden aproximadamente cuando el evento estudiado es poco frecuente, pero divergen y el OR tiende a sobreestimar el efecto cuando la prevalencia del evento es alta.
¿Qué tamaño muestral necesito para una regresión logística en mi tesis?
Una guía orientativa habitual en la literatura metodológica es disponer de al menos diez casos del grupo minoritario de la variable dependiente por cada predictor incluido en el modelo. Con muestras pequeñas o eventos raros, los coeficientes pueden ser inestables y conviene consultar alternativas como la regresión logística penalizada.
¿Puedo usar regresión logística con más de dos categorías en la variable dependiente?
No con el modelo logístico binario. Para variables dependientes con más de dos categorías sin orden se utiliza la regresión logística multinomial, y para categorías con orden natural, la regresión logística ordinal.
¿Cómo sé si mi modelo de regresión logística tiene buen ajuste?
Se suele reportar el estadístico de Hosmer-Lemeshow (un valor p no significativo indica buen ajuste), algún pseudo-R² como el de Nagelkerke, y la comparación del modelo completo frente a un modelo nulo mediante la prueba de razón de verosimilitud.
¿Es lo mismo un coeficiente beta que un odds ratio?
No. El coeficiente beta de la regresión logística está expresado en la escala del logaritmo de las posibilidades (log-odds). El odds ratio se obtiene aplicando la función exponencial al coeficiente beta (OR = e^beta) y se interpreta en la escala de razón de posibilidades, más intuitiva para reportar resultados.
¿Qué software puedo usar para calcular la regresión logística en mi tesis?
SPSS, R (con la función glm y familia binomial) y Stata son las opciones más habituales en tesis de ciencias sociales y salud. Todos ofrecen el OR, el intervalo de confianza y el valor p directamente o mediante una transformación sencilla de los coeficientes.
Escribe tu TFG o tesis con IA
Pasa de la teoría a tu documento terminado
Tesify estructura, redacta y formatea tu TFG, TFM o tesis en normas APA y Vancouver, con bibliografía automática y verificación antiplagio integrada. Regístrate gratis, sin tarjeta.

Leave a Reply