Análisis de Supervivencia en la Tesis 2026: Kaplan-Meier, Prueba Log-Rank y Regresión de Cox Paso a Paso (SPSS y R)
Cuando la variable dependiente no es una puntuación ni una categoría, sino el tiempo que transcurre hasta que ocurre un suceso, la estadística clásica falla. La regresión lineal no maneja observaciones incompletas; la regresión logística ignora el factor temporal. El análisis de supervivencia Kaplan-Meier Cox tesis fue diseñado exactamente para este escenario: medir, comparar y modelizar el tiempo hasta el evento en presencia de censura. Su dominio ha superado la oncología para llegar a las ciencias sociales, la educación, la criminología y la psicología clínica.
Este artículo cubre de forma completa los tres pilares del análisis de supervivencia: el estimador de Kaplan-Meier para estimar la función de supervivencia sin asumir ninguna distribución, la prueba log-rank para comparar grupos y la regresión de Cox para modelizar el efecto de covariables ajustando por factores de confusión. Se incluyen la secuencia de pasos en SPSS y en R, la interpretación del hazard ratio, la verificación del supuesto de riesgos proporcionales y las pautas de reporte en APA 7.
¿Qué es el análisis de supervivencia?
El análisis de supervivencia —también llamado análisis de tiempo hasta el evento o, en ingeniería, análisis de fiabilidad— estudia el tiempo que transcurre desde un origen definido hasta la ocurrencia de un evento de interés. El «evento» puede ser cualquier suceso discreto y no recurrente dentro del marco de la investigación: fallecimiento, recaída de una enfermedad, abandono escolar, reinserción laboral, reincidencia delictiva o disolución de una empresa.
Lo que distingue a estos datos de los habituales en ciencias sociales y de la salud es que la variable de resultado no es el evento en sí (presencia/ausencia), sino el tiempo hasta ese evento. Esa naturaleza temporal convierte la censura en una realidad inevitable, que el análisis de supervivencia gestiona explícitamente en lugar de ignorarla. Para elegir entre este enfoque y otras técnicas —como la regresión logística o la lineal—, es útil consultar la guía para elegir la prueba estadística adecuada en el TFG.
Tipos de censura
La censura ocurre cuando la observación de un sujeto termina antes de que se produzca el evento, o cuando ese evento no puede constatarse con precisión. Los tipos principales son:
- Censura por la derecha (right censoring): la más frecuente. El sujeto abandona el estudio antes del evento, o el estudio concluye mientras el sujeto sigue sin experimentarlo. Su tiempo de seguimiento se conoce, pero el desenlace final, no.
- Censura por la izquierda (left censoring): el evento ocurrió antes del inicio del seguimiento observable.
- Censura por intervalo: solo se sabe que el evento ocurrió entre dos momentos de observación.
Tratar las observaciones censuradas como no-eventos —o eliminarlas del análisis— introduce sesgo. Los métodos de supervivencia incorporan la información parcial de estos sujetos de forma no sesgada. Cuando los datos presentan valores perdidos previos a la censura, conviene combinar este análisis con técnicas de imputación múltiple de datos faltantes para distinguir la pérdida aleatoria de la censura informativa.
Funciones de supervivencia S(t) y riesgo h(t)
La función de supervivencia S(t)
S(t) = P(T > t): la probabilidad de que el sujeto no haya experimentado el evento hasta el tiempo t. Empieza en S(0) = 1 y decrece (de forma monótona no creciente) hacia 0 con el tiempo. Cuando todos los sujetos acaban experimentando el evento, la curva alcanza S(∞) = 0; con censura importante puede quedar truncada por encima de cero.
La función de riesgo h(t)
h(t) (hazard function) es la tasa instantánea de ocurrencia del evento en el momento t, condicionada a haber sobrevivido hasta ese instante. No es una probabilidad sino una densidad, y puede superar el valor 1. Su integral acumulada H(t) = −log S(t) se denomina función de riesgo acumulado. La relación entre ambas funciones permite transitar entre distintas parametrizaciones del modelo y fundamenta la construcción del estimador de Kaplan-Meier y la regresión de Cox.
El estimador de Kaplan-Meier
El estimador de Kaplan-Meier (KM) es el método no paramétrico estándar para estimar S(t) a partir de datos observados con censura. No impone ninguna forma distribucional: calcula directamente la probabilidad de no experimentar el evento en cada tiempo de evento observado. La fórmula productolímite es:
Ŝ(t) = ∏ti ≤ t [ (ni − di) / ni ]
donde ni es el número de sujetos en riesgo justo antes del tiempo ti y di es el número de eventos que ocurren en ese momento. La estimación es un producto acumulado de probabilidades condicionales de no-evento en cada tiempo observado.
El resultado gráfico es una curva escalonada que desciende en los momentos exactos en que se producen eventos. Las marcas de censura —pequeños ticks sobre la curva— indican los sujetos que abandonaron el seguimiento sin que se produjera el evento. Para publicación, la figura siempre debe ir acompañada de la tabla de número en riesgo por debajo del eje de tiempo: permite al lector evaluar la fiabilidad de la estimación cuando la muestra se reduce.
Supóngase un estudio de adherencia a un programa de fisioterapia (n = 60; evento = abandono; seguimiento máximo = 12 meses). La curva KM podría mostrar que a los 3 meses Ŝ(3) = 0,82 (el 82 % de los pacientes sigue en el programa) y que a los 9 meses Ŝ(9) = 0,54, con marcas de censura en los meses 5 y 8 por cambio de domicilio. Ese perfil temporal es imposible de capturar con un simple porcentaje de abandono calculado al final del seguimiento.

La prueba log-rank
La prueba log-rank (Mantel-Cox) compara las curvas de supervivencia de dos o más grupos mediante una estadística chi-cuadrado. Contrasta la hipótesis nula de que las funciones S(t) son idénticas en todos los grupos para todo t. El estadístico suma, en cada tiempo de evento, la diferencia entre eventos observados (O) y esperados bajo H0 (E), ponderada por el número en riesgo:
χ² = Σ (Ok − Ek)² / Ek , con K−1 grados de libertad
Un valor p < 0,05 indica que al menos dos curvas difieren de forma estadísticamente significativa. El log-rank pondera por igual todos los instantes temporales; otras variantes enfatizan distintas fases:
| Prueba | Énfasis temporal | Cuándo preferirla |
|---|---|---|
| Log-rank (Mantel-Cox) | Uniforme en todo el seguimiento | Riesgo proporcional entre grupos durante todo el periodo |
| Breslow (Wilcoxon generalizado) | Pondera más la fase inicial | Se esperan diferencias tempranas entre grupos |
| Tarone-Ware | Ponderación intermedia | Situación de incertidumbre sobre la fase de mayor diferencia |
El log-rank no controla por covariables: compara grupos de forma univariada. Para ajustar por factores de confusión se necesita la regresión de Cox.
Regresión de Cox: hazard ratio y supuesto PH
La regresión de Cox (modelo de riesgos proporcionales, Cox proportional hazards model) describe la función de riesgo de cada sujeto como el producto de una función de riesgo basal h0(t) —no especificada— y un componente exponencial de las covariables:
h(t | X) = h0(t) · exp(β1X1 + β2X2 + … + βpXp)
La clave es que la forma de h0(t) no necesita especificarse: se estima de los propios datos. Esto distingue a Cox de los modelos paramétricos (Weibull, exponencial) y explica su adopción generalizada en la investigación aplicada.
El hazard ratio (HR)
Al exponenciar los coeficientes β se obtienen los hazard ratios: HR = exp(β). El HR es el cociente de riesgos instantáneos entre dos sujetos que difieren en una unidad en la covariable X, manteniendo el resto constantes:
- HR > 1: la covariable se asocia con mayor riesgo (menor tiempo de supervivencia).
- HR < 1: la covariable protege (mayor tiempo de supervivencia).
- HR = 1: sin efecto sobre el riesgo.
El HR de Cox es análogo al odds ratio en la regresión logística —ambos son medidas relativas de efecto— pero incorpora la dimensión temporal. La principal diferencia conceptual se discute en detalle en el artículo sobre regresión logística binaria e interpretación del odds ratio: cuando el seguimiento es heterogéneo y el evento frecuente, HR y OR divergen considerablemente.
El supuesto de riesgos proporcionales (PH)
El supuesto central del modelo de Cox establece que el HR entre cualesquiera dos perfiles de covariables permanece constante a lo largo del tiempo. Si el grupo A tiene el doble de riesgo que el grupo B en el mes 1, también lo tiene en el mes 12. Para verificarlo se usan:
- Residuos de Schoenfeld: si los residuos de una covariable muestran tendencia temporal significativa, el supuesto se viola. En R,
cox.zph()prueba esto formalmente (p < 0,05 sugiere violación). - Gráfico log(−log S) vs. log t: las curvas de los grupos deben ser aproximadamente paralelas.
- Interacción covariable × tiempo: estrategia de rescate cuando el supuesto falla.
Cuando el supuesto se viola solo en una variable, el modelo de Cox estratificado (strata() en R) permite una función de riesgo basal distinta por estrato sin restringir su HR, preservando la estimación de las demás covariables.
Pasos en SPSS
Kaplan-Meier en SPSS
- Ir a Analizar > Supervivencia > Kaplan-Meier.
- Mover la variable de tiempo al campo «Tiempo» y la variable de estado (0 = censurado, 1 = evento) al campo «Estado». Pulsar «Definir evento» e indicar el valor que corresponde al evento (habitualmente 1).
- En «Factor» introducir la variable de grupo para obtener curvas comparadas.
- En «Comparar factor»: activar Log rango y, opcionalmente, Breslow y Tarone-Ware.
- En «Opciones»: solicitar tabla de supervivencia y la gráfica de la función de supervivencia.
- Pulsar «Aceptar».
Regresión de Cox en SPSS
- Ir a Analizar > Supervivencia > Regresión de Cox.
- Definir tiempo y estado (con su valor de evento) como en el paso anterior.
- En «Covariables» introducir las variables predictoras. Las variables categóricas deben tratarse con el botón «Categórica» para que SPSS genere automáticamente las dummy.
- En «Método»: «Introducir» (entrada forzada) para modelos confirmatorios; «Por pasos» para exploración.
- En «Opciones»: solicitar exp(B) con sus IC 95 %, gráfico de la función de riesgo acumulado por grupo (para verificar visualmente el supuesto PH) y residuos de Schoenfeld.
- Pulsar «Aceptar».
Pasos en R (paquetes survival y survminer)
Los paquetes principales son survival (incluido en la distribución base de R) y survminer para visualización. Instala survminer con install.packages("survminer").
library(survival)
library(survminer)
# 1. Crear el objeto Surv (tiempo, estado: 1=evento, 0=censurado)
surv_obj <- Surv(time = datos$tiempo, event = datos$estado)
# 2. Kaplan-Meier por grupos
km_fit <- survfit(surv_obj ~ grupo, data = datos)
summary(km_fit) # tabla de supervivencia con IC 95%
# 3. Gráfica KM con tabla de riesgo y valor p del log-rank
ggsurvplot(km_fit, data = datos, pval = TRUE,
conf.int = TRUE, risk.table = TRUE,
legend.labs = c("Control", "Intervención"),
xlab = "Tiempo (meses)")
# 4. Prueba log-rank formal
survdiff(surv_obj ~ grupo, data = datos)
# 5. Regresión de Cox multivariante
cox_mod <- coxph(surv_obj ~ edad + sexo + grupo, data = datos)
summary(cox_mod) # HR = exp(coef), IC 95%, valor p
# 6. Verificar supuesto de riesgos proporcionales (Schoenfeld)
ph_test <- cox.zph(cox_mod)
print(ph_test) # p > 0.05 indica supuesto no violado
ggcoxzph(ph_test) # gráfico de residuos por covariable
La función ggsurvplot() genera curvas de publicación con tabla de riesgo, intervalos de confianza simultáneos y el valor p del log-rank, todo en un solo bloque de código. Los resultados del análisis de Cox se interpretan con la misma lógica que la regresión lineal múltiple —covariables, supuestos y diagnósticos del modelo—, aunque la variable de respuesta y los estadísticos difieren.
Interpretación y reporte en APA 7
El estilo de reporte varía según el componente del análisis:
| Componente | Qué reportar | Ejemplo de frase |
|---|---|---|
| Kaplan-Meier | Mediana de supervivencia (IC 95 %), número en riesgo por punto temporal, figura KM con tabla de riesgo | “La mediana de tiempo hasta el evento fue de 14 meses (IC 95 % [11, 18]).” |
| Log-rank | χ², grados de libertad, valor p | “Las curvas difirieron significativamente entre grupos, χ²(1) = 8.34, p = .004.” |
| Regresión de Cox | HR con IC 95 %, χ² global del modelo o −2LL, verificación del supuesto PH | “El grupo intervención mostró un riesgo reducido (HR = 0.61, IC 95 % [0.42, 0.89], p = .010).” |
| Supuesto PH | Resultado de cox.zph() global y por covariable | “El supuesto de riesgos proporcionales no fue violado (χ² global = 3.21, p = .202).” |
Informa siempre el tamaño muestral total, el número de eventos observados (no solo el N) y el tiempo máximo de seguimiento. La guía de análisis de datos en el TFG describe el marco de reporte para otras técnicas cuantitativas complementarias.
Errores comunes
- Ignorar la censura o eliminar los sujetos censurados. La censura es información, no ruido. Excluir estos sujetos sesga la estimación hacia tiempos de supervivencia más cortos (sobreestima el riesgo).
- Usar regresión logística cuando el tiempo importa. Si el tiempo de seguimiento varía entre sujetos, la logística produce estimadores sesgados porque asigna el mismo peso a un evento a los 2 meses que a los 24 meses. El análisis de supervivencia es la técnica correcta.
- No verificar el supuesto de riesgos proporcionales. Un modelo de Cox con covariables que violan la proporcionalidad produce HR espurios. Ejecutar siempre
cox.zph()y revisar el gráfico log(−log S). - Sobreajustar el modelo de Cox. Incluir más covariables de las que los datos soportan (regla EPV: mínimo 10 eventos por variable) produce intervalos de confianza desorbitados e inestabilidad numérica.
- Confundir hazard ratio con riesgo relativo. El HR compara tasas instantáneas, no riesgos acumulados. Interpretar el HR como si fuera un riesgo relativo de todo el periodo es un error conceptual frecuente en las secciones de resultados.
- Presentar la curva KM sin tabla de número en riesgo. Cuando la muestra se reduce (por eventos o censuras), la curva es menos fiable. La tabla de riesgo informa al lector cuántos sujetos sustentan cada tramo de la estimación.
- No indicar el método de comparación múltiple en log-rank por pares. Comparar más de dos grupos sin corregir el nivel de significación (Bonferroni, Holm) infla el error de tipo I. Para un contexto de pruebas múltiples, véase también el enfoque de análisis de mediación y moderación con PROCESS, donde la corrección del error acumulado es igualmente crítica.
Aplicaciones por disciplina
El análisis de supervivencia ha trascendido la medicina para convertirse en una herramienta metodológica transversal:
| Disciplina | Variable de tiempo | Evento de interés |
|---|---|---|
| Oncología / Medicina | Meses desde diagnóstico | Muerte, recaída, progresión tumoral |
| Epidemiología | Semanas desde exposición | Desarrollo de la enfermedad |
| Enfermería / Salud pública | Días desde ingreso hospitalario | Alta, reingreso, complicación postoperatoria |
| Psicología clínica | Semanas desde inicio del tratamiento | Recaída, remisión clínica |
| Educación | Semestres de matrícula | Abandono universitario, titulación |
| Criminología | Meses desde la puesta en libertad | Reincidencia delictiva |
| Economía / Empresariales | Años desde la constitución | Disolución empresarial, concurso de acreedores |
La revisión metodológica más citada sobre los fundamentos del análisis de supervivencia se encuentra en la serie de artículos publicados en Critical Care (Machin et al., PMC), y la documentación oficial de SPSS para Kaplan-Meier está disponible en la página de IBM SPSS Statistics.
Preguntas frecuentes
¿Puedo usar el análisis de supervivencia sin seguimiento longitudinal?
No en sentido estricto. El análisis de supervivencia requiere una variable de tiempo (duración hasta el evento) y el conocimiento de qué observaciones son censuradas. Si solo dispones de una medición transversal de evento/no-evento sin información temporal diferencial, la regresión logística es más apropiada. El análisis de supervivencia exige que cada sujeto tenga un tiempo de inicio y un tiempo de fin (evento o censura).
¿Cuántas covariables puedo incluir en el modelo de Cox?
La regla empírica más extendida es disponer de al menos 10 eventos por cada covariable incluida en el modelo (EPV, events per variable). Con 80 eventos puedes incluir como máximo 8 predictores de forma razonablemente estable. Por debajo de ese umbral los intervalos de confianza se amplían sustancialmente y los estimadores de HR pueden ser poco fiables.
¿Qué hago si el supuesto de riesgos proporcionales se viola?
Existen varias estrategias: (1) estratificar el modelo de Cox por la covariable problemática [strata() en R], lo que permite una función de riesgo basal distinta por estrato sin estimar un HR para esa variable; (2) incluir una interacción entre la covariable y el tiempo; (3) usar modelos paramétricos de supervivencia (Weibull, log-normal) si la forma distribucional es adecuada; (4) modelos de tiempo de fallo acelerado (AFT) como alternativa semiparamétrica.
¿El log-rank funciona con más de dos grupos?
Sí. La prueba log-rank generalizada compara K grupos simultáneamente con una chi-cuadrado de K−1 grados de libertad. Cuando el resultado global es significativo, se realizan comparaciones por pares con corrección de Bonferroni o Holm para controlar el error de tipo I. En SPSS se activa mediante «Comparar factor » → «Todas las combinaciones por pares». En R se usa pairwise.survdiff() del paquete survminer.
¿Qué diferencia hay entre el hazard ratio y el odds ratio?
El odds ratio (OR) de la regresión logística compara la probabilidad de que el evento ocurra (binaria, sin dimensión temporal). El hazard ratio (HR) de Cox compara la tasa instantánea de ocurrencia a lo largo del tiempo. Cuando el seguimiento es homogéneo y el evento es raro, tienden a ser similares. Cuando el evento es frecuente o el seguimiento varía entre sujetos, pueden divergir de forma notable, y el HR es el estimador más apropiado.
¿Es posible aplicar el análisis de supervivencia de forma gratuita?
Sí. R con los paquetes survival y survminer ofrece todas las funcionalidades (Kaplan-Meier, log-rank, Cox, diagnósticos del supuesto PH) de forma completamente gratuita, con mayor flexibilidad y calidad gráfica que SPSS. SPSS requiere licencia, aunque muchas universidades españolas y latinoamericanas la proporcionan mediante acuerdos de campus con IBM.
Escribe tu TFG o tesis con IA
Pasa de la teoría a tu documento terminado
Tesify estructura, redacta y formatea tu TFG, TFM o tesis en normas APA y Vancouver, con bibliografía automática y verificación antiplagio integrada. Regístrate gratis, sin tarjeta.

Leave a Reply