Curva ROC, Sensibilidad y Especificidad en la Tesis 2026: Guía con Ejemplos

Curva ROC, Sensibilidad y Especificidad en la Tesis 2026: Guía con Ejemplos

La curva ROC, la sensibilidad y la especificidad son herramientas estadísticas para evaluar la capacidad de una prueba diagnóstica o un modelo de clasificación de distinguir entre dos grupos (por ejemplo, enfermo/sano). La sensibilidad mide los verdaderos positivos detectados, la especificidad los verdaderos negativos, y el área bajo la curva ROC (AUC) resume el rendimiento global de la prueba en un único valor entre 0,5 y 1.

Si tu tesis evalúa una prueba diagnóstica, un cuestionario de cribado o un modelo predictivo en salud, psicología o aprendizaje automático, necesitas reportar estos tres indicadores juntos: la curva ROC no tiene sentido interpretativo sin conocer la sensibilidad y la especificidad que representa en cada punto, y viceversa.

Definiciones: sensibilidad, especificidad y curva ROC

La sensibilidad es la proporción de casos verdaderamente positivos que la prueba identifica correctamente como positivos. La especificidad es la proporción de casos verdaderamente negativos que la prueba identifica correctamente como negativos. La curva ROC (Receiver Operating Characteristic) representa gráficamente la sensibilidad (eje Y) frente a 1 menos la especificidad (eje X) para todos los posibles puntos de corte de una variable de prueba continua o de probabilidad predicha.

El origen de esta metodología se remonta al análisis de señales en radar durante la Segunda Guerra Mundial, y se adoptó después en medicina diagnóstica para evaluar pruebas de cribado y, más recientemente, en aprendizaje automático para evaluar clasificadores binarios. Su ventaja principal frente a reportar un único par sensibilidad/especificidad es que resume el rendimiento de la prueba en todo el rango posible de puntos de corte, no solo en uno elegido de antemano.

Matriz de confusión con verdaderos y falsos positivos y negativos
Matriz de confusión: verdaderos y falsos positivos y negativos

La matriz de confusión y los cuatro resultados posibles

Condición presente (real) Condición ausente (real)
Prueba positiva Verdadero positivo (VP) Falso positivo (FP)
Prueba negativa Falso negativo (FN) Verdadero negativo (VN)

A partir de esta matriz de confusión se calculan los indicadores clave:

  • Sensibilidad = VP / (VP + FN)
  • Especificidad = VN / (VN + FP)
  • Valor predictivo positivo (VPP) = VP / (VP + FP)
  • Valor predictivo negativo (VPN) = VN / (VN + FN)

Es importante no confundir sensibilidad/especificidad con VPP/VPN: las primeras dos son propiedades intrínsecas de la prueba, mientras que el VPP y el VPN dependen también de la prevalencia de la condición en la población estudiada. Este matiz es especialmente relevante cuando se aplica una prueba diagnóstica a poblaciones con prevalencia muy distinta a la de la muestra original con la que se validó.

Qué es el AUC y cómo interpretarlo

Rango de AUC Interpretación habitual
0,50 Sin capacidad discriminativa (equivalente al azar)
0,51 – 0,70 Discriminación baja
0,71 – 0,80 Discriminación aceptable
0,81 – 0,90 Discriminación buena
0,91 – 1,00 Discriminación excelente

Estos rangos son orientativos y varían según el área de aplicación; conviene siempre reportar el AUC junto con su intervalo de confianza del 95%, no solo el valor puntual, y contrastarlo frente a la línea de referencia de 0,5 (rendimiento equivalente al azar). Un AUC con un intervalo de confianza que incluye 0,5 indica que no se puede afirmar con seguridad que la prueba discrimine mejor que el azar.

El punto de corte óptimo y el índice de Youden

Cuando la variable de prueba es continua (una puntuación, una probabilidad predicha por un modelo), hay que elegir un punto de corte para clasificar los casos como positivos o negativos. El criterio más citado es el índice de Youden (J = sensibilidad + especificidad − 1), que identifica el punto de corte que maximiza conjuntamente ambos indicadores. Sin embargo, en contextos clínicos donde el coste de un falso negativo es mucho mayor que el de un falso positivo (por ejemplo, cribado de una enfermedad grave), puede justificarse elegir un punto de corte que priorice la sensibilidad sobre la especificidad, y viceversa en contextos donde los falsos positivos son especialmente costosos.

Comparación del área bajo la curva ROC de varios modelos diagnósticos
Comparación del área bajo la curva ROC (AUC) entre varios modelos diagnósticos

Cómo calcular la curva ROC en SPSS y R

En SPSS, el procedimiento se encuentra en Analizar > Clasificar > Curva COR (ROC). Necesitas indicar la variable de estado (la variable binaria que indica el grupo real, codificada habitualmente como 0/1) y la variable de prueba (la puntuación continua o probabilidad predicha). Marcando la opción de tabla de coordenadas, SPSS devuelve la sensibilidad y 1-especificidad para cada posible punto de corte, lo que permite aplicar el índice de Youden manualmente o revisar visualmente el “codo” de la curva.

En R, el paquete pROC es uno de los más utilizados en tesis y publicaciones científicas para calcular la curva ROC, el AUC con su intervalo de confianza y el punto de corte óptimo mediante la función coords() con el criterio de Youden. También es habitual usar ggplot2 para representar gráficamente la curva con una calidad adecuada para publicación.

Ejemplo aplicado en un contexto de tesis

El siguiente ejemplo es ilustrativo y no procede de un estudio empírico publicado; sirve únicamente para mostrar cómo se estructura el análisis. Supongamos una tesis que evalúa si una escala de cribado psicológico predice correctamente un diagnóstico clínico confirmado por entrevista estructurada. El investigador calcula la curva ROC de la puntuación total de la escala frente al diagnóstico (positivo/negativo), obtiene un AUC con su intervalo de confianza del 95%, identifica el punto de corte óptimo según el índice de Youden, y reporta la sensibilidad y especificidad correspondientes a ese punto de corte concreto, no solo el AUC global. Este es el nivel de detalle que un tribunal espera encontrar en el apartado de resultados.

Cómo comparar dos curvas ROC

Si tu tesis compara el rendimiento de dos pruebas o dos modelos predictivos, no basta con observar qué AUC es numéricamente mayor: hay que aplicar una prueba estadística formal, como la prueba de DeLong, disponible en el paquete pROC de R, para determinar si la diferencia entre los dos AUC es estadísticamente significativa. Reportar dos AUC sin esta comparación formal es uno de los motivos más frecuentes por los que un tribunal pide revisar el apartado de resultados.

Errores comunes al reportar estos indicadores

  • Reportar sensibilidad y especificidad sin especificar el punto de corte concreto al que corresponden.
  • Confundir sensibilidad y especificidad con valor predictivo positivo y negativo.
  • Omitir el intervalo de confianza del AUC, presentando solo el valor puntual.
  • Elegir el punto de corte de forma arbitraria, sin justificar el criterio (Youden, prioridad clínica, u otro) empleado.
  • Comparar el AUC de dos modelos sin usar una prueba estadística formal (como la prueba de DeLong) para valorar si la diferencia es significativa.

Documentar con claridad estas decisiones metodológicas en el apartado de resultados fortalece la validez interna del análisis y facilita que el tribunal siga el razonamiento estadístico sin ambigüedades.

Preguntas frecuentes

¿Qué es la curva ROC?

Es una representación gráfica que muestra la relación entre la sensibilidad (tasa de verdaderos positivos) y 1 menos la especificidad (tasa de falsos positivos) de una prueba diagnóstica o modelo de clasificación, para todos los posibles puntos de corte.

¿Qué diferencia hay entre sensibilidad y especificidad?

La sensibilidad mide la proporción de verdaderos positivos correctamente identificados por la prueba entre quienes realmente tienen la condición; la especificidad mide la proporción de verdaderos negativos correctamente identificados entre quienes no la tienen.

¿Cómo se interpreta el AUC de una curva ROC?

El AUC (área bajo la curva) va de 0,5 (capacidad discriminativa nula, equivalente al azar) a 1 (discriminación perfecta). Valores más altos indican que la prueba o el modelo distingue mejor entre los dos grupos comparados.

¿Qué es el índice de Youden y para qué sirve?

El índice de Youden (sensibilidad + especificidad − 1) es un criterio habitual para elegir el punto de corte óptimo de una prueba diagnóstica, seleccionando el valor que maximiza conjuntamente sensibilidad y especificidad.

¿Cómo calculo la curva ROC en SPSS?

En SPSS se accede desde Analizar, Clasificar, Curva COR (ROC), indicando la variable de estado (variable de resultado binaria) y la variable de prueba (puntuación continua o probabilidad predicha), y marcando la opción de mostrar la tabla de coordenadas para identificar el punto de corte.

¿Qué errores comunes se cometen al reportar sensibilidad y especificidad?

Confundir sensibilidad con valor predictivo positivo, no reportar el intervalo de confianza del AUC, y elegir el punto de corte sin justificar el criterio clínico o metodológico utilizado son los errores más frecuentes en tesis y TFG.

Si tu tesis combina la evaluación diagnóstica con técnicas de agrupación de perfiles, puede interesarte también el análisis de conglomerados (clúster) en SPSS. Para contrastar diferencias entre grupos definidos por el punto de corte, revisa cómo aplicar la prueba chi-cuadrado, cómo elegir entre correlación de Pearson y Spearman según la naturaleza de tus variables, y si necesitas evaluar la fiabilidad de mediciones repetidas antes de construir tu modelo, consulta el coeficiente de correlación intraclase (ICC).

Escribe tu TFG o tesis con IA

Pasa de la teoría a tu documento terminado

Tesify estructura, redacta y formatea tu TFG, TFM o tesis en normas APA y Vancouver, con bibliografía automática y verificación antiplagio integrada. Regístrate gratis, sin tarjeta.

Leave a Reply

Your email address will not be published. Required fields are marked *

Escribe tu TFG o tesis con Tesify — gratis Probar gratis