CASP, AMSTAR-2, RoB 2 o escala PEDro: qué herramienta usar para evaluar los estudios de tu revisión (comparativa 2026)

La respuesta rápida: si los estudios que evalúas son ensayos aleatorizados, usa RoB 2. Si son ensayos de fisioterapia, la escala PEDro te da además una puntuación comparable. Si tu revisión incluye estudios de diseños variados o eres primer lector, los checklists de CASP son la puerta de entrada más asequible. Y AMSTAR-2 no evalúa estudios primarios: evalúa revisiones sistemáticas completas, incluida la tuya. Confundir ese último punto es el error más repetido en los TFG sanitarios.

La tabla de decisión

Herramienta Qué evalúa Estructura Resultado que produce
CASP Estudios primarios de casi cualquier diseño (ECA, cohortes, casos y controles, cualitativos, diagnósticos, transversales…) y también revisiones Un checklist por diseño, en formato de preguntas guiadas Juicio cualitativo razonado, sin puntuación
RoB 2 Ensayos controlados aleatorizados Cinco dominios de sesgo con preguntas señalizadoras Juicio por dominio y global: riesgo bajo, algunas dudas o riesgo alto
Escala PEDro Ensayos clínicos en fisioterapia y disciplinas afines Once criterios; el primero (criterios de elección) no puntúa Puntuación de 0 a 10
AMSTAR-2 Revisiones sistemáticas de intervenciones (con estudios aleatorizados y no aleatorizados) 16 ítems, con dominios críticos Confianza global: alta, moderada, baja o críticamente baja; sin puntuación numérica

Antes de seguir, una distinción que salva anexos enteros: estas herramientas valoran la calidad o el riesgo de sesgo de estudios ya publicados. No son las listas con las que informas de tu propio trabajo (STROBE, CONSORT, PRISMA, COREQ…). Si dudas de cuál de las dos familias necesitas, revisa primero qué checklist se adjunta al TFG según tu diseño: son dos anexos distintos y el tribunal sabe distinguirlos.

CASP: la puerta de entrada

El Critical Appraisal Skills Programme publica checklists gratuitos y descargables para valorar críticamente estudios de distintos tipos: ensayos aleatorizados, revisiones sistemáticas (con versiones específicas para metaanálisis de ECA y de estudios observacionales), estudios cualitativos, cohortes, casos y controles, estudios diagnósticos, evaluaciones económicas, reglas de predicción clínica y estudios transversales.

Su formato es de preguntas encadenadas —¿la pregunta estaba claramente formulada?, ¿el reclutamiento fue adecuado?, ¿los resultados se aplican a tu contexto?— y esa es su gran virtud para un TFG: te enseña a leer un artículo mientras lo evalúas. No produce una puntuación, y eso no es un defecto; te obliga a justificar el juicio con frases, que es exactamente lo que luego escribes en tu tabla de valoración.

Elige CASP si tu revisión incluye diseños variados, si es tu primera valoración crítica o si tu revisión es cualitativa: su checklist de estudios cualitativos es el más usado en los TFG de esa familia, en combinación con los criterios de rigor de Lincoln y Guba para la parte de credibilidad.

RoB 2: el estándar Cochrane para ensayos aleatorizados

RoB 2 es la herramienta revisada de la colaboración Cochrane para evaluar el riesgo de sesgo en ensayos aleatorizados. Su versión actual data de agosto de 2019, con variantes específicas para ensayos aleatorizados por conglomerados y ensayos cruzados, y su cita canónica es el artículo de Sterne y colaboradores en BMJ (2019;366:l4898).

Funciona por dominios de sesgo —el proceso de aleatorización, las desviaciones de la intervención prevista, los datos de resultado incompletos, la medición del resultado y la selección del resultado notificado—, cada uno con preguntas señalizadoras que desembocan en un juicio: riesgo bajo, algunas dudas o riesgo alto, primero por dominio y después global.

Es más exigente que CASP: las preguntas señalizadoras piden entender el protocolo del ensayo, no solo el artículo. A cambio, es lo que un tribunal con formación metodológica espera ver cuando tu revisión incluye ECA. Si tus estudios incluidos son de intervención pero sin aleatorización, la familia Cochrane tiene una herramienta hermana, ROBINS-I, pensada exactamente para estudios no aleatorizados de intervenciones: no fuerces RoB 2 donde no corresponde.

Escala PEDro: once criterios y una traducción oficial al español

La escala PEDro, mantenida por la Physiotherapy Evidence Database, evalúa ensayos clínicos en fisioterapia con once criterios: elegibilidad, asignación aleatoria, asignación oculta, comparabilidad inicial, cegamientos de participantes, terapeutas y evaluadores, seguimiento adecuado, análisis por intención de tratar, comparación estadística entre grupos y medidas puntuales con variabilidad. El primer criterio afecta a la validez externa y no se utiliza para calcular la puntuación, de modo que el resultado va de 0 a 10.

Dos datos la hacen especialmente cómoda para un TFG español. Primero, la puntuación numérica permite tablas comparables entre estudios y cortes explícitos («se consideraron de calidad aceptable los ensayos con PEDro ≥ 6», con la justificación correspondiente). Segundo, existe una traducción oficial al español desde 2012, realizada por Antonia Gómez-Conesa con el apoyo de la Asociación Española de Fisioterapeutas y la Unidad de Metaanálisis de la Universidad de Murcia, siguiendo un protocolo de traducción y retrotraducción conforme a las recomendaciones internacionales. Puedes valorar con la versión española y citarla sin traducir nada por tu cuenta.

Ojo a la confusión de nombres: PEDro es también la base de datos donde buscas ensayos de fisioterapia —el papel que juega en la estructura del TFG de Fisioterapia—; la escala es el instrumento de valoración. En tu metodología, distingue explícitamente cuándo hablas de una y cuándo de la otra.

AMSTAR-2: para revisiones, no para estudios primarios

Diagrama de decisión para elegir la herramienta de valoración crítica según el diseño del estudio
La herramienta no se elige por preferencia: la decide el diseño de los estudios que estás valorando.

AMSTAR-2 es la revisión del instrumento AMSTAR para valorar críticamente revisiones sistemáticas de intervenciones sanitarias, tanto de estudios aleatorizados como no aleatorizados. Tiene 16 ítems (frente a los 11 del original), categorías de respuesta simplificadas y una decisión de diseño importante: no está pensada para producir una puntuación global. La valoración final es una declaración de confianza en los resultados de la revisión —alta, moderada, baja o críticamente baja— basada en las debilidades encontradas en los dominios críticos.

¿Cuándo la usas en un TFG? En dos escenarios. Si haces una revisión de revisiones (umbrella review), AMSTAR-2 es tu herramienta de valoración de cada revisión incluida. Y aunque tu trabajo sea una revisión de estudios primarios, leerla es un espejo incómodo y útil: sus 16 ítems son la lista de lo que un evaluador experto miraría en tu propia revisión, del protocolo previo a la justificación de exclusiones.

Lo que no debes hacer es aplicar AMSTAR-2 a un ensayo o a un estudio de cohortes: no está diseñada para eso y el anexo resultante no significa nada.

Cómo elegir en tres preguntas

  1. ¿Qué estás valorando? Estudios primarios → CASP, RoB 2 o PEDro según diseño. Revisiones completas → AMSTAR-2.
  2. ¿Qué diseño tienen tus estudios incluidos? ECA → RoB 2 (o PEDro en fisioterapia). Observacionales o mezcla → CASP del diseño correspondiente. Intervenciones sin aleatorizar → ROBINS-I.
  3. ¿Qué formato de resultado necesita tu tabla? Puntuación comparable → PEDro. Juicio por dominios → RoB 2. Valoración razonada sin número → CASP.

Sea cual sea la elección, se declara en la metodología con la versión utilizada, se aplica a todos los estudios incluidos por igual, y sus resultados se presentan en una tabla propia dentro del flujo general de la revisión. Si todavía estás montando esa estructura, sigue el procedimiento PRISMA 2020 paso a paso: la valoración crítica es uno de sus pasos, no un adorno final.

Errores que se repiten en los tribunales

  • Usar AMSTAR-2 sobre estudios primarios o RoB 2 sobre estudios observacionales. La herramienta equivocada invalida el anexo entero.
  • Convertir todo en números sin criterio. Inventarse una puntuación para CASP o sumar dominios de RoB 2 como si fueran puntos contradice el diseño de las herramientas.
  • Valorar solo los estudios que confirman tu hipótesis. La valoración se aplica a todos los incluidos, y sus resultados deben pesar en la síntesis: un hallazgo sostenido por estudios de riesgo alto se discute como tal.
  • No declarar cuántos revisores valoraron. Lo ideal son dos evaluadores independientes; si eres tú solo, dilo y explica cómo resolviste tus dudas (consulta al tutor, releer el protocolo).
  • Copiar el juicio de otra revisión. Si otra revisión ya valoró un estudio que incluyes, puedes contrastar, pero la valoración de tu revisión es tuya.

De la tabla de valoración al capítulo escrito

La valoración crítica genera un material incómodo de redactar: una tabla por herramienta, un párrafo por estudio y una síntesis que conecte calidad con conclusiones sin repetirse.

Abre tu revisión en Tesify y redacta la sección de valoración con tus juicios delante: estructura los párrafos por dominios y deja que la tabla hable. El criterio lo pones tú; el texto deja de atascarse.

Preguntas frecuentes

¿Es obligatorio valorar la calidad de los estudios en un TFG de revisión?

Si tu revisión se presenta como sistemática, sí: la valoración crítica de los estudios incluidos es parte del método, y PRISMA 2020 espera que informes de ella. En una revisión narrativa no es exigible, pero incluirla eleva el trabajo.

¿Puedo usar dos herramientas a la vez?

Sí, cuando tu revisión incluye diseños distintos: RoB 2 para los ensayos y el checklist CASP de cohortes para los observacionales, por ejemplo. Decláralo así en la metodología y presenta los resultados por separado.

¿Qué puntuación PEDro se considera «buena calidad»?

No hay un corte universal: cada revisión declara y justifica el suyo. Lo importante es fijarlo antes de valorar, aplicarlo a todos los ensayos y explicar qué pasa con los estudios que quedan por debajo (¿se excluyen o se discuten aparte?).

¿CASP sirve para estudios cualitativos?

Sí, tiene un checklist específico para estudios cualitativos y es la opción más habitual en TFG que revisan investigación con entrevistas o grupos focales.

¿Dónde descargo cada herramienta?

Siempre de su fuente oficial: los checklists en la web de CASP, RoB 2 y ROBINS-I en el sitio de herramientas de riesgo de sesgo de Cochrane, la escala PEDro en la web de la base de datos PEDro (con su versión en español) y AMSTAR-2 en amstar.ca. Las copias que circulan por blogs y repositorios de apuntes no siempre son la versión vigente.

¿La valoración cambia mis conclusiones?

Debería poder cambiarlas: para eso se hace. Si tras valorar descubres que la evidencia a favor de tu hipótesis viene de estudios con riesgo alto de sesgo, tu discusión tiene que decirlo. Una revisión cuyas conclusiones ignoran su propia tabla de calidad se desmonta con una sola pregunta del tribunal.

Escribe tu TFG o tesis con IA

Pasa de la teoría a tu documento terminado

Tesify estructura, redacta y formatea tu TFG, TFM o tesis en normas APA y Vancouver, con bibliografía automática y verificación antiplagio integrada. Regístrate gratis, sin tarjeta.

Leave a Reply

Your email address will not be published. Required fields are marked *

Escribe tu TFG o tesis con Tesify — gratis Probar gratis