,

TFG de Ingeniería Biomédica 2026: señales, imágenes y bases de datos abiertas para validar tu método

TFG de Ingeniería Biomédica 2026: señales, imágenes y bases de datos abiertas para validar tu método

El TFG de Ingeniería Biomédica tiene un obstáculo que sus compañeros de Informática o Telecomunicaciones no tienen: los datos son clínicos. Y conseguir datos clínicos significa comité de ética, permiso de gerencia, meses de espera y una probabilidad razonable de que la respuesta llegue después de la fecha de entrega.

Muchos estudiantes concluyen de ahí que su trabajo tiene que ser una simulación o una revisión. Es una conclusión equivocada. Existe un ecosistema amplio de repositorios biomédicos abiertos —señales fisiológicas, imagen médica, registros de cuidados intensivos— con datos reales, anonimizados, anotados por clínicos y descargables. Con ellos se hace un TFG serio, con validación cuantitativa y comparable con la literatura.

Este artículo cubre las tres cosas que hacen falta: dónde están los datos, cómo se valida un método sin engañarse, y qué capa normativa hay que nombrar para que el trabajo parezca de ingeniería biomédica y no de ciencia de datos genérica.

Trazado de una señal fisiológica con marcas de anotación sobre los eventos de interés
Lo que hace utilizable a una base de datos biomédica no es la señal: son las anotaciones.

Los repositorios que puedes usar mañana

Conviene distinguir tres niveles de acceso, porque determinan si el dato entra en tu calendario:

  • Acceso abierto. Descarga inmediata, sin registro o con un registro trivial. Es donde debe estar el núcleo de tu TFG.
  • Acceso acreditado. Exige completar un curso de formación en protección de datos de investigación y firmar un acuerdo de uso. El trámite es de días o semanas, no de meses, y es perfectamente asumible en un TFM.
  • Acceso por solicitud a un consorcio. Formulario de proyecto, revisión por un comité. Aquí ya hablamos de meses; solo tiene sentido si empiezas muy pronto.
Ámbito Qué se encuentra Acceso típico
Señales fisiológicas Electrocardiograma de superficie y ambulatorio, electroencefalograma, polisomnografía, presión arterial, señales de UCI, marcha y acelerometría Mayoritariamente abierto
Registros clínicos de cuidados críticos Constantes, analíticas, medicación, notas y desenlaces de decenas de miles de ingresos Acreditado
Radiografía de tórax Cientos de miles de radiografías etiquetadas con hallazgos extraídos de los informes Abierto o acreditado según el conjunto
Imagen oncológica Tomografía computarizada y resonancia con segmentaciones y datos clínicos asociados Abierto
Neuroimagen Resonancia estructural y funcional en formato estandarizado, y cohortes de envejecimiento y demencia Abierto o por solicitud
Dermatología Imagen dermatoscópica con diagnóstico histológico Abierto
Retos de segmentación Conjuntos con verdad de referencia y una métrica y un ranking públicos Abierto con registro

Los conjuntos clásicos de electrocardiograma merecen mención aparte porque son, con diferencia, el punto de entrada más fácil a un TFG de Biomédica: hay bases históricas de registros ambulatorios con anotación latido a latido revisada por cardiólogos, y bases modernas con decenas de miles de electrocardiogramas clínicos de doce derivaciones etiquetados por diagnóstico. Entre ambas cubres tanto un problema de detección de eventos como uno de clasificación.

Dos consejos de selección que ahorran semanas:

  1. Elige el conjunto por sus anotaciones, no por su tamaño. Un millón de señales sin verdad de referencia no sirve para validar nada. Lo que hace investigable una base de datos es que alguien la haya etiquetado bien.
  2. Comprueba que existe literatura previa sobre ese conjunto. Es lo que te permite comparar tus resultados con los de otros, que es media discusión escrita. Un dataset sin trabajos publicados te deja sin referencia.

Antes de tocar el modelo: el preprocesado que hay que documentar

En señales biomédicas el preprocesado no es un detalle: cambia los resultados. Y es la parte que los TFG describen peor.

  • Frecuencia de muestreo y remuestreo. Si mezclas registros adquiridos a frecuencias distintas hay que unificarlos, y la decisión afecta a todo lo que venga después.
  • Filtrado. Eliminación de la deriva de línea base, filtro de banda apropiado a la señal y filtro de rechazo de banda para la interferencia de la red eléctrica, que en Europa está a 50 Hz y no a 60. Documenta el tipo de filtro, el orden y las frecuencias de corte.
  • Segmentación. Cómo trocean las ventanas, con qué solapamiento y respecto a qué evento se alinean.
  • Rechazo de artefactos. Qué criterio usaste para descartar tramos y cuántos descartaste. Este número va en la memoria.
  • Normalización. Y aquí una trampa: si normalizas usando estadísticos calculados sobre todo el conjunto, incluidos los datos de prueba, ya has filtrado información. Los parámetros de normalización se estiman solo con los datos de entrenamiento.

El error que invalida la mitad de estos trabajos

Separar los datos por paciente evita la fuga de información entre entrenamiento y prueba
Arriba, segmentos del mismo paciente a ambos lados. Abajo, la partición correcta.

Se llama fuga de información y en el contexto biomédico tiene una forma muy concreta: partir los datos por segmento en lugar de por paciente.

El razonamiento inocente es este. Tienes 100 registros de media hora, los trocheas en ventanas de diez segundos, obtienes 180 000 ventanas y las repartes al azar 80/20 entre entrenamiento y prueba. Parece impecable, y tu clasificador da un 99 % de exactitud.

No lo es. Ventanas del mismo paciente han caído a ambos lados de la partición, y el modelo no ha aprendido a detectar la patología: ha aprendido a reconocer al paciente, que es una tarea mucho más fácil porque cada persona tiene una morfología de señal característica. En cuanto llegue un sujeto nuevo, el rendimiento se desploma.

La regla es innegociable: la partición se hace por sujeto. Todos los datos de un paciente van íntegros a entrenamiento, a validación o a prueba, nunca repartidos. Lo mismo vale para la validación cruzada, que debe ser por grupos de sujeto. Y si además ajustas hiperparámetros, necesitas una validación cruzada anidada, o el conjunto de prueba se contamina por la puerta de atrás.

Declara en la memoria cuántos pacientes hay en cada partición, no solo cuántas ventanas. Es la primera cifra que busca un revisor con experiencia.

Qué métricas reportar (y por qué la exactitud no basta)

Cuando una clase es muy minoritaria, la exactitud global deja de ser informativa
Si el evento ocurre en el 1 % de los casos, un clasificador que nunca lo detecta acierta el 99 %.

Los problemas biomédicos son casi siempre desbalanceados: el latido anómalo, la lesión, el evento adverso son minoritarios por definición. En ese escenario la exactitud global es una métrica engañosa, porque un modelo que predice siempre «normal» la maximiza sin detectar absolutamente nada.

Lo que se reporta es esto:

  • Sensibilidad y especificidad, siempre las dos, porque el compromiso entre ambas es la decisión clínica de fondo. La relación entre ellas y el umbral elegido está desarrollada en la guía de curva ROC, sensibilidad y especificidad.
  • Valor predictivo positivo, que depende de la prevalencia y es lo que de verdad le importa a quien recibe la alarma.
  • Área bajo la curva ROC y, cuando la clase positiva es muy rara, también el área bajo la curva de precisión-exhaustividad, que es más informativa en ese régimen.
  • La matriz de confusión completa, no solo los resúmenes. Ocupa cuatro celdas y permite recalcular cualquier métrica.
  • Intervalos de confianza de las métricas principales, obtenidos por remuestreo. Una sensibilidad puntual sin intervalo, en un conjunto de prueba de 30 pacientes, dice poco.

Y una recomendación de encaje disciplinar: cuando tu tarea tiene un estándar de evaluación propio del campo —clases de latido normalizadas, criterios de tolerancia temporal para considerar acertada una detección—, úsalo. Es lo que hace tus números comparables con la literatura en lugar de ser una métrica particular tuya.

Reproducibilidad: la parte barata que casi nadie hace

Un TFG computacional que no se puede reproducir tiene un problema de fondo, y arreglarlo cuesta una tarde:

  • Semilla aleatoria fija y declarada.
  • Fichero de entorno con las versiones exactas de las librerías.
  • Código en un repositorio público, con la licencia puesta y un identificador persistente que puedas citar. Cómo se cita correctamente está en la guía de citar software y código fuente, y la mecánica de repositorio y automatización, en la de proyecto de Ingeniería Informática con integración continua.
  • Un script que, partiendo del dataset descargado, reproduzca las tablas de la memoria de principio a fin.

La capa que convierte el trabajo en biomédico

Un clasificador de señales sin contexto clínico ni regulatorio es un TFG de aprendizaje automático con datos médicos. Lo que lo hace de Ingeniería Biomédica son tres párrafos que casi nadie escribe:

Uno: el encuadre como producto sanitario. El software con finalidad diagnóstica o terapéutica es un producto sanitario en la normativa europea, con una clasificación de riesgo y unos requisitos que van mucho más allá del rendimiento del modelo. Añade que los sistemas de inteligencia artificial en contexto sanitario están además sujetos al reglamento europeo de IA, de aplicación escalonada. No tienes que certificar nada en un TFG, pero sí debes situar tu prototipo: qué sería, qué clase de riesgo tendría y qué le faltaría para llegar a un uso real.

Dos: las normas técnicas del ciclo de vida. Existen normas específicas para el desarrollo de software sanitario, para la gestión de riesgos de productos sanitarios y para la seguridad de equipos electromédicos. Nombrar la que aplique a tu caso y explicar en qué te habría afectado demuestra que entiendes el terreno.

Tres: la parte ética y de datos. Trabajar con datos públicos anonimizados no te exime de nada: hay un acuerdo de uso que has aceptado, con obligaciones sobre reidentificación y redistribución, y hay que declararlo. Los criterios de fondo están en la guía de anonimización de datos. Si en algún momento tu trabajo pasa a datos de pacientes de un centro real, el circuito cambia por completo y está descrito en la guía de cómo pedir acceso a datos clínicos y en la de ética de la investigación con sujetos humanos.

Cierra con la utilidad clínica: contra qué se compara tu método en la práctica actual, qué recogen las guías de práctica clínica sobre ese problema y qué haría falta para que un profesional se fiara. Eso es la discusión.

Un calendario realista

Para un TFG de un cuatrimestre, un reparto que funciona: dos semanas para elegir el conjunto de datos y leer los trabajos previos sobre él, dos para el preprocesado y la partición por sujeto —que es donde se decide la validez de todo—, cuatro para el método y los experimentos, dos para la validación final y las métricas, y el resto para escribir. Reservar el conjunto de prueba y no tocarlo hasta esa fase de validación es una decisión metodológica, no una preferencia.

Preguntas frecuentes

¿Necesito comité de ética si uso datos públicos?

Normalmente no, porque los datos ya están anonimizados y su publicación fue aprobada en origen. Lo que sí hay es un acuerdo de uso que aceptas al descargar y que debes cumplir y citar. Consulta de todos modos la normativa de tu centro, porque algunas escuelas piden un informe favorable para cualquier trabajo con datos de salud.

¿Puedo hacer un TFG de Biomédica sin programar?

Puedes, orientándolo a instrumentación, biomecánica, diseño de dispositivos o gestión de tecnología sanitaria. Pero si el trabajo va de señales o de imagen, programar es el trabajo.

¿MATLAB o Python?

Ambos son estándar en el sector y la licencia universitaria de MATLAB suele estar disponible. Python tiene hoy más ecosistema en aprendizaje automático y más código publicado que puedes tomar como referencia. Elige uno y sé coherente; declara la versión.

¿Cuántos pacientes necesito para que el resultado valga algo?

No hay un número mágico, pero el conjunto de prueba debe tener suficientes sujetos de la clase minoritaria como para que el intervalo de confianza de la sensibilidad no sea absurdo. Con cinco casos positivos, cualquier cifra que reportes es ruido.

¿Puedo comparar mi método con los resultados publicados de otro autor?

Solo si usas el mismo conjunto, la misma partición y la misma métrica. Comparar tu sensibilidad con la de un artículo que usó otra base de datos u otro criterio de acierto no es una comparación: es una coincidencia numérica.

¿Sirve un modelo preentrenado para imagen natural en imagen médica?

Sí, el ajuste fino de modelos preentrenados funciona razonablemente bien y es una estrategia habitual con conjuntos pequeños. Hay que declararlo con claridad y discutir la diferencia de dominio entre las imágenes de origen y las médicas.

¿Y si mis resultados son peores que los publicados?

Se reportan igual y se discute por qué: partición más exigente, menos datos, ausencia de un preprocesado que el otro trabajo sí hacía. Un TFG que replica honestamente y obtiene menos rendimiento del esperado, y lo explica, vale más que uno con cifras espectaculares y una fuga de información sin detectar.

De los resultados a la memoria

Tener las métricas no es tener el trabajo. Hay que justificar la elección del conjunto de datos, describir el preprocesado con detalle reproducible, montar las tablas comparativas, discutir frente a la literatura previa y encuadrar el prototipo en su contexto clínico y regulatorio. Tesify trabaja sobre tus propios resultados —no inventa métricas ni pacientes— y te ayuda a convertirlos en capítulos redactados, con las citas y la bibliografía en el formato que exija tu escuela.

Empieza gratis con Tesify y avanza tu TFG desde hoy. Más de 9.000 estudiantes ya lo usan, y el 100 % del texto sigue siendo tuyo.

Escribe tu TFG o tesis con IA

Pasa de la teoría a tu documento terminado

Tesify estructura, redacta y formatea tu TFG, TFM o tesis en normas APA y Vancouver, con bibliografía automática y verificación antiplagio integrada. Regístrate gratis, sin tarjeta.

Leave a Reply

Your email address will not be published. Required fields are marked *

Escribe tu TFG o tesis con Tesify — gratis Probar gratis