,

¿Poisson, binomial negativa o exceso de ceros? Qué modelo usar cuando tu variable dependiente es un recuento (comparativa 2026)

¿Poisson, binomial negativa o exceso de ceros? Qué modelo usar cuando tu variable dependiente es un recuento (comparativa 2026)

Tu variable dependiente es un número de veces: errores cometidos, visitas al centro de salud, faltas de asistencia, incidencias registradas, reingresos hospitalarios, delitos por distrito. No es una puntuación ni una escala: es un recuento. Y meterlo en una regresión lineal produce un modelo que puede predecir «menos dos accidentes».

Existen cuatro familias de modelos para este caso y la mayoría de los TFG ni siquiera saben que hay que elegir. Esta comparativa las pone una al lado de otra, da el criterio de decisión y termina con la recomendación.

La tabla, primero

Modelo Cuándo corresponde Qué añade Dificultad
Poisson Recuentos cuya varianza es aproximadamente igual a su media Es el punto de partida obligado y el más fácil de defender Baja
Binomial negativa Recuentos con sobredispersión: la varianza supera claramente a la media Un parámetro de dispersión extra que corrige los errores estándar Baja-media
Inflado de ceros (ZIP / ZINB) Hay muchos más ceros de los que el modelo predice, y esos ceros vienen de dos procesos distintos Modela por separado «quién puede tener el evento» y «cuántos tiene» Media-alta
De barrera (hurdle) Muchos ceros, pero todos del mismo tipo: primero se cruza un umbral y luego se cuenta Dos partes independientes: cero frente a no cero, y el recuento positivo Media-alta

Recomendación corta: empieza siempre por Poisson, comprueba la sobredispersión, pasa a binomial negativa si la hay, y solo plantéate un modelo con exceso de ceros si además tienes una razón sustantiva —no solo estadística— para creer que los ceros se generan de dos maneras distintas.

Por qué la regresión lineal no vale aquí

Histograma de una variable de recuento con una barra inicial muy alta que indica exceso de ceros
Un recuento típico: asimétrico, discreto y con una montaña de ceros a la izquierda.

Una variable de recuento tiene tres propiedades que rompen los supuestos de la regresión lineal múltiple: solo toma valores enteros no negativos, su distribución es asimétrica hacia la derecha, y su varianza crece con su media en lugar de mantenerse constante. Ajustar una recta produce residuos con patrón, intervalos de confianza mal calibrados y predicciones imposibles.

La solución no es transformar la variable con un logaritmo —que además obliga a inventar qué hacer con los ceros—, sino usar un modelo lineal generalizado con la distribución adecuada y un enlace logarítmico. Ese es el marco común de las cuatro opciones de la tabla.

Paso 1: ajusta el Poisson y mide la sobredispersión

Comparación visual entre datos equidispersos y datos sobredispersos alrededor de la misma media
Misma media, dispersión muy distinta. El modelo de Poisson solo es válido en el caso de la izquierda.

El modelo de Poisson descansa sobre un supuesto fuerte: la media y la varianza de la variable son iguales (equidispersión). En datos reales eso rara vez se cumple, porque casi siempre hay heterogeneidad no observada entre unidades.

Cómo comprobarlo, en orden de rigor:

  1. Compara media y varianza de la dependiente. Si la varianza es varias veces la media, ya tienes una señal.
  2. Mira el estadístico de bondad de ajuste dividido entre sus grados de libertad en la salida del modelo. Un valor claramente superior a 1 indica sobredispersión; uno claramente inferior, subdispersión.
  3. Aplica un contraste formal de sobredispersión, disponible en los paquetes estadísticos habituales.

Si hay sobredispersión y la ignoras, los coeficientes siguen siendo razonables pero los errores estándar salen demasiado pequeños, y acabas declarando significativo lo que no lo es. Es el error más caro de esta familia de modelos, precisamente porque no se nota en la tabla de resultados.

Paso 2: binomial negativa, la opción por defecto en la práctica

La binomial negativa añade un parámetro de dispersión que absorbe esa variabilidad extra. Los coeficientes se interpretan igual que en Poisson y los errores estándar quedan bien calibrados.

Para elegir entre ambos: si el parámetro de dispersión estimado es significativamente distinto de cero, o si el AIC y el BIC de la binomial negativa son claramente menores, quédate con la binomial negativa. En muchos conjuntos de datos sociales y sanitarios reales, esta es la respuesta.

Paso 3: ¿de verdad tienes exceso de ceros?

Muchos ceros no significan automáticamente «modelo inflado de ceros». La pregunta correcta es si tu modelo predice menos ceros de los que observas. Compara la proporción de ceros observada con la que el modelo espera; si observas un 55 % y el modelo predice un 30 %, tienes un problema real.

Y entonces viene la pregunta que decide entre las dos opciones restantes, que es conceptual, no estadística:

  • Inflado de ceros si crees que hay dos poblaciones: unas unidades que nunca podrían tener el evento (ceros estructurales) y otras que podrían tenerlo pero esta vez marcaron cero. Ejemplo: número de cigarrillos al día en una muestra donde hay no fumadores.
  • De barrera si crees que todos podrían tener el evento pero hay un umbral que cruzar, y una vez cruzado el proceso que determina la cantidad es otro. Ejemplo: número de visitas al especialista, donde lo difícil es conseguir la primera derivación.

Elige según tu teoría y escríbelo así en la metodología. Un tribunal valora mucho más «elegí el modelo de barrera porque la primera consulta y las siguientes responden a decisiones distintas» que «lo elegí porque tenía mejor AIC».

Un aviso metodológico honesto: en la literatura se usa con frecuencia un contraste específico para comparar un modelo inflado de ceros con su versión estándar, pero su validez para este caso concreto está discutida. Lo más defendible hoy es apoyar la decisión en tres patas: el argumento sustantivo, la comparación de AIC y BIC, y la comparación gráfica entre ceros observados y ceros predichos.

El detalle que casi nadie declara: el offset

Árbol de decisión que ramifica entre los distintos modelos disponibles para variables de recuento
Cuatro modelos, dos preguntas: ¿hay sobredispersión? y ¿de dónde vienen los ceros?

Si tus unidades no se han observado durante el mismo tiempo, o no tienen el mismo tamaño, los recuentos brutos no son comparables. Diez incidencias en un centro de 900 alumnos no es lo mismo que diez en uno de 90. Diez averías en seis meses no es lo mismo que diez en dos años.

La solución correcta no es dividir la variable dependiente y perder su naturaleza de recuento. Es incluir un offset: el logaritmo de la exposición —población, tiempo, superficie, número de oportunidades— entra en el modelo con su coeficiente fijado en 1. Con eso, el modelo deja de estimar cuentas y pasa a estimar tasas, que es lo que realmente querías.

Es una línea de código o una casilla del cuadro de diálogo, y es la diferencia entre un modelo interpretable y uno que confunde tamaño con efecto. Declárala explícitamente en la metodología.

Cómo se interpretan los resultados

Como el enlace es logarítmico, el exponencial del coeficiente es una razón de tasas de incidencia: cuántas veces se multiplica el recuento esperado por cada unidad de aumento del predictor, manteniendo el resto constante. Un valor de 1,30 significa un 30 % más de eventos esperados; uno de 0,80, un 20 % menos.

La lógica es prima hermana de la del odds ratio en la regresión logística, pero no es lo mismo y no debe llamarse igual: aquí se comparan tasas, no probabilidades relativas. Si tu variable dependiente fuera ordinal en lugar de un recuento, el modelo sería otro y lo cubre la guía sobre regresión logística ordinal.

En la tabla de resultados, incluye por predictor el coeficiente, el error estándar, el contraste con su valor p, el exponencial del coeficiente y su intervalo de confianza al 95 %. Y en el texto, el estadístico de dispersión, el criterio con el que elegiste el modelo y la variable usada como offset.

Con qué programa

Poisson y binomial negativa se ajustan sin dificultad desde el módulo de modelos lineales generalizados de SPSS, eligiendo la distribución y el enlace logarítmico, y con la casilla de offset disponible en el propio cuadro de diálogo. En R son glm() con familia Poisson y la función de binomial negativa del paquete MASS.

Los modelos inflados de ceros y de barrera, en cambio, no están en el módulo estándar de SPSS: se ajustan en R —con las funciones correspondientes del paquete pscl— o en Stata. Si tu plan pasa por ahí, cuéntalo con tu tutor antes, porque cambia la herramienta que vas a necesitar; la comparativa de programas para analizar datos en la tesis ayuda a decidir.

Cuándo tu variable no es realmente un recuento

Tres casos que se confunden a menudo:

  • Proporciones con denominador conocido —«12 aciertos de 20»— no son recuentos libres: el modelo natural es binomial, no Poisson.
  • Tiempo hasta que ocurre un evento no es un recuento aunque se mida en días: eso es análisis de supervivencia.
  • Recuentos anidados —alumnos dentro de aulas, pacientes dentro de hospitales— exigen además una estructura jerárquica, como explican los modelos multinivel. Se puede combinar: un modelo de Poisson multinivel es perfectamente posible, pero es un TFM ambicioso, no un TFG de última hora.

Si aún estás situando tu variable dependiente en el mapa general, el árbol de decisión para elegir la prueba estadística es el punto de partida.

Cuatro errores frecuentes

  1. Quedarse en Poisson sin comprobar la dispersión. Es el fallo silencioso: la tabla parece impecable y los valores p están inflados.
  2. Elegir un modelo inflado de ceros solo porque hay muchos ceros. Sin dos procesos distintos detrás, la binomial negativa suele bastar y es mucho más fácil de defender.
  3. Olvidar el offset cuando las unidades difieren en tamaño o en tiempo de observación.
  4. Interpretar el exponencial del coeficiente como un odds ratio. Es una razón de tasas: se habla de eventos esperados, no de probabilidades.

Un ejemplo de campo donde esto se aplica

El caso más limpio es el de los datos de criminalidad: número de delitos por distrito, con poblaciones muy distintas y una fuerte concentración territorial. La guía sobre análisis de datos del delito en el TFG de Criminología muestra las fuentes oficiales disponibles; sobre esos datos, la combinación correcta suele ser binomial negativa con la población del distrito como offset. La misma lógica funciona en Enfermería con reingresos por servicio, en Educación con faltas por aula y en Ingeniería con averías por unidad instalada. Y si tu trabajo es econométrico, la estructura general del modelo se plantea igual que en cualquier TFG de Económicas con modelo econométrico.

Pasa de la teoría a tu documento terminado

Elegir el modelo es media hora; justificarlo por escrito, comparar dos ajustes en una tabla y redactar la interpretación en párrafos que un tribunal siga sin esfuerzo es lo que se atasca. Tesify convierte la salida de tu programa en texto analítico, mantiene el formato APA 7 y te ayuda a escribir la justificación metodológica del modelo elegido.

Empieza tu TFG con Tesify

Preguntas frecuentes

¿Cuál elijo si tengo poco tiempo?

Ajusta Poisson, comprueba la dispersión y, si hay sobredispersión, quédate con la binomial negativa. Esa secuencia cubre la inmensa mayoría de los TFG y es defendible en cualquier tribunal.

¿Cómo sé si hay sobredispersión?

Compara la media y la varianza de tu variable, mira el estadístico de bondad de ajuste dividido entre sus grados de libertad en la salida del modelo y, si quieres cerrar el argumento, aplica un contraste formal de sobredispersión.

¿Qué pasa si ignoro la sobredispersión?

Los errores estándar salen demasiado pequeños y los intervalos de confianza demasiado estrechos, así que declararás significativos efectos que no lo son. Los coeficientes en sí suelen resistir mejor, pero la inferencia se rompe.

¿Puedo transformar la variable con un logaritmo y hacer una regresión lineal?

Es una práctica antigua y hoy no se recomienda: obliga a inventar un tratamiento para los ceros, cambia la escala de interpretación y no arregla el problema de la varianza. Usa el modelo que corresponde a la distribución.

¿Qué es exactamente un offset?

El logaritmo de la exposición —tiempo, población, superficie, número de oportunidades— incluido en el modelo con su coeficiente fijado en 1. Convierte el modelo de recuentos en un modelo de tasas y es imprescindible cuando las unidades no son comparables entre sí.

¿Cuántos ceros son «demasiados» ceros?

No hay un porcentaje mágico. Lo que importa no es cuántos ceros observas, sino cuántos predice tu modelo: si observas muchos más de los esperados, hay exceso de ceros; si el modelo ya los reproduce, no hace falta complicarlo.

¿Puedo hacer todo esto en SPSS?

Poisson y binomial negativa sí, desde el módulo de modelos lineales generalizados, con el offset incluido en el propio cuadro de diálogo. Los modelos inflados de ceros y de barrera requieren R o Stata.

¿Cómo lo justifico en la metodología?

Con cuatro frases: naturaleza de recuento de la dependiente, inadecuación de la regresión lineal, resultado del diagnóstico de dispersión y modelo finalmente elegido con su criterio. Si usaste offset, una quinta frase diciendo cuál y por qué.

Escribe tu TFG o tesis con IA

Pasa de la teoría a tu documento terminado

Tesify estructura, redacta y formatea tu TFG, TFM o tesis en normas APA y Vancouver, con bibliografía automática y verificación antiplagio integrada. Regístrate gratis, sin tarjeta.

Leave a Reply

Your email address will not be published. Required fields are marked *

Escribe tu TFG o tesis con Tesify — gratis Probar gratis