Una variable dummy convierte una categoría en un indicador de 0 y 1 para poder incluirla en una regresión. Con k categorías se crean siempre k − 1 variables: la categoría omitida actúa como referencia y cada coeficiente se interpreta como la diferencia respecto a ella. Crear las k rompe el modelo.
Por qué no puedes meter la variable tal cual
Es el error de partida. Si tu variable «titulación» está codificada como 1 = Derecho, 2 = Psicología, 3 = Ingeniería y la metes directamente en la regresión, el modelo interpretará esos números como una escala: asumirá que Ingeniería vale el triple que Derecho y que la distancia entre Derecho y Psicología es la misma que entre Psicología e Ingeniería.
El coeficiente resultante no significa nada, pero el programa lo calculará sin protestar. Por eso toda variable nominal —y la mayoría de las ordinales con pocas categorías— necesita convertirse en dummies antes de entrar en un modelo.
Cómo se construyen: ejemplo completo
Con cuatro categorías de titulación se crean tres dummies, tomando Derecho como referencia:
| Titulación | D_Psicología | D_Ingeniería | D_Enfermería |
|---|---|---|---|
| Derecho (referencia) | 0 | 0 | 0 |
| Psicología | 1 | 0 | 0 |
| Ingeniería | 0 | 1 | 0 |
| Enfermería | 0 | 0 | 1 |
La fila de la referencia es todo ceros, y de ahí viene la regla: la categoría omitida no desaparece del modelo, está contenida en la constante. No hace falta una cuarta dummy porque «no ser ninguna de las tres» ya identifica a Derecho de forma inequívoca.
Si creas las cuatro, las columnas suman exactamente 1 en todas las filas, lo que reproduce la constante y genera colinealidad perfecta. Es la llamada trampa de las variables ficticias: el modelo no puede estimarse, y los programas responden eliminando una categoría por su cuenta o devolviendo un error.

Cómo elegir la categoría de referencia
La elección no cambia el ajuste global del modelo —R² y F son idénticos— pero sí cambia qué comparaciones lees directamente. Tres criterios, por orden de utilidad:
- La categoría teóricamente relevante. Si comparas tres metodologías docentes frente a la clase magistral tradicional, la referencia es la tradicional.
- La categoría más numerosa. Produce errores típicos más pequeños en las comparaciones y coeficientes más estables.
- La categoría más interpretable. «Sin experiencia previa» funciona mejor como punto de partida que «más de diez años de experiencia».
Lo que no vale es elegir la referencia después de ver cuál hace que los coeficientes salgan significativos. Decídelo antes y explícalo en el trabajo.
Cómo se interpretan los coeficientes
Cada coeficiente es la diferencia media en la variable dependiente entre esa categoría y la referencia, manteniendo constante el resto de predictores. Con un ejemplo:
- Constante = 6,80. Nota media esperada en Derecho, la referencia, con las demás variables en cero.
- D_Psicología = 0,42 (p = 0,031). Psicología obtiene 0,42 puntos más que Derecho, y la diferencia es significativa.
- D_Ingeniería = −0,31 (p = 0,088). Ingeniería obtiene 0,31 puntos menos que Derecho, sin llegar a la significación.
Aquí está el punto que más se malinterpreta: estos contrastes son solo frente a la referencia. Que Psicología difiera de Derecho y que Ingeniería no lo haga no te dice si Psicología difiere de Ingeniería. Para esa comparación necesitas cambiar la referencia y reestimar, o pedir contrastes por pares.
Y si vas a mirar todas las comparaciones posibles, entras en el terreno de las comparaciones múltiples: con cuatro categorías son seis contrastes, y ahí el ajuste del nivel de significación deja de ser opcional.

Dos casos especiales
Variables ordinales. Si las categorías tienen un orden real y espaciado razonablemente uniforme —por ejemplo, nivel de estudios—, puedes tratarlas como numéricas y ahorrar coeficientes. Si el espaciado no es uniforme o quieres detectar saltos no lineales, dummies. La solución elegante: prueba las dos y compara el ajuste.
Interacciones con dummies. Multiplicar una dummy por una variable continua permite comprobar si el efecto de esa continua difiere entre categorías. Es potente y tiene un efecto colateral conocido: el término producto correlaciona por construcción con sus componentes, lo que infla los diagnósticos de colinealidad. Centrar la variable continua en su media antes de multiplicar reduce ese problema sin alterar la interpretación de la interacción.
Cómo hacerlo en el software
- SPSS: Transformar → Recodificar en distintas variables, una por dummy. En regresión logística existe el botón «Categórica» que las genera automáticamente y permite elegir la referencia, pero en regresión lineal hay que crearlas a mano.
- jamovi: declara la variable como nominal y el módulo de regresión lineal crea las dummies solo, con la referencia configurable.
- R: basta con que la variable sea un factor; la función
lm()genera el contraste por defecto y la referencia se cambia conrelevel().
Qué escribir en el TFG
«La variable titulación, de cuatro categorías, se incorporó al modelo mediante tres variables ficticias tomando Derecho como categoría de referencia por ser la más numerosa (n = 82). Los coeficientes representan la diferencia media respecto a dicha categoría, manteniendo constantes el resto de predictores.»
Dos frases que evitan la mitad de las preguntas del tribunal: cuántas dummies, cuál es la referencia y por qué. Después conviene comprobar que la codificación no ha introducido problemas de colinealidad revisando los diagnósticos del modelo, y verificar los supuestos habituales antes de interpretar nada, empezando por la normalidad de los residuos.
Si tu diseño acaba comparando grupos en lugar de modelar una continua, el terreno natural es el ANOVA factorial, que hace lo mismo por otra vía; y si necesitas ajustar por una covariable continua, el ANCOVA. Cuando lo que falta es tiempo para redactar el apartado con esta precisión, Tesify te ayuda a estructurarlo y mantener el formato coherente mientras tú decides la codificación.
Preguntas frecuentes
¿Cuántas variables dummy necesito?
Siempre una menos que el número de categorías. Con cuatro categorías se crean tres variables ficticias, y la categoría omitida actúa como referencia quedando representada en la constante del modelo.
¿Qué pasa si creo una dummy por categoría?
Se produce colinealidad perfecta, conocida como trampa de las variables ficticias, porque la suma de todas las dummies reproduce exactamente la constante. El modelo no puede estimarse y el programa eliminará una categoría automáticamente o devolverá un error.
¿Cómo elijo la categoría de referencia?
Por criterio teórico cuando existe un grupo de comparación natural, por tamaño cuando se busca precisión en las estimaciones, o por interpretabilidad. La elección no altera el ajuste global del modelo, solo qué comparaciones se leen de forma directa.
¿Puedo comparar dos categorías que no son la referencia?
No directamente a partir de los coeficientes, que solo contrastan cada categoría frente a la referencia. Hay que cambiar la categoría de referencia y reestimar el modelo, o solicitar contrastes por pares, ajustando entonces por comparaciones múltiples.
¿Las variables ordinales necesitan dummies?
No siempre. Si el orden es real y el espaciado entre categorías es razonablemente uniforme, pueden tratarse como numéricas y se ahorran coeficientes. Si el espaciado es irregular o interesa detectar saltos no lineales, es preferible usar variables ficticias.
Escribe tu TFG o tesis con IA
Pasa de la teoría a tu documento terminado
Tesify estructura, redacta y formatea tu TFG, TFM o tesis en normas APA y Vancouver, con bibliografía automática y verificación antiplagio integrada. Regístrate gratis, sin tarjeta.

Leave a Reply