Diseño de Experimentos (DOE): Una Guía Práctica

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
La mayoría de los equipos prueban cambios de proceso de la misma manera: ajustan una cosa, observan qué pasa, luego ajustan otra cosa. Es lento, pasa por alto las interacciones entre factores y a menudo lleva a conclusiones que no se sostienen en cuanto se cambia cualquier otra cosa. El diseño de experimentos ofrece un camino más rápido y más riguroso.
El diseño de experimentos (DOE) es un método estructurado para planificar pruebas de modo que pueda entender qué insumos impulsan sus resultados y en qué medida. Cambia varios factores simultáneamente de forma controlada, y luego usa análisis estadístico para separar la señal del ruido. Es la diferencia entre la optimización informada y el ensayo y error costoso.
¿Qué es el diseño de experimentos?
El diseño de experimentos (DOE) es una rama de la estadística aplicada que le indica exactamente cómo configurar y ejecutar una serie de pruebas para identificar de manera eficiente las relaciones de causa y efecto entre los insumos del proceso (factores) y los resultados (respuestas).
Un factor es cualquier variable que controla durante el experimento, como la temperatura, el tamaño del lote o el texto del mensaje. Cada factor se prueba en niveles definidos (por ejemplo, 180 °C vs 200 °C, o asunto de correo corto vs largo). La variable de respuesta es lo que mide: rendimiento, tasa de defectos, tasa de conversión. Al variar múltiples factores a la vez en una estructura planificada, el DOE captura no solo los efectos principales sino también las interacciones, donde el efecto de un factor depende del nivel de otro. Esa información de interacción es exactamente lo que se pierde con las pruebas de un factor a la vez.
Datos Clave
- Los practicantes de Six Sigma que usan DOE reportan reducciones de tiempo de ciclo de entre 40 y 70 por ciento en comparación con la experimentación no estructurada, según la American Society for Quality (ASQ, 2022).
- Un estudio publicado en el Journal of Quality Technology encontró que los experimentos diseñados identificaron rutinariamente variables críticas del proceso en 3 a 5 corridas, donde las pruebas de un factor a la vez requerían 15 o más (JQT, 2020).
- La encuesta de clientes de 2023 de Minitab encontró que el 68 por ciento de las organizaciones de manufactura que usan herramientas estadísticas de DOE alcanzaron su objetivo de mejora más rápido que con enfoques de prueba informales (Minitab, 2023).
DOE vs un factor a la vez (OFAT)
El enfoque tradicional de prueba es OFAT: mantener todo constante, cambiar un factor, observar el resultado, repetir. Es intuitivo y puede funcionar para sistemas muy simples. Pero falla rápidamente en cuanto existen interacciones o cuando importa el número de corridas.
| Dimensión | DOE | OFAT |
|---|---|---|
| Detección de interacciones | Sí: encuentra efectos A x B por diseño | No: las interacciones permanecen ocultas |
| Corridas totales necesarias | Menos: los diseños fraccionales pueden cubrir muchos factores en 8 a 16 corridas | Más: cada factor requiere su propia secuencia de pruebas |
| Eficiencia de costos | Alta: la información por corrida se maximiza | Baja: muchas corridas producen información redundante |
| Confianza en los resultados | Estadística: el error se cuantifica vía ANOVA | Informal: sin estimación de varianza |
| Cuándo usarlo | Múltiples factores, interacciones sospechadas, presupuesto limitado de corridas | Un solo factor, sistema bien entendido, verificación rápida |
Si está optimizando un proceso con tres o más factores y le importa si la temperatura afecta el rendimiento de forma distinta a diferentes presiones, OFAT lo va a engañar. El DOE no lo hará.
Conceptos clave en el diseño de experimentos
Entender estos términos evita los errores de configuración más comunes.
| Término | Qué significa |
|---|---|
| Factor | Una variable de entrada controlada, probada en dos o más niveles |
| Nivel | Un ajuste específico de un factor (bajo/alto, encendido/apagado, 50 mg/100 mg) |
| Variable de respuesta | El resultado que se mide para juzgar si el experimento funcionó |
| Interacción | Cuando el efecto del Factor A sobre la respuesta depende del nivel del Factor B |
| Bloqueo | Agrupar corridas por una variable perturbadora (turno, operador, lote) para evitar que infle el error |
| Aleatorización | Ejecutar las pruebas experimentales en orden aleatorio para evitar sesgos sistemáticos por tendencias temporales desconocidas |
| Replicación | Ejecutar la misma combinación de tratamiento más de una vez para estimar el error experimental puro |
| Confusión (confounding) | Cuando dos efectos son indistinguibles entre sí, generalmente en diseños fraccionales |
| Punto central | Una corrida en el punto medio de todos los rangos de factores, usada para detectar curvatura en la respuesta |
La aleatorización y el bloqueo no son detalles opcionales. Sin aleatorización, un horno que se calienta o un operador que se fatiga pueden parecer un efecto de factor real. Sin bloqueo, no se puede separar la mejora verdadera del ruido de turno a turno.
Tipos comunes de diseños experimentales
| Diseño | Mejor para | Contrapartida |
|---|---|---|
| Factorial completo | 2 a 4 factores, se necesitan todas las interacciones | El número de corridas se duplica con cada factor agregado (2^k) |
| Factorial fraccional | 4 a 8 factores, presupuesto limitado | Algunas interacciones de orden superior quedan confundidas |
| Plackett-Burman | Cribado rápido de 8 a 20 factores | Solo estima efectos principales, sin información de interacción |
| Superficie de respuesta (CCD/Box-Behnken) | Optimización después del cribado, respuesta curva | Requiere tres niveles por factor, más corridas |
| Taguchi | Robustez frente al ruido en manufactura | Confunde algunas interacciones por diseño, menos flexible |
Un proyecto típico ejecuta primero un Plackett-Burman para descartar factores inactivos, luego un factorial fraccional sobre los sobrevivientes, y luego un diseño de superficie de respuesta si se necesita precisar un óptimo. Cada paso reduce la incertidumbre y enfoca los recursos.
Cómo ejecutar un estudio de diseño de experimentos
Paso 1: Definir el objetivo y la variable de respuesta
Empiece con un enunciado del problema preciso. "Mejorar el rendimiento" es demasiado vago. "Aumentar el rendimiento de primera pasada en la Línea 3 del 87% al 93% sin aumentar el tiempo de ciclo" es comprobable. Identifique la variable de respuesta que va a medir y confirme que puede medirla de forma repetible. Un mal acuerdo del sistema de medición (vea control estadístico de procesos y capacidad del proceso) va a corromper cualquier experimento.
Paso 2: Elegir factores y niveles
Enumere cada variable que plausiblemente podría afectar la respuesta. Cribe la lista con su equipo usando datos previos, un diagrama de espina de pescado o un FMEA. Redúzcala a los 4 a 8 candidatos más probables. Para cada uno, establezca un nivel bajo y uno alto lo suficientemente amplios para detectar un efecto pero lo suficientemente realistas para ser seguros y operables. Si no está seguro del rango, ejecute primero un experimento de acotación de rango.
Paso 3: Seleccionar un diseño
Haga coincidir el diseño con su situación.
- 2 a 3 factores con presupuesto para todas las combinaciones: factorial completo (4 a 8 corridas mínimo con replicación).
- 4 a 7 factores, se necesita información de interacción: factorial fraccional de Resolución IV o V.
- 8 o más factores para cribado inicial: Plackett-Burman.
- Optimizar un conjunto confirmado de 2 a 3 factores: diseño de superficie de respuesta.
Use software (Minitab, JMP, o el paquete gratuito FrF2 de R) para generar la matriz de diseño. No cree los órdenes de corrida a mano.
Paso 4: Ejecutar el experimento y aleatorizar
Ejecute las corridas en el orden generado aleatoriamente que provee el software. La aleatorización no es negociable: protege contra tendencias temporales, desgaste de equipos y efectos de aprendizaje del operador que de otro modo se harían pasar por efectos de factor. Mantenga todas las variables ajenas al estudio en sus valores operativos estándar. Registre todo: condiciones ambientales, operador, estado del equipo, números de lote.
Paso 5: Analizar los resultados
Ingrese los datos de respuesta en su software y ejecute un análisis de varianza (ANOVA) o regresión. Observe:
- Gráficos de efectos principales: qué factores desplazan la respuesta promedio.
- Gráficos de interacción: si el efecto de un factor invierte dirección en distintos niveles de otro.
- Gráficos de residuos: si se cumplen los supuestos del modelo (normalidad, varianza constante).
- Pareto de efectos: qué efectos superan el umbral de significancia.
Un efecto estadísticamente significativo tiene un valor p por debajo de su umbral (generalmente 0.05) y un tamaño práctico que vale la pena atender. Ambas cosas importan. Un efecto minúsculo puede ser estadísticamente significativo con conteos altos de corridas pero operativamente irrelevante.
Paso 6: Confirmar e iterar
Ejecute un experimento de confirmación en los ajustes óptimos predichos. El resultado de confirmación debe caer dentro del intervalo de predicción del modelo. Si no lo hace, algo se pasó por alto: un factor no medido, un rango demasiado estrecho, o una variable de ruido que se coló. Este paso es donde la mayoría de los equipos abandonan pronto y luego se arrepienten. Una vez confirmado, codifique los nuevos ajustes en sus procedimientos operativos estándar y actualice la línea base del gráfico de control.
Ejemplos de diseño de experimentos
| Industria/Función | Qué se estudió | Factores probados | Resultado |
|---|---|---|---|
| Manufactura farmacéutica | Tasa de disolución de tabletas | Fuerza de compresión, concentración de aglutinante, tiempo de granulación | Identificó 2 factores responsables del 91% de la variación, redujo los lotes fuera de especificación en un 60% |
| Marketing por correo electrónico | Tasa de clics | Longitud del asunto, hora de envío, personalización, texto del CTA | El factorial fraccional 2^4 aisló la interacción asunto + CTA como el impulsor dominante |
| Agricultura | Rendimiento de cultivo | Tipo de fertilizante, frecuencia de riego, espaciado entre hileras | El diseño de superficie de respuesta encontró el óptimo para tres factores simultáneamente en 15 parcelas |
| Rendimiento de software | Latencia de respuesta de API | Tamaño de caché, profundidad del pool de conexiones, tiempo de espera de consulta | Plackett-Burman cribó 7 parámetros; 2 dominaron, se ajustaron para reducir la latencia p95 en un 34% |
| Procesamiento de alimentos | Puntaje de textura de snack | Tiempo de horneado, temperatura del horno, contenido de humedad | El factorial completo 2^3 más puntos centrales confirmó curvatura; la superficie de respuesta encontró el óptimo |
La misma lógica aplica ya sea que esté mezclando compuestos, escribiendo texto publicitario o ajustando una base de datos. Si los insumos varían y no está seguro de cuáles importan, el DOE responde la pregunta más rápido que la intuición.
Mejores prácticas y errores comunes
Hacer:
- Aleatorizar el orden de las corridas siempre, incluso cuando sea incómodo.
- Replicar al menos el punto central para obtener una estimación de error puro.
- Validar su sistema de medición antes de empezar (Gauge R&R si es necesario).
- Confirmar los resultados en los ajustes óptimos antes de cambiar la producción.
- Documentar los rangos de factores, las definiciones de respuesta y los registros de corridas para que el experimento se pueda reproducir.
No hacer:
- Agregar factores a mitad del experimento. Agregar un factor después de haber empezado invalida la estructura del diseño.
- Usar demasiados factores con una resolución inadecuada. Ejecutar un diseño de Resolución III cuando sabe que existen interacciones le dará resultados confundidos y engañosos.
- Confundir la significancia estadística con la importancia práctica. Siempre revise el tamaño del efecto.
- Saltarse la corrida de confirmación. El modelo es una abstracción matemática; el proceso es real.
- Intentar calcular a mano los diseños de DOE. El software genera órdenes de corrida válidos y aleatorizados con los patrones de confusión correctos. No improvise.
El DOE encaja de forma natural en la fase de Mejora de DMAIC, donde reemplaza las conjeturas por una elección de ajustes óptimos respaldada estadísticamente. También es común en proyectos de Lean Six Sigma y en cualquier iniciativa de Six Sigma donde el análisis de causa raíz ya haya reducido la lista de sospechosos a un puñado de factores que vale la pena probar formalmente.
Preguntas frecuentes
¿El diseño de experimentos es lo mismo que las pruebas A/B?
Las pruebas A/B son un caso específico y simplificado de DOE: un factor en dos niveles con asignación aleatoria. El DOE generaliza esa lógica a múltiples factores probados simultáneamente, con un manejo explícito de interacciones y bloqueo. Si ejecuta una prueba multivariante adecuada en una campaña de correo electrónico, está haciendo DOE. Si prueba una cosa a la vez, está haciendo OFAT con asignación aleatoria, lo cual es mejor que el OFAT puro pero aún así se pierde las interacciones.
¿Cuántas corridas necesito?
Para un factorial completo de 2 niveles, el mínimo es 2^k corridas (k = número de factores): 8 para 3 factores, 16 para 4, y así sucesivamente. La replicación duplica el conteo. Los diseños fraccionales reducen esto significativamente: un diseño de Resolución V para 5 factores necesita 16 corridas. Los diseños de cribado para 8 factores pueden hacerse en 12. El número correcto depende de cuántas interacciones necesite resolver y cuánto error puro necesite estimar. Deje que el software lo calcule a partir de su elección de diseño.
¿Qué software necesito?
Minitab y JMP son los estándares de la industria. Ambos generan diseños, aleatorizan órdenes de corrida, realizan ANOVA y regresión, y producen los gráficos de efectos estándar. Los paquetes FrF2 y rsm de R hacen lo mismo sin costo. Excel puede manejar factoriales completos simples de 2 factores, pero se vuelve propenso a errores para cualquier cosa más grande. Si su equipo ya está usando capacitación en DMAIC o belts de Six Sigma, casi con seguridad ya tiene licencia de Minitab.
¿Cuándo no debería usar DOE?
Cuando solo tiene un factor plausible para probar, una prueba A/B simple es más rápida. Cuando no puede controlar los niveles de los factores con precisión (por ejemplo, no puede mantener realmente constante la humedad ambiental), la validez del experimento se rompe. Y cuando el tiempo o costo por corrida es extremadamente alto y el FMEA ya apunta fuertemente a un solo factor, una prueba confirmatoria de un solo factor puede ser más pragmática que un experimento diseñado completo.
¿Se puede usar DOE en industrias de servicios, no solo en manufactura?
Sí. Cualquier proceso con insumos y resultados medibles puede estudiarse con DOE: manejo de llamadas de servicio al cliente (tiempo de espera, longitud del guion, política de devolución de llamadas), despliegue de software (combinaciones de feature flags, porcentajes de lanzamiento), campañas de marketing y configuraciones de cadena de suministro. La matemática no distingue si la respuesta es rendimiento de un producto o Net Promoter Score.
Lecturas relacionadas

Senior Operations & Growth Strategist
On this page
- ¿Qué es el diseño de experimentos?
- DOE vs un factor a la vez (OFAT)
- Conceptos clave en el diseño de experimentos
- Tipos comunes de diseños experimentales
- Cómo ejecutar un estudio de diseño de experimentos
- Paso 1: Definir el objetivo y la variable de respuesta
- Paso 2: Elegir factores y niveles
- Paso 3: Seleccionar un diseño
- Paso 4: Ejecutar el experimento y aleatorizar
- Paso 5: Analizar los resultados
- Paso 6: Confirmar e iterar
- Ejemplos de diseño de experimentos
- Mejores prácticas y errores comunes
- Preguntas frecuentes
- Lecturas relacionadas