Diseño de Experimentos (DOE): Una Guía Práctica

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
La mayoría de los equipos prueban cambios de proceso de la misma manera: ajustan una cosa, observan qué pasa, luego ajustan otra cosa. Es lento, pasa por alto las interacciones entre factores y a menudo lleva a conclusiones que no se sostienen en cuanto se cambia cualquier otra cosa. El diseño de experimentos ofrece un camino más rápido y más riguroso.
El diseño de experimentos (DOE) es un método estructurado para planificar pruebas de modo que pueda entender qué insumos impulsan sus resultados y en qué medida. Cambia varios factores simultáneamente de forma controlada, y luego usa análisis estadístico para separar la señal del ruido. Es la diferencia entre la optimización informada y el ensayo y error costoso.
¿Qué es el diseño de experimentos?
El diseño de experimentos (DOE) es una rama de la estadística aplicada que le indica exactamente cómo configurar y ejecutar una serie de pruebas para identificar de manera eficiente las relaciones de causa y efecto entre los insumos del proceso (factores) y los resultados (respuestas).
Un factor es cualquier variable que controla durante el experimento, como la temperatura, el tamaño del lote o el texto del mensaje. Cada factor se prueba en niveles definidos (por ejemplo, 180 °C vs 200 °C, o asunto de correo corto vs largo). La variable de respuesta es lo que mide: rendimiento, tasa de defectos, tasa de conversión. Al variar múltiples factores a la vez en una estructura planificada, el DOE captura no solo los efectos principales sino también las interacciones, donde el efecto de un factor depende del nivel de otro. Esa información de interacción es exactamente lo que se pierde con las pruebas de un factor a la vez.
Datos Clave
- Los practicantes de Six Sigma que usan DOE reportan reducciones de tiempo de ciclo de entre 40 y 70 por ciento en comparación con la experimentación no estructurada, según la American Society for Quality (ASQ, 2022).
- Un estudio publicado en el Journal of Quality Technology encontró que los experimentos diseñados identificaron rutinariamente variables críticas del proceso en 3 a 5 corridas, donde las pruebas de un factor a la vez requerían 15 o más (JQT, 2020).
- La encuesta de clientes de 2023 de Minitab encontró que el 68 por ciento de las organizaciones de manufactura que usan herramientas estadísticas de DOE alcanzaron su objetivo de mejora más rápido que con enfoques de prueba informales (Minitab, 2023).
DOE vs un factor a la vez (OFAT)
El enfoque tradicional de prueba es OFAT: mantener todo constante, cambiar un factor, observar el resultado, repetir. Es intuitivo y puede funcionar para sistemas muy simples. Pero falla rápidamente en cuanto existen interacciones o cuando importa el número de corridas.

| Dimensión | DOE | OFAT |
|---|---|---|
| Detección de interacciones | Sí: encuentra efectos A x B por diseño | No: las interacciones permanecen ocultas |
| Corridas totales necesarias | Menos: los diseños fraccionales pueden cubrir muchos factores en 8 a 16 corridas | Más: cada factor requiere su propia secuencia de pruebas |
| Eficiencia de costos | Alta: la información por corrida se maximiza | Baja: muchas corridas producen información redundante |
| Confianza en los resultados | Estadística: el error se cuantifica vía ANOVA | Informal: sin estimación de varianza |
| Cuándo usarlo | Múltiples factores, interacciones sospechadas, presupuesto limitado de corridas | Un solo factor, sistema bien entendido, verificación rápida |
Si está optimizando un proceso con tres o más factores y le importa si la temperatura afecta el rendimiento de forma distinta a diferentes presiones, OFAT lo va a engañar. El DOE no lo hará.
Conceptos clave en el diseño de experimentos
Entender estos términos evita los errores de configuración más comunes.

| Término | Qué significa |
|---|---|
| Factor | Una variable de entrada controlada, probada en dos o más niveles |
| Nivel | Un ajuste específico de un factor (bajo/alto, encendido/apagado, 50 mg/100 mg) |
| Variable de respuesta | El resultado que se mide para juzgar si el experimento funcionó |
| Interacción | Cuando el efecto del Factor A sobre la respuesta depende del nivel del Factor B |
| Bloqueo | Agrupar corridas por una variable perturbadora (turno, operador, lote) para evitar que infle el error |
| Aleatorización | Ejecutar las pruebas experimentales en orden aleatorio para evitar sesgos sistemáticos por tendencias temporales desconocidas |
| Replicación | Ejecutar la misma combinación de tratamiento más de una vez para estimar el error experimental puro |
| Confusión (confounding) | Cuando dos efectos son indistinguibles entre sí, generalmente en diseños fraccionales |
| Punto central | Una corrida en el punto medio de todos los rangos de factores, usada para detectar curvatura en la respuesta |
La aleatorización y el bloqueo no son detalles opcionales. Sin aleatorización, un horno que se calienta o un operador que se fatiga pueden parecer un efecto de factor real. Sin bloqueo, no se puede separar la mejora verdadera del ruido de turno a turno.
Tipos comunes de diseños experimentales
Los diseños factoriales completos y fraccionados, de cribado, de superficie de respuesta y Taguchi intercambian el número de corridas por detalle de interacciones y capacidad de optimización.

| Diseño | Mejor para | Contrapartida |
|---|---|---|
| Factorial completo | 2 a 4 factores, se necesitan todas las interacciones | El número de corridas se duplica con cada factor agregado (2^k) |
| Factorial fraccional | 4 a 8 factores, presupuesto limitado | Algunas interacciones de orden superior quedan confundidas |
| Plackett-Burman | Cribado rápido de 8 a 20 factores | Solo estima efectos principales, sin información de interacción |
| Superficie de respuesta (CCD/Box-Behnken) | Optimización después del cribado, respuesta curva | Requiere tres niveles por factor, más corridas |
| Taguchi | Robustez frente al ruido en manufactura | Confunde algunas interacciones por diseño, menos flexible |
Un proyecto típico ejecuta primero un Plackett-Burman para descartar factores inactivos, luego un factorial fraccional sobre los sobrevivientes, y luego un diseño de superficie de respuesta si se necesita precisar un óptimo. Cada paso reduce la incertidumbre y enfoca los recursos.
Cómo ejecutar un estudio de diseño de experimentos
Defina la respuesta, elija factores y niveles, seleccione y aleatorice el diseño, analice los efectos y luego confirme los ajustes predichos.

Paso 1: Definir el objetivo y la variable de respuesta
Empiece con un enunciado del problema preciso. "Mejorar el rendimiento" es demasiado vago. "Aumentar el rendimiento de primera pasada en la Línea 3 del 87% al 93% sin aumentar el tiempo de ciclo" es comprobable. Identifique la variable de respuesta que va a medir y confirme que puede medirla de forma repetible. Un mal acuerdo del sistema de medición (vea control estadístico de procesos y capacidad del proceso) va a corromper cualquier experimento.
Paso 2: Elegir factores y niveles
Enumere cada variable que plausiblemente podría afectar la respuesta. Cribe la lista con su equipo usando datos previos, un diagrama de espina de pescado o un FMEA. Redúzcala a los 4 a 8 candidatos más probables. Para cada uno, establezca un nivel bajo y uno alto lo suficientemente amplios para detectar un efecto pero lo suficientemente realistas para ser seguros y operables. Si no está seguro del rango, ejecute primero un experimento de acotación de rango.
Paso 3: Seleccionar un diseño
Haga coincidir el diseño con su situación.
- 2 a 3 factores con presupuesto para todas las combinaciones: factorial completo (4 a 8 corridas mínimo con replicación).
- 4 a 7 factores, se necesita información de interacción: factorial fraccional de Resolución IV o V.
- 8 o más factores para cribado inicial: Plackett-Burman.
- Optimizar un conjunto confirmado de 2 a 3 factores: diseño de superficie de respuesta.
Use software (Minitab, JMP, o el paquete gratuito FrF2 de R) para generar la matriz de diseño. No cree los órdenes de corrida a mano.
Paso 4: Ejecutar el experimento y aleatorizar
Ejecute las corridas en el orden generado aleatoriamente que provee el software. La aleatorización no es negociable: protege contra tendencias temporales, desgaste de equipos y efectos de aprendizaje del operador que de otro modo se harían pasar por efectos de factor. Mantenga todas las variables ajenas al estudio en sus valores operativos estándar. Registre todo: condiciones ambientales, operador, estado del equipo, números de lote.
Paso 5: Analizar los resultados
Ingrese los datos de respuesta en su software y ejecute un análisis de varianza (ANOVA) o regresión. Observe:
- Gráficos de efectos principales: qué factores desplazan la respuesta promedio.
- Gráficos de interacción: si el efecto de un factor invierte dirección en distintos niveles de otro.
- Gráficos de residuos: si se cumplen los supuestos del modelo (normalidad, varianza constante).
- Pareto de efectos: qué efectos superan el umbral de significancia.
Un efecto estadísticamente significativo tiene un valor p por debajo de su umbral (generalmente 0.05) y un tamaño práctico que vale la pena atender. Ambas cosas importan. Un efecto minúsculo puede ser estadísticamente significativo con conteos altos de corridas pero operativamente irrelevante.
Paso 6: Confirmar e iterar
Ejecute un experimento de confirmación en los ajustes óptimos predichos. El resultado de confirmación debe caer dentro del intervalo de predicción del modelo. Si no lo hace, algo se pasó por alto: un factor no medido, un rango demasiado estrecho, o una variable de ruido que se coló. Este paso es donde la mayoría de los equipos abandonan pronto y luego se arrepienten. Una vez confirmado, codifique los nuevos ajustes en sus procedimientos operativos estándar y actualice la línea base del gráfico de control.
Ejemplos de diseño de experimentos
| Industria/Función | Qué se estudió | Factores probados | Resultado |
|---|---|---|---|
| Manufactura farmacéutica | Tasa de disolución de tabletas | Fuerza de compresión, concentración de aglutinante, tiempo de granulación | Identificó 2 factores responsables del 91% de la variación, redujo los lotes fuera de especificación en un 60% |
| Marketing por correo electrónico | Tasa de clics | Longitud del asunto, hora de envío, personalización, texto del CTA | El factorial fraccional 2^4 aisló la interacción asunto + CTA como el impulsor dominante |
| Agricultura | Rendimiento de cultivo | Tipo de fertilizante, frecuencia de riego, espaciado entre hileras | El diseño de superficie de respuesta encontró el óptimo para tres factores simultáneamente en 15 parcelas |
| Rendimiento de software | Latencia de respuesta de API | Tamaño de caché, profundidad del pool de conexiones, tiempo de espera de consulta | Plackett-Burman cribó 7 parámetros; 2 dominaron, se ajustaron para reducir la latencia p95 en un 34% |
| Procesamiento de alimentos | Puntaje de textura de snack | Tiempo de horneado, temperatura del horno, contenido de humedad | El factorial completo 2^3 más puntos centrales confirmó curvatura; la superficie de respuesta encontró el óptimo |
La misma lógica aplica ya sea que esté mezclando compuestos, escribiendo texto publicitario o ajustando una base de datos. Si los insumos varían y no está seguro de cuáles importan, el DOE responde la pregunta más rápido que la intuición.
Mejores prácticas y errores comunes
Hacer:
- Aleatorizar el orden de las corridas siempre, incluso cuando sea incómodo.
- Replicar al menos el punto central para obtener una estimación de error puro.
- Validar su sistema de medición antes de empezar (Gauge R&R si es necesario).
- Confirmar los resultados en los ajustes óptimos antes de cambiar la producción.
- Documentar los rangos de factores, las definiciones de respuesta y los registros de corridas para que el experimento se pueda reproducir.
No hacer:
- Agregar factores a mitad del experimento. Agregar un factor después de haber empezado invalida la estructura del diseño.
- Usar demasiados factores con una resolución inadecuada. Ejecutar un diseño de Resolución III cuando sabe que existen interacciones le dará resultados confundidos y engañosos.
- Confundir la significancia estadística con la importancia práctica. Siempre revise el tamaño del efecto.
- Saltarse la corrida de confirmación. El modelo es una abstracción matemática; el proceso es real.
- Intentar calcular a mano los diseños de DOE. El software genera órdenes de corrida válidos y aleatorizados con los patrones de confusión correctos. No improvise.
El DOE encaja de forma natural en la fase de Mejora de DMAIC, donde reemplaza las conjeturas por una elección de ajustes óptimos respaldada estadísticamente. También es común en proyectos de Lean Six Sigma y en cualquier iniciativa de Six Sigma donde el análisis de causa raíz ya haya reducido la lista de sospechosos a un puñado de factores que vale la pena probar formalmente.
Lecturas relacionadas

On this page
- ¿Qué es el diseño de experimentos?
- DOE vs un factor a la vez (OFAT)
- Conceptos clave en el diseño de experimentos
- Tipos comunes de diseños experimentales
- Cómo ejecutar un estudio de diseño de experimentos
- Paso 1: Definir el objetivo y la variable de respuesta
- Paso 2: Elegir factores y niveles
- Paso 3: Seleccionar un diseño
- Paso 4: Ejecutar el experimento y aleatorizar
- Paso 5: Analizar los resultados
- Paso 6: Confirmar e iterar
- Ejemplos de diseño de experimentos
- Mejores prácticas y errores comunes
- Lecturas relacionadas