Diseño de Experimentos (DOE): Una Guía Práctica

Matriz de cuadrícula factorial de diseño de experimentos que muestra niveles de factores y corridas experimentales

Turn this article into takeaways for your work.

Each assistant summarizes the article only for you and suggests best practices for your work.

La mayoría de los equipos prueban cambios de proceso de la misma manera: ajustan una cosa, observan qué pasa, luego ajustan otra cosa. Es lento, pasa por alto las interacciones entre factores y a menudo lleva a conclusiones que no se sostienen en cuanto se cambia cualquier otra cosa. El diseño de experimentos ofrece un camino más rápido y más riguroso.

El diseño de experimentos (DOE) es un método estructurado para planificar pruebas de modo que pueda entender qué insumos impulsan sus resultados y en qué medida. Cambia varios factores simultáneamente de forma controlada, y luego usa análisis estadístico para separar la señal del ruido. Es la diferencia entre la optimización informada y el ensayo y error costoso.

¿Qué es el diseño de experimentos?

El diseño de experimentos (DOE) es una rama de la estadística aplicada que le indica exactamente cómo configurar y ejecutar una serie de pruebas para identificar de manera eficiente las relaciones de causa y efecto entre los insumos del proceso (factores) y los resultados (respuestas).

Un factor es cualquier variable que controla durante el experimento, como la temperatura, el tamaño del lote o el texto del mensaje. Cada factor se prueba en niveles definidos (por ejemplo, 180 °C vs 200 °C, o asunto de correo corto vs largo). La variable de respuesta es lo que mide: rendimiento, tasa de defectos, tasa de conversión. Al variar múltiples factores a la vez en una estructura planificada, el DOE captura no solo los efectos principales sino también las interacciones, donde el efecto de un factor depende del nivel de otro. Esa información de interacción es exactamente lo que se pierde con las pruebas de un factor a la vez.

Datos Clave

  • Los practicantes de Six Sigma que usan DOE reportan reducciones de tiempo de ciclo de entre 40 y 70 por ciento en comparación con la experimentación no estructurada, según la American Society for Quality (ASQ, 2022).
  • Un estudio publicado en el Journal of Quality Technology encontró que los experimentos diseñados identificaron rutinariamente variables críticas del proceso en 3 a 5 corridas, donde las pruebas de un factor a la vez requerían 15 o más (JQT, 2020).
  • La encuesta de clientes de 2023 de Minitab encontró que el 68 por ciento de las organizaciones de manufactura que usan herramientas estadísticas de DOE alcanzaron su objetivo de mejora más rápido que con enfoques de prueba informales (Minitab, 2023).

DOE vs un factor a la vez (OFAT)

El enfoque tradicional de prueba es OFAT: mantener todo constante, cambiar un factor, observar el resultado, repetir. Es intuitivo y puede funcionar para sistemas muy simples. Pero falla rápidamente en cuanto existen interacciones o cuando importa el número de corridas.

Dimensión DOE OFAT
Detección de interacciones Sí: encuentra efectos A x B por diseño No: las interacciones permanecen ocultas
Corridas totales necesarias Menos: los diseños fraccionales pueden cubrir muchos factores en 8 a 16 corridas Más: cada factor requiere su propia secuencia de pruebas
Eficiencia de costos Alta: la información por corrida se maximiza Baja: muchas corridas producen información redundante
Confianza en los resultados Estadística: el error se cuantifica vía ANOVA Informal: sin estimación de varianza
Cuándo usarlo Múltiples factores, interacciones sospechadas, presupuesto limitado de corridas Un solo factor, sistema bien entendido, verificación rápida

Si está optimizando un proceso con tres o más factores y le importa si la temperatura afecta el rendimiento de forma distinta a diferentes presiones, OFAT lo va a engañar. El DOE no lo hará.

Conceptos clave en el diseño de experimentos

Entender estos términos evita los errores de configuración más comunes.

Término Qué significa
Factor Una variable de entrada controlada, probada en dos o más niveles
Nivel Un ajuste específico de un factor (bajo/alto, encendido/apagado, 50 mg/100 mg)
Variable de respuesta El resultado que se mide para juzgar si el experimento funcionó
Interacción Cuando el efecto del Factor A sobre la respuesta depende del nivel del Factor B
Bloqueo Agrupar corridas por una variable perturbadora (turno, operador, lote) para evitar que infle el error
Aleatorización Ejecutar las pruebas experimentales en orden aleatorio para evitar sesgos sistemáticos por tendencias temporales desconocidas
Replicación Ejecutar la misma combinación de tratamiento más de una vez para estimar el error experimental puro
Confusión (confounding) Cuando dos efectos son indistinguibles entre sí, generalmente en diseños fraccionales
Punto central Una corrida en el punto medio de todos los rangos de factores, usada para detectar curvatura en la respuesta

La aleatorización y el bloqueo no son detalles opcionales. Sin aleatorización, un horno que se calienta o un operador que se fatiga pueden parecer un efecto de factor real. Sin bloqueo, no se puede separar la mejora verdadera del ruido de turno a turno.

Tipos comunes de diseños experimentales

Diseño Mejor para Contrapartida
Factorial completo 2 a 4 factores, se necesitan todas las interacciones El número de corridas se duplica con cada factor agregado (2^k)
Factorial fraccional 4 a 8 factores, presupuesto limitado Algunas interacciones de orden superior quedan confundidas
Plackett-Burman Cribado rápido de 8 a 20 factores Solo estima efectos principales, sin información de interacción
Superficie de respuesta (CCD/Box-Behnken) Optimización después del cribado, respuesta curva Requiere tres niveles por factor, más corridas
Taguchi Robustez frente al ruido en manufactura Confunde algunas interacciones por diseño, menos flexible

Un proyecto típico ejecuta primero un Plackett-Burman para descartar factores inactivos, luego un factorial fraccional sobre los sobrevivientes, y luego un diseño de superficie de respuesta si se necesita precisar un óptimo. Cada paso reduce la incertidumbre y enfoca los recursos.

Cómo ejecutar un estudio de diseño de experimentos

Paso 1: Definir el objetivo y la variable de respuesta

Empiece con un enunciado del problema preciso. "Mejorar el rendimiento" es demasiado vago. "Aumentar el rendimiento de primera pasada en la Línea 3 del 87% al 93% sin aumentar el tiempo de ciclo" es comprobable. Identifique la variable de respuesta que va a medir y confirme que puede medirla de forma repetible. Un mal acuerdo del sistema de medición (vea control estadístico de procesos y capacidad del proceso) va a corromper cualquier experimento.

Paso 2: Elegir factores y niveles

Enumere cada variable que plausiblemente podría afectar la respuesta. Cribe la lista con su equipo usando datos previos, un diagrama de espina de pescado o un FMEA. Redúzcala a los 4 a 8 candidatos más probables. Para cada uno, establezca un nivel bajo y uno alto lo suficientemente amplios para detectar un efecto pero lo suficientemente realistas para ser seguros y operables. Si no está seguro del rango, ejecute primero un experimento de acotación de rango.

Paso 3: Seleccionar un diseño

Haga coincidir el diseño con su situación.

  • 2 a 3 factores con presupuesto para todas las combinaciones: factorial completo (4 a 8 corridas mínimo con replicación).
  • 4 a 7 factores, se necesita información de interacción: factorial fraccional de Resolución IV o V.
  • 8 o más factores para cribado inicial: Plackett-Burman.
  • Optimizar un conjunto confirmado de 2 a 3 factores: diseño de superficie de respuesta.

Use software (Minitab, JMP, o el paquete gratuito FrF2 de R) para generar la matriz de diseño. No cree los órdenes de corrida a mano.

Paso 4: Ejecutar el experimento y aleatorizar

Ejecute las corridas en el orden generado aleatoriamente que provee el software. La aleatorización no es negociable: protege contra tendencias temporales, desgaste de equipos y efectos de aprendizaje del operador que de otro modo se harían pasar por efectos de factor. Mantenga todas las variables ajenas al estudio en sus valores operativos estándar. Registre todo: condiciones ambientales, operador, estado del equipo, números de lote.

Paso 5: Analizar los resultados

Ingrese los datos de respuesta en su software y ejecute un análisis de varianza (ANOVA) o regresión. Observe:

  • Gráficos de efectos principales: qué factores desplazan la respuesta promedio.
  • Gráficos de interacción: si el efecto de un factor invierte dirección en distintos niveles de otro.
  • Gráficos de residuos: si se cumplen los supuestos del modelo (normalidad, varianza constante).
  • Pareto de efectos: qué efectos superan el umbral de significancia.

Un efecto estadísticamente significativo tiene un valor p por debajo de su umbral (generalmente 0.05) y un tamaño práctico que vale la pena atender. Ambas cosas importan. Un efecto minúsculo puede ser estadísticamente significativo con conteos altos de corridas pero operativamente irrelevante.

Paso 6: Confirmar e iterar

Ejecute un experimento de confirmación en los ajustes óptimos predichos. El resultado de confirmación debe caer dentro del intervalo de predicción del modelo. Si no lo hace, algo se pasó por alto: un factor no medido, un rango demasiado estrecho, o una variable de ruido que se coló. Este paso es donde la mayoría de los equipos abandonan pronto y luego se arrepienten. Una vez confirmado, codifique los nuevos ajustes en sus procedimientos operativos estándar y actualice la línea base del gráfico de control.

Ejemplos de diseño de experimentos

Industria/Función Qué se estudió Factores probados Resultado
Manufactura farmacéutica Tasa de disolución de tabletas Fuerza de compresión, concentración de aglutinante, tiempo de granulación Identificó 2 factores responsables del 91% de la variación, redujo los lotes fuera de especificación en un 60%
Marketing por correo electrónico Tasa de clics Longitud del asunto, hora de envío, personalización, texto del CTA El factorial fraccional 2^4 aisló la interacción asunto + CTA como el impulsor dominante
Agricultura Rendimiento de cultivo Tipo de fertilizante, frecuencia de riego, espaciado entre hileras El diseño de superficie de respuesta encontró el óptimo para tres factores simultáneamente en 15 parcelas
Rendimiento de software Latencia de respuesta de API Tamaño de caché, profundidad del pool de conexiones, tiempo de espera de consulta Plackett-Burman cribó 7 parámetros; 2 dominaron, se ajustaron para reducir la latencia p95 en un 34%
Procesamiento de alimentos Puntaje de textura de snack Tiempo de horneado, temperatura del horno, contenido de humedad El factorial completo 2^3 más puntos centrales confirmó curvatura; la superficie de respuesta encontró el óptimo

La misma lógica aplica ya sea que esté mezclando compuestos, escribiendo texto publicitario o ajustando una base de datos. Si los insumos varían y no está seguro de cuáles importan, el DOE responde la pregunta más rápido que la intuición.

Mejores prácticas y errores comunes

Hacer:

  • Aleatorizar el orden de las corridas siempre, incluso cuando sea incómodo.
  • Replicar al menos el punto central para obtener una estimación de error puro.
  • Validar su sistema de medición antes de empezar (Gauge R&R si es necesario).
  • Confirmar los resultados en los ajustes óptimos antes de cambiar la producción.
  • Documentar los rangos de factores, las definiciones de respuesta y los registros de corridas para que el experimento se pueda reproducir.

No hacer:

  • Agregar factores a mitad del experimento. Agregar un factor después de haber empezado invalida la estructura del diseño.
  • Usar demasiados factores con una resolución inadecuada. Ejecutar un diseño de Resolución III cuando sabe que existen interacciones le dará resultados confundidos y engañosos.
  • Confundir la significancia estadística con la importancia práctica. Siempre revise el tamaño del efecto.
  • Saltarse la corrida de confirmación. El modelo es una abstracción matemática; el proceso es real.
  • Intentar calcular a mano los diseños de DOE. El software genera órdenes de corrida válidos y aleatorizados con los patrones de confusión correctos. No improvise.

El DOE encaja de forma natural en la fase de Mejora de DMAIC, donde reemplaza las conjeturas por una elección de ajustes óptimos respaldada estadísticamente. También es común en proyectos de Lean Six Sigma y en cualquier iniciativa de Six Sigma donde el análisis de causa raíz ya haya reducido la lista de sospechosos a un puñado de factores que vale la pena probar formalmente.

Preguntas frecuentes

¿El diseño de experimentos es lo mismo que las pruebas A/B?

Las pruebas A/B son un caso específico y simplificado de DOE: un factor en dos niveles con asignación aleatoria. El DOE generaliza esa lógica a múltiples factores probados simultáneamente, con un manejo explícito de interacciones y bloqueo. Si ejecuta una prueba multivariante adecuada en una campaña de correo electrónico, está haciendo DOE. Si prueba una cosa a la vez, está haciendo OFAT con asignación aleatoria, lo cual es mejor que el OFAT puro pero aún así se pierde las interacciones.

¿Cuántas corridas necesito?

Para un factorial completo de 2 niveles, el mínimo es 2^k corridas (k = número de factores): 8 para 3 factores, 16 para 4, y así sucesivamente. La replicación duplica el conteo. Los diseños fraccionales reducen esto significativamente: un diseño de Resolución V para 5 factores necesita 16 corridas. Los diseños de cribado para 8 factores pueden hacerse en 12. El número correcto depende de cuántas interacciones necesite resolver y cuánto error puro necesite estimar. Deje que el software lo calcule a partir de su elección de diseño.

¿Qué software necesito?

Minitab y JMP son los estándares de la industria. Ambos generan diseños, aleatorizan órdenes de corrida, realizan ANOVA y regresión, y producen los gráficos de efectos estándar. Los paquetes FrF2 y rsm de R hacen lo mismo sin costo. Excel puede manejar factoriales completos simples de 2 factores, pero se vuelve propenso a errores para cualquier cosa más grande. Si su equipo ya está usando capacitación en DMAIC o belts de Six Sigma, casi con seguridad ya tiene licencia de Minitab.

¿Cuándo no debería usar DOE?

Cuando solo tiene un factor plausible para probar, una prueba A/B simple es más rápida. Cuando no puede controlar los niveles de los factores con precisión (por ejemplo, no puede mantener realmente constante la humedad ambiental), la validez del experimento se rompe. Y cuando el tiempo o costo por corrida es extremadamente alto y el FMEA ya apunta fuertemente a un solo factor, una prueba confirmatoria de un solo factor puede ser más pragmática que un experimento diseñado completo.

¿Se puede usar DOE en industrias de servicios, no solo en manufactura?

Sí. Cualquier proceso con insumos y resultados medibles puede estudiarse con DOE: manejo de llamadas de servicio al cliente (tiempo de espera, longitud del guion, política de devolución de llamadas), despliegue de software (combinaciones de feature flags, porcentajes de lanzamiento), campañas de marketing y configuraciones de cadena de suministro. La matemática no distingue si la respuesta es rendimiento de un producto o Net Promoter Score.

Lecturas relacionadas

About the author

Tara Minh

Tara Minh

Senior Operations & Growth Strategist

Tara Minh is Senior Operations & Growth Strategist at Rework, helping B2B SaaS leaders scale without breaking their teams. With 8+ years in revenue operations and process optimization, Tara turns messy workflows into systems people actually follow. Readers get practical frameworks they can use to cut waste, align teams, and grow on purpose.