La teoría del refuerzo de la motivación explicada

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
La mayoría de las teorías de la motivación preguntan qué ocurre dentro de una persona. Maslow pregunta qué necesidad está insatisfecha. Vroom pregunta qué cree alguien sobre el esfuerzo y la recompensa. Adams pregunta si se siente tratado con justicia. La teoría del refuerzo rechaza la pregunta. Dice que no importa lo que piensen: hay que mirar lo que sucede justo después de que actúan, porque eso decide si lo harán de nuevo. Es la teoría más directa del canon de la gestión, y también la que los directivos usan constantemente sin darse cuenta. Cada esquema de bonos, cada recorrido de seguridad, cada «buena detección» en un standup es una decisión de refuerzo, tomada bien o mal.
¿Qué es la teoría del refuerzo?
La teoría del refuerzo sostiene que el comportamiento es función de sus consecuencias. Las acciones seguidas de resultados favorables se repiten. Las acciones seguidas de resultados desfavorables, o de nada en absoluto, se debilitan. La teoría se asocia con B.F. Skinner y su trabajo sobre el condicionamiento operante, en el cual un organismo opera sobre su entorno y el entorno responde, fortaleciendo o debilitando lo que ocurrió antes.
Desciende de la ley del efecto de Edward Thorndike, que surgió de colocar gatos en cajas-puzle en la década de 1890 y cronometrar cuánto tardaban en escapar. Thorndike también añadió una cláusula que la mayoría de los resúmenes omiten: cuanto mayor es la satisfacción o la incomodidad, mayor es el fortalecimiento o el debilitamiento. Una revisión de 2026 en el Journal of the Experimental Analysis of Behavior, escrita por Michael Domjan, rastrea cómo la versión que se enseña se fue desviando, con Science and Human Behavior (1953) de Skinner como punto de giro que reformuló la ley como un comportamiento simplemente grabado por las consecuencias. Los libros de texto heredaron la versión truncada, así que vale la pena dedicar unos minutos al capítulo original de 1911.
La decisión de diseño crítica es lo que la teoría deja fuera: necesidades, creencias, percepciones de justicia, valor esperado. Trata a la persona como una caja negra y trabaja solo con el comportamiento observable y las consecuencias observables. Es deliberado y aporta una claridad real, porque se pueden contar los comportamientos, cambiar las consecuencias y medir si el conteo se movió. También le cuesta todo lo que los demás marcos de la familia de teorías del liderazgo existen para capturar. La jerarquía de necesidades de Maslow y la teoría de las necesidades de McClelland son teorías de contenido que nombran lo que las personas quieren. La teoría de las expectativas de Vroom y la teoría de la equidad de Adams son teorías cognitivas de proceso que modelan el cálculo que las personas hacen antes de decidir intentarlo. La teoría del refuerzo no es ninguna de las dos. Es una teoría de las consecuencias, y la única de este grupo que seguiría funcionando aunque los seres humanos no tuvieran vida interior.
Datos clave: Teoría del refuerzo
- La primera formulación definitiva de Thorndike de la ley del efecto apareció en Animal Intelligence (1911, p. 244): las respuestas «acompañadas o seguidas de cerca por satisfacción para el animal» se conectan con mayor firmeza a la situación que las produjo. Fuente: Classics in the History of Psychology, York University
- Stajkovic y Luthans realizaron un metaanálisis de 72 estudios de gestión conductual en organizaciones reales y encontraron un tamaño del efecto promedio de d = .47, que se reportó como una mejora del 16% en el desempeño de tareas y una probabilidad de éxito del 63%. Fuente: Personnel Psychology, 2003
- En el mismo análisis, el dinero mejoró el desempeño un 23%, el reconocimiento social un 17% y la retroalimentación sobre el desempeño un 10%. Usados juntos, los tres produjeron un efecto sinérgico un 21% mayor que la suma de los efectos individuales. Fuente: Personnel Psychology, 2003
- El metaanálisis de 128 experimentos de Deci, Koestner y Ryan encontró que las recompensas tangibles socavaron de forma significativa la motivación intrínseca de libre elección (contingentes al compromiso d = -0.40, contingentes a la finalización d = -0.36, contingentes al desempeño d = -0.28), mientras que la retroalimentación positiva la reforzó (d = 0.33). Fuente: Psychological Bulletin, 1999
- De los cuatro programas, la razón variable es a la vez el más productivo y el más resistente a la extinción, y por eso las recompensas impredecibles son tan difíciles de desmontar. Fuente: OpenStax, Psychology 2e
Las cuatro consecuencias
La teoría del refuerzo le ofrece exactamente cuatro movimientos. Dos aumentan un comportamiento, dos lo disminuyen. El vocabulario es desafortunado, porque aquí «positivo» y «negativo» significan añadir y quitar, no bueno y malo.
| Consecuencia | Qué ocurre | Efecto | Ejemplo en el trabajo |
|---|---|---|---|
| Refuerzo positivo | Se añade algo deseable | Aumenta | Un ingeniero detecta una desviación de configuración antes de que cause una caída, y el responsable del incidente lo menciona por su nombre en el siguiente standup |
| Refuerzo negativo | Se retira algo desagradable | Aumenta | Un equipo que entrega su informe semanal de estado a tiempo deja de recibir los mensajes diarios de seguimiento |
| Castigo | Se añade algo desagradable, o se retira algo valorado | Disminuye | Una infracción de seguridad reincidente genera una advertencia formal, o se retira a alguien de un proyecto de alta visibilidad |
| Extinción | No ocurre nada en absoluto | Disminuye | Alguien plantea problemas de proceso en tres retros seguidas, nunca se hace nada y deja de plantearlos |
El refuerzo negativo no es castigo, y la mayoría de los textos de gestión se equivocan en esto
Este es el error más común al escribir sobre el refuerzo en el trabajo, así que conviene ser directo. El refuerzo negativo aumenta un comportamiento. Lo hace retirando algo aversivo: cesa la insistencia, se silencia la alarma, termina la cadena de escalamiento. El alivio es el reforzador.
El castigo disminuye un comportamiento al añadir algo aversivo o retirar algo valorado. Los dos son opuestos en sus efectos y se confunden fácilmente al redactarlos. Psychology 2e de OpenStax mantiene la distinción limpia: positivo significa añadir, negativo significa retirar, el refuerzo aumenta, el castigo disminuye. Cuatro combinaciones, sin solapamiento.
No es pedantería. Si confunde uno con otro, leerá «el refuerzo negativo funciona» como una licencia para apoyarse en la amenaza, cuando el hallazgo trata del alivio de una presión continua. También oculta un diagnóstico útil: ¿cuánto del comportamiento de su equipo se mantiene hoy por alivio y no por recompensa? Los equipos que solo se mueven cuando algo desagradable acecha funcionan con refuerzo negativo, y eso sirve hasta que lo desagradable se convierte en ruido de fondo.
Las dos consecuencias que disminuyen el comportamiento tienen cada una su trampa. El castigo suprime el comportamiento rápidamente, pero no enseña qué hacer en su lugar, y enseña de forma fiable a evitar a quien castiga, lo que significa menos errores visibles y no menos errores reales. Ese mecanismo es el que destruye en silencio la seguridad psicológica, y por eso las organizaciones que castigan las malas noticias terminan con la peor información.
La extinción es más lenta y más extraña. Cuando un comportamiento que antes se reforzaba deja de dar resultado, la primera respuesta suele ser una ráfaga de extinción: el comportamiento se vuelve más intenso y más frecuente antes de desaparecer. El colega que solía obtener respuestas rápidas escribiéndole directamente insistirá más fuerte después de que usted lo derive a la cola de solicitudes. Los directivos que no esperan la ráfaga concluyen que el cambio fracasó y restituyen la antigua recompensa en el peor momento posible, enseñando persistencia en lugar de la nueva rutina.
Programas de refuerzo
Decidir qué reforzar es la parte fácil. Cuándo se refuerza importa igual de mucho, y aquí es donde la teoría produce sus hallazgos prácticos menos obvios.

El refuerzo continuo significa que cada instancia recibe la consecuencia. Es el que enseña más rápido, lo que lo hace adecuado mientras alguien está aprendiendo, y también el que se extingue más rápido, porque la ausencia de la recompensa es evidente de inmediato. Si refuerza cada vez, está construyendo un comportamiento que se derrumba en cuanto la recompensa se detiene.
El refuerzo intermitente significa que solo algunas instancias reciben la consecuencia. Enseña más despacio y se mantiene mucho más tiempo. El trabajo de Ferster y Skinner de 1957 trazó los cuatro programas intermitentes básicos, que se sitúan en dos ejes: razón frente a intervalo (respuestas contadas frente a tiempo transcurrido) y fijo frente a variable.
| Programa | Regla de refuerzo | Equivalente laboral | Patrón de respuesta | Persistencia cuando la recompensa se detiene |
|---|---|---|---|---|
| Razón fija | Tras un número determinado de respuestas | Pago a destajo, comisión por unidad vendida, un bono por cada décima demo calificada | Alta producción con una pausa marcada justo después de cada pago | Moderada, y la pausa hace visible la caída desde el principio |
| Razón variable | Tras un número impredecible de respuestas | La propia prospección (algunas llamadas conectan), el reconocimiento espontáneo, un spiff sorteado entre los negocios que califican | Alta y constante, casi sin pausa posterior a la recompensa | La más alta de los cuatro, por un margen claro |
| Intervalo fijo | La primera respuesta tras un periodo determinado | Bono mensual, revisión trimestral, evaluación anual | Moderado, con un marcado efecto de festón: el esfuerzo se dispara al acercarse la fecha y decae justo después | Baja, porque la ausencia del pago tiene una fecha de vencimiento evidente |
| Intervalo variable | La primera respuesta tras un periodo impredecible | Recorridos de seguridad sin aviso, auditorías de calidad aleatorias, un líder que aparece en los standups sin un patrón | Moderado pero genuinamente constante | Sólida, porque no hay una fecha en la que notar la ausencia |
La fila que importa es la de razón variable. Produce tanto el mayor rendimiento como la mayor resistencia a la extinción. Es el mismo mecanismo detrás de las máquinas tragamonedas, y explica por qué un hábito de reconocimiento impredecible mantiene un comportamiento mejor que un bono programado más grande.
También explica por qué ciertos esquemas de incentivos son casi imposibles de desmontar. Una cultura de ventas construida sobre recompensas impredecibles y de alta variabilidad ha instalado exactamente el programa más resistente a la extinción, de modo que cuando finanzas propone algo más plano, la resistencia no tiene que ver solo con el dinero: el patrón antiguo persiste mucho después de que los pagos cambian, y la ráfaga de extinción que sigue se parece mucho a una crisis de moral. Los esquemas de intervalo fijo son la imagen especular: fáciles de retirar y fáciles de manipular. La carrera habitual de fin de trimestre no es un problema de disciplina. Es un programa de intervalo fijo haciendo exactamente lo que la investigación dice que hace.
Modificación de la conducta organizacional: la versión aplicada
La aplicación formal de la teoría del refuerzo en el trabajo es la Modificación de la Conducta Organizacional, normalmente abreviada como OB Mod, desarrollada por Fred Luthans y Robert Kreitner a mediados de los años setenta. Su unidad de análisis es la cadena A-B-C: el antecedente (la ocasión en la que ocurre el comportamiento), el comportamiento en sí y la consecuencia que lo sigue. El modelo de cinco pasos funciona así.

| Paso | Qué hace usted | Dónde suele fallar |
|---|---|---|
| 1. Identificar | Señale los comportamientos que impulsan el desempeño, usando la observabilidad como prueba: ¿se puede ver, contar y conectar con un resultado? | Las organizaciones intentan reforzar disposiciones. «Sea más responsable» no pasa la prueba; «registre el defecto dentro del mismo turno» sí |
| 2. Medir | Registre la frecuencia actual antes de cambiar nada | Sin línea base, el efecto de una intervención no se distingue de la fluctuación normal ni se puede defender después |
| 3. Analizar | Mapee las contingencias existentes: qué precede al comportamiento y qué lo sigue | Se omite, lo que oculta que el comportamiento que no le gusta ya está reforzado por algo en el sistema |
| 4. Intervenir | Cambie las consecuencias, indicando cuál de los cuatro tipos utiliza y con qué programa | Una nueva recompensa vaga en lugar de una consecuencia especificada con un programa especificado |
| 5. Evaluar | Vuelva a medir contra la línea base | Un resultado nulo se interpreta como motivo para subir la recompensa, cuando normalmente significa que el paso 3 estaba mal |
¿Funciona realmente?
Mejor que muchas intervenciones de gestión, dentro de su alcance. Alexander Stajkovic y Fred Luthans realizaron un metaanálisis de 72 estudios de gestión conductual llevados a cabo en organizaciones reales y reportaron un tamaño del efecto promedio de d = .47, que traducen como una mejora del 16% en el desempeño de tareas y una probabilidad de éxito del 63%. El dinero, la retroalimentación sobre el desempeño y el reconocimiento social tuvieron cada uno un efecto independiente significativo: el dinero mejoró el desempeño un 23%, el reconocimiento social un 17% y la retroalimentación un 10%.
Dos detalles merecen atención. El reconocimiento social superó a la retroalimentación sobre el desempeño y quedó a un paso del dinero, a una fracción del costo. Y los tres combinados produjeron un efecto sinérgico, un 21% mayor que la suma de sus efectos individuales, aunque los autores señalan que el dinero y el reconocimiento social combinados entre sí no funcionaron tan bien como las otras combinaciones. De modo que la configuración más fuerte no es «pague más». Es pagar, decirle a las personas cómo les va y reconocerlas. Esa es una de las razones por las que una práctica directa de retroalimentación como la franqueza radical mejora el desempeño aun cuando la compensación no cambia.
La salvedad es el alcance. Ese 16% proviene de estudios sobre desempeño de tareas medible, que se inclina hacia el trabajo observable: producción, asistencia, cumplimiento de normas de seguridad, transacciones de servicio. No es evidencia de que los esquemas de refuerzo mejoren la estrategia o el juicio.
Las críticas serias
La teoría del refuerzo atrae más críticas sostenidas que cualquier otro modelo de motivación de esta colección, y las objeciones no son triviales.

Las recompensas extrínsecas pueden desplazar la motivación intrínseca
Este es el desafío empírico más fuerte y tiene nombre: el efecto de sobrejustificación. Si alguien ya disfruta una actividad por sí misma y usted empieza a pagarle por ella, la recompensa puede convertirse en la razón por la que la hace, y el interés cae cuando el pago se detiene.
El metaanálisis de 128 experimentos de Edward Deci, Richard Koestner y Richard Ryan es la referencia canónica. Las recompensas contingentes al compromiso, a la finalización y al desempeño socavaron de forma significativa la motivación intrínseca de libre elección, con tamaños del efecto de d = -0.40, -0.36 y -0.28, y lo mismo ocurrió con las recompensas tangibles y esperadas como categorías amplias. La retroalimentación positiva fue en sentido contrario: reforzó la conducta de libre elección (d = 0.33) y el interés autoinformado (d = 0.31).
Si se leen juntos, la orientación es inusualmente clara. El reconocimiento informativo construye interés intrínseco. Las recompensas tangibles ligadas a hacer la tarea, terminarla o alcanzar una cifra lo erosionan. Es un hallazgo difícil para quien basa toda su estrategia de motivación en un plan de bonos. La teoría de la autodeterminación explica la razón: las recompensas que se sienten controladoras socavan la autonomía, mientras que la retroalimentación que se siente informativa apoya la competencia.
Tratar a las personas como comportamiento por condicionar es un problema ético
La técnica se desarrolló con palomas y ratas y se transfiere a los humanos porque el mecanismo de aprendizaje subyacente se transfiere, y eso es justamente lo que genera inquietud. Un directivo que aplica un programa de refuerzo a un profesional adulto ha adoptado una postura sobre esa persona: que la palanca útil es su comportamiento y no su razonamiento.
La versión defendible es la transparencia. Si las personas saben qué se refuerza y por qué, y pueden discutir la elección, la objeción de manipulación se debilita considerablemente. La versión indefendible es el condicionamiento encubierto. No es casualidad que el pensamiento del refuerzo esté cerca de la Teoría X de McGregor, que asume que las personas necesitan ser dirigidas y controladas. La técnica no requiere esa suposición, pero resulta cómoda para los directivos que la sostienen, y esa comodidad merece que la note en usted mismo.
Ignorar la cognición la hace poco adecuada para el trabajo del conocimiento complejo
El diseño de caja negra que hace práctica a la teoría del refuerzo en una línea de producción la hace casi inútil en una decisión de arquitectura. El trabajo complejo implica juicio en la ambigüedad, donde el comportamiento correcto no es observable de antemano y el resultado llega meses después, mal atribuido. No se puede reforzar lo que no se ve, ni reforzar con prontitud lo que no se resuelve en dos trimestres. Para ese trabajo, las teorías cognitivas pesan más, porque las preguntas que importan son si la persona cree que su esfuerzo producirá el resultado (teoría de las expectativas), si considera que el trato es justo (teoría de la equidad) y si la meta es lo bastante específica y difícil para enfocar el esfuerzo (teoría del establecimiento de metas).
Usted obtiene exactamente el comportamiento que mide
El refuerzo es indiferente a la intención. Fortalece el comportamiento que realmente precedió a la recompensa, que puede no ser el que usted quería fortalecer.
La versión sistemática de este argumento es «Goals Gone Wild», de Ordóñez, Schweitzer, Galinsky y Bazerman, que sostiene que los beneficios de fijar metas se han sobrestimado mientras se han ignorado sus daños, y cataloga los efectos secundarios: un enfoque estrecho que descuida todo lo que queda fuera de la meta, un aumento del comportamiento poco ético, preferencias de riesgo distorsionadas, corrosión de la cultura organizacional y menor motivación intrínseca. Cada uno es una falla de refuerzo. El esquema reforzó un indicador sustituto, las personas optimizaron ese indicador y aquello que el indicador representaba empeoró. Si recompensa los tickets cerrados, obtendrá tickets cerrados prematuramente.
El patrón de fondo es que el refuerzo funciona, y por eso una meta mal elegida es peligrosa y no solo ineficaz. Este es el límite más agudo del liderazgo transaccional, en esencia la teoría del refuerzo operacionalizada como estilo de liderazgo: la recompensa contingente es eficaz para producir el comportamiento especificado y estructuralmente incapaz de advertir cuando la especificación era errónea.
Dónde sigue funcionando de verdad
Nada de eso vuelve obsoleta a la teoría. La convierte en una herramienta especializada con un rango bien definido, y dentro de ese rango supera a casi todo lo demás.
| Ámbito | Por qué encaja | Qué reforzar |
|---|---|---|
| Comportamiento de seguridad | El objetivo es observable, y la consecuencia natural (una lesión) es demasiado infrecuente para enseñar algo | Usar el equipo, ejecutar la verificación, reportar el casi accidente, con un programa de observación de intervalo variable |
| Calidad y reducción de defectos | Los defectos son contables, las causas rastreables y los ciclos de retroalimentación rápidos | Detectar un defecto aguas arriba, registrarlo con precisión, detener la línea cuando no se cumple el estándar |
| Formación de hábitos y onboarding | Las nuevas rutinas necesitan un refuerzo denso al principio, y quien aprende aún no puede juzgar su propio trabajo | Cada paso correcto, de forma continua durante las primeras semanas, y luego reduciéndolo a un programa variable |
| Tareas repetitivas y observables | La producción es medible por unidad y la consecuencia puede seguir en minutos | Rendimiento, precisión, adherencia a la secuencia |
| Moldear un comportamiento específico | El alcance acotado es el terreno propio de la teoría, y evita el problema del indicador sustituto | Una sola acción con nombre, definida con la precisión suficiente para que dos observadores coincidan en que ocurrió |
El patrón es que la teoría del refuerzo funciona cuando el comportamiento es observable, la consecuencia puede ser inmediata y contingente, y el objetivo es una acción específica y no una actitud. Por eso «reforzar el compromiso» es un error de categoría. El compromiso no es un comportamiento, nadie puede verlo ocurrir y no existe un momento en el que entregar una consecuencia.
Cómo aplicarla con honestidad
Refuerce el comportamiento, no solo recompense los resultados
Esto es lo que separa la práctica competente de un plan de bonos. Los resultados están contaminados por la suerte, las condiciones de mercado y el trabajo de otras personas. Los comportamientos son la parte que la persona controla. Si recompensa un negocio cerrado, en parte ha recompensado un trimestre favorable. Si refuerza la llamada de descubrimiento que sacó a la luz la objeción real, ha reforzado algo repetible. Las recompensas por resultados siguen teniendo su lugar, pero enseñan menos de lo que se supone.

Hágalo inmediato y hágalo contingente
Estas son las dos variables que más importan, y ambas suelen estar rotas. Inmediato significa que la consecuencia sigue lo bastante de cerca como para que la conexión sea obvia, y por eso un reconocimiento en el standup de mañana supera por un margen enorme a uno en la revisión del próximo trimestre. Contingente significa que la consecuencia depende de ese comportamiento y solo de ese comportamiento. Un bono que todos reciben no es contingente a nada, así que no refuerza nada. Puede seguir siendo justo pagarlo. Simplemente no es un instrumento de motivación.
Prefiera el reconocimiento impredecible al bono programado
Dada la investigación sobre programas, este es el cambio de hábito de mayor impacto al alcance de la mayoría de los directivos, y no cuesta nada. Una recompensa de intervalo fijo produce el festón: un aumento antes de la fecha y un bajón después. El reconocimiento impredecible produce un comportamiento estable y se sostiene mucho más una vez que usted se detiene. En la práctica significa notar el buen trabajo cuando lo ve, en lugar de guardarlo para un ciclo de evaluación.
Nombre también el comportamiento. «Buen trabajo esta semana» no refuerza nada en particular, porque la persona no puede saber cuál de las cuarenta cosas que hizo lo mereció. «Usted señaló esa dependencia antes de que bloqueara el lanzamiento, y eso nos ahorró dos días» refuerza una acción específica, y esa especificidad es lo que convierte una recompensa en retroalimentación.
Use la extinción deliberadamente y espere la ráfaga
Si un comportamiento se mantiene por algo que usted controla, normalmente puede detenerlo retirando el refuerzo en lugar de castigarlo. Las escalaciones que eluden el proceso se detienen cuando eludirlo deja de funcionar. Solo planifique la ráfaga de extinción y decida de antemano que no restituirá la antigua recompensa durante la semana en que el comportamiento se intensifique.
Revise qué refuerza ya su sistema
Antes de diseñar nada, aplíquese a usted mismo el paso 3 de OB Mod. Toda organización es ya una máquina de refuerzo, haya planificado alguien algo o no. La persona que se ofrece para trabajo extra y recibe más trabajo ha sido castigada. El equipo que expone un riesgo a tiempo y recibe una auditoría ha sido castigado. El colega que absorbe el problema en silencio y que lo dejan en paz ha sido reforzado. Gran parte del trabajo de refuerzo a nivel de mando medio no consiste en añadir nuevas recompensas. Consiste en encontrar las contingencias que construyó por accidente y apagarlas.
Una advertencia que vale para los cinco puntos: un reforzador se define por su efecto, no por su intención. El elogio público refuerza a algunas personas y castiga levemente a otras. Compruébelo observando qué hace el comportamiento a continuación.
Cómo se relaciona con las demás teorías de la motivación
La teoría del refuerzo es un instrumento dentro de un conjunto, no una rival de las demás. Responde una pregunta más acotada que cualquiera de ellas, y la responde de forma más concreta.
| Teoría | Qué observa | Dónde supera a la teoría del refuerzo | Dónde la teoría del refuerzo la supera |
|---|---|---|---|
| Teoría del refuerzo (Skinner) | Acciones observables y sus consecuencias | En ninguna parte dentro de su propio terreno | Es accionable de inmediato esta semana y medible |
| Jerarquía de Maslow | Necesidades internas en secuencia | Explica por qué una recompensa cae en saco roto cuando una necesidad inferior no está cubierta | Es comprobable, sin adivinar un estado oculto |
| Teoría de los dos factores de Herzberg | Factores de higiene frente a motivadores | Explica por qué eliminar una irritación no crea motivación | Especifica el momento y la contingencia que Herzberg deja vagos |
| Teoría de las necesidades de McClelland | Perfiles de logro, afiliación y poder | Le dice qué reforzador funcionará como tal | Le dice cuándo y con qué frecuencia entregarlo |
| Teoría de las expectativas de Vroom | Expectativa, instrumentalidad y valencia | Diagnostica fallas de motivación que ninguna recompensa puede arreglar | Funciona cuando la persona no puede articular su propio razonamiento |
| Teoría de la equidad de Adams | Relaciones entre aportes y resultados frente a un referente | Explica por qué una recompensa técnicamente correcta sale mal | Trata el comportamiento de una persona, no una comparación social |
| Teoría del establecimiento de metas de Locke | Especificidad, dificultad y compromiso de la meta | Dirige el esfuerzo antes del comportamiento y no después | Sostiene el comportamiento una vez fijada la meta |
| Teoría de la autodeterminación | Autonomía, competencia y relación con los demás | Explica cuándo las recompensas saldrán activamente mal | Mueve más rápido los comportamientos acotados y observables |
La síntesis a la que llegan la mayoría de los directivos es la siguiente. Use el establecimiento de metas para decidir qué importa, las expectativas y la equidad para comprobar que el trato sea creíble y justo, la teoría de la autodeterminación para decidir si una recompensa tangible es apropiada en absoluto, y la teoría del refuerzo para manejar el momento y la especificidad de lo que usted dice cuando el comportamiento ocurre frente a usted. Esa última parte es el trabajo diario, y es la parte que la mayoría de los programas de desarrollo de liderazgo ignora por completo.
Preguntas frecuentes sobre la teoría del refuerzo
¿Qué es la teoría del refuerzo en términos simples?
La teoría del refuerzo dice que el comportamiento se moldea por lo que lo sigue. Las acciones seguidas de consecuencias favorables se repiten, y las acciones seguidas de consecuencias desfavorables o de nada en absoluto se van apagando. Ignora deliberadamente lo que una persona está pensando y trabaja solo con el comportamiento observable y las consecuencias observables.
¿Cuáles son los cuatro tipos de refuerzo?
En rigor, hay dos tipos de refuerzo y dos formas de disminuir un comportamiento. El refuerzo positivo añade algo deseable y el refuerzo negativo retira algo desagradable, y ambos aumentan el comportamiento. El castigo añade algo desagradable o retira algo valorado, y la extinción elimina todas las consecuencias, y ambos lo disminuyen.
¿El refuerzo negativo es lo mismo que el castigo?
No, y este es el error más común en los textos de gestión sobre el tema. El refuerzo negativo aumenta un comportamiento al retirar algo desagradable, como cuando los correos de seguimiento cesan una vez que el informe se entrega a tiempo. El castigo disminuye un comportamiento. Son opuestos, y «negativo» aquí significa retirar, no malo.
¿Qué programa de refuerzo funciona mejor en el trabajo?
Para aprender algo nuevo, el refuerzo continuo enseña más rápido. Para mantener un comportamiento, la razón variable es la más fuerte, porque produce un rendimiento alto y estable y es la más resistente a la extinción de los cuatro programas. Las recompensas de intervalo fijo, como los bonos trimestrales, producen el patrón más débil, con un aumento antes de la fecha y un bajón después.
¿La teoría del refuerzo mejora realmente el desempeño?
Dentro de su alcance, sí. Stajkovic y Luthans realizaron un metaanálisis de 72 estudios de gestión conductual en organizaciones reales y reportaron una mejora promedio del 16% en el desempeño de tareas, con el dinero en un 23%, el reconocimiento social en un 17% y la retroalimentación sobre el desempeño en un 10%. Esos estudios se concentran en el desempeño observable de tareas, por lo que el hallazgo no se extiende a la estrategia ni al trabajo que exige juicio complejo.
¿Cuál es la principal crítica a la teoría del refuerzo?
La crítica más fuerte basada en evidencia es el efecto de sobrejustificación. El metaanálisis de 128 experimentos de Deci, Koestner y Ryan encontró que las recompensas tangibles ligadas a hacer, completar o desempeñar una tarea socavaron de forma significativa la motivación intrínseca, mientras que la retroalimentación positiva la aumentó. También existen objeciones éticas al condicionamiento de adultos y un límite práctico: el refuerzo fortalece exactamente el comportamiento que usted midió, incluso cuando ese comportamiento era el indicador equivocado.
¿Cuándo debe un directivo usar la teoría del refuerzo?
Úsela cuando el comportamiento sea observable, la consecuencia pueda seguir rápidamente y dependa solo de ese comportamiento, y el objetivo sea una acción específica y no una actitud. La seguridad, la calidad, la formación de hábitos, el onboarding y el trabajo repetitivo y medible son sus casos más sólidos.
La teoría del refuerzo no es una filosofía de la motivación y no pretende serlo. Es una afirmación sobre las consecuencias, y acierta en ellas. La disciplina que impone es que usted tiene que nombrar un comportamiento con la precisión suficiente para verlo ocurrir, y luego ser honesto sobre lo que su organización hace hoy en el momento siguiente. La mayoría de los equipos descubre que ha estado reforzando algo distinto de lo que dice valorar.

On this page
- ¿Qué es la teoría del refuerzo?
- Las cuatro consecuencias
- El refuerzo negativo no es castigo, y la mayoría de los textos de gestión se equivocan en esto
- Programas de refuerzo
- Modificación de la conducta organizacional: la versión aplicada
- ¿Funciona realmente?
- Las críticas serias
- Las recompensas extrínsecas pueden desplazar la motivación intrínseca
- Tratar a las personas como comportamiento por condicionar es un problema ético
- Ignorar la cognición la hace poco adecuada para el trabajo del conocimiento complejo
- Usted obtiene exactamente el comportamiento que mide
- Dónde sigue funcionando de verdad
- Cómo aplicarla con honestidad
- Refuerce el comportamiento, no solo recompense los resultados
- Hágalo inmediato y hágalo contingente
- Prefiera el reconocimiento impredecible al bono programado
- Use la extinción deliberadamente y espere la ráfaga
- Revise qué refuerza ya su sistema
- Cómo se relaciona con las demás teorías de la motivación