Teoria do Reforço da Motivação Explicada

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
A maioria das teorias da motivação pergunta o que se passa dentro de uma pessoa. Maslow pergunta qual necessidade está insatisfeita. Vroom pergunta o que alguém acredita sobre esforço e recompensa. Adams pergunta se a pessoa se sente tratada de forma justa. A teoria do reforço recusa a pergunta. Ela diz: esqueça o que as pessoas pensam, olhe para o que acontece logo depois que elas agem, porque é isso que decide se vão repetir o comportamento. É a teoria mais direta do cânone da gestão, e também a que os gestores usam o tempo todo sem perceber. Todo esquema de bônus, toda ronda de segurança, todo "ótima percepção" em um standup é uma decisão de reforço, tomada bem ou mal.
O que é a teoria do reforço?
A teoria do reforço sustenta que o comportamento é função de suas consequências. Ações seguidas de resultados favoráveis são repetidas. Ações seguidas de resultados desfavoráveis, ou de nada, desaparecem. A teoria é associada a B.F. Skinner e ao seu trabalho sobre condicionamento operante, em que um organismo age sobre o ambiente e o ambiente responde, fortalecendo ou enfraquecendo o que veio antes.
Ela descende da lei do efeito de Edward Thorndike, que nasceu de experimentos nos quais gatos eram colocados em caixas-problema, na década de 1890, e cronometrados até conseguirem escapar. Thorndike também acrescentou uma cláusula que a maioria dos resumos omite: quanto maior a satisfação ou o desconforto, maior o fortalecimento ou o enfraquecimento. Uma revisão de 2026 no Journal of the Experimental Analysis of Behavior, de Michael Domjan, rastreia como a versão ensinada foi se desviando, tendo o Science and Human Behavior de Skinner, de 1953, como ponto de virada que reformulou a lei como o comportamento simplesmente sendo gravado pelas consequências. Os livros didáticos herdaram a versão truncada, por isso vale dedicar alguns minutos ao capítulo original de 1911.
A decisão de projeto crítica é o que a teoria deixa de fora: necessidades, crenças, percepções de justiça, valor esperado. Ela trata a pessoa como uma caixa-preta e trabalha apenas com comportamentos observáveis e consequências observáveis. Isso é deliberado e traz clareza real, porque você pode contar comportamentos, mudar consequências e medir se a contagem se alterou. Também custa à teoria tudo o que os outros frameworks da família das teorias de liderança existem para capturar. A hierarquia de necessidades de Maslow e a teoria das necessidades de McClelland são teorias de conteúdo que nomeiam o que as pessoas querem. A teoria da expectativa de Vroom e a teoria da equidade de Adams são teorias cognitivas de processo que modelam o cálculo que as pessoas fazem antes de decidir tentar. A teoria do reforço não é nenhuma das duas. É uma teoria das consequências, e a única aqui que continuaria funcionando mesmo que os seres humanos não tivessem vida interior.
Dados Relevantes: Teoria do Reforço
- A primeira formulação definitiva da lei do efeito por Thorndike apareceu em Animal Intelligence (1911, p. 244): respostas "acompanhadas ou seguidas de perto por satisfação para o animal" ficam mais firmemente conectadas à situação que as produziu. Fonte: Classics in the History of Psychology, York University
- Stajkovic e Luthans fizeram uma meta-análise de 72 estudos de gestão comportamental em organizações reais e encontraram um tamanho de efeito médio de d = ,47, reportado como uma melhoria de 16% no desempenho de tarefas e 63% de probabilidade de sucesso. Fonte: Personnel Psychology, 2003
- Na mesma análise, o dinheiro melhorou o desempenho em 23%, o reconhecimento social em 17% e o feedback de desempenho em 10%. Usados juntos, os três produziram um efeito sinérgico 21% maior do que a soma dos efeitos individuais. Fonte: Personnel Psychology, 2003
- A meta-análise de Deci, Koestner e Ryan, com 128 experimentos, constatou que recompensas tangíveis minaram significativamente a motivação intrínseca de livre escolha (condicionadas ao engajamento d = -0,40, condicionadas à conclusão d = -0,36, condicionadas ao desempenho d = -0,28), enquanto o feedback positivo a reforçou (d = 0,33). Fonte: Psychological Bulletin, 1999
- Entre as quatro programações, a de razão variável é ao mesmo tempo a mais produtiva e a mais resistente à extinção, e por isso recompensas imprevisíveis são tão difíceis de desfazer. Fonte: OpenStax, Psychology 2e
As quatro consequências
A teoria do reforço oferece exatamente quatro movimentos. Dois aumentam um comportamento, dois o diminuem. O vocabulário é infeliz, porque "positivo" e "negativo" aqui significam adicionar e remover, não bom e ruim.
| Consequência | O que acontece | Efeito | Exemplo no ambiente de trabalho |
|---|---|---|---|
| Reforço positivo | Algo desejável é adicionado | Aumenta | Um engenheiro sinaliza um desvio de configuração antes que cause uma queda, e o responsável pelo incidente o cita no próximo standup |
| Reforço negativo | Algo desagradável é removido | Aumenta | Uma equipe que entrega o status semanal no prazo deixa de receber os lembretes diários de cobrança |
| Punição | Algo desagradável é adicionado, ou algo valorizado é removido | Diminui | Uma violação de segurança repetida gera uma advertência formal, ou alguém é retirado de um projeto de alta visibilidade |
| Extinção | Absolutamente nada acontece | Diminui | Alguém levanta problemas de processo em três retrospectivas seguidas, nada é feito, e a pessoa para de levantá-los |
Reforço negativo não é punição, e a maior parte dos textos de gestão erra isso
Este é o erro mais comum nos textos sobre reforço no trabalho, então vale ser direto. O reforço negativo aumenta um comportamento. Ele faz isso retirando algo aversivo: a cobrança insistente cessa, o alarme se cala, a cadeia de escalonamento termina. O alívio é o reforçador.
A punição diminui um comportamento ao adicionar algo aversivo ou remover algo valorizado. Os dois são opostos em efeito e facilmente confundidos na redação. O Psychology 2e da OpenStax mantém a distinção limpa: positivo significa adicionar, negativo significa remover, reforço aumenta, punição diminui. Quatro combinações, sem sobreposição.
Isso não é preciosismo. Se você confundir um com o outro, vai ler "reforço negativo funciona" como licença para apelar à ameaça, quando a constatação é sobre o alívio de uma pressão contínua. Isso também esconde um diagnóstico útil: quanto do comportamento da sua equipe é mantido hoje por alívio e não por recompensa? Equipes que só se movem quando algo desagradável está por vir funcionam à base de reforço negativo, e isso funciona até o momento em que o desagradável vira ruído de fundo.
Cada uma das duas consequências que diminuem comportamento tem uma pegadinha. A punição suprime o comportamento rapidamente, mas não ensina nada sobre o que fazer em vez dele, e ensina de forma confiável as pessoas a evitar quem pune, o que significa menos erros visíveis e nenhum erro real a menos. Esse mecanismo destrói silenciosamente a segurança psicológica, e é por isso que organizações que punem más notícias acabam com as piores informações.
A extinção é mais lenta e mais estranha. Quando um comportamento antes reforçado deixa de compensar, a primeira resposta costuma ser uma explosão de extinção: ele fica mais intenso e mais frequente antes de parar. O colega que antes obtinha respostas rápidas chamando você diretamente vai chamar com mais força depois que você o encaminhar para a fila. Gestores que não esperam essa explosão concluem que a mudança falhou e restauram a recompensa antiga no pior momento possível, ensinando persistência em vez da nova rotina.
Programações de reforço
Decidir o que reforçar é a metade fácil. Quando você reforça importa tanto quanto, e é aqui que a teoria produz suas conclusões práticas menos óbvias.

O reforço contínuo significa que toda ocorrência recebe a consequência. É o que ensina mais rápido, o que o torna adequado enquanto alguém está aprendendo, e é também o que se extingue mais rápido, porque a falta da recompensa é imediatamente óbvia. Se você reforça toda e qualquer vez, está construindo um comportamento que desmorona no momento em que a recompensa para.
O reforço intermitente significa que apenas algumas ocorrências recebem a consequência. Ensina mais devagar e se sustenta por muito mais tempo. O trabalho de Ferster e Skinner de 1957 mapeou as quatro programações intermitentes básicas, que se organizam em dois eixos: razão versus intervalo (respostas contadas versus tempo decorrido) e fixo versus variável.
| Programação | Regra de reforço | Analogia no trabalho | Padrão de resposta | Persistência quando a recompensa cessa |
|---|---|---|---|---|
| Razão fixa | Após um número definido de respostas | Pagamento por peça, comissão por unidade vendida, um bônus a cada décimo demo qualificado | Alto volume, com uma pausa nítida logo após cada pagamento | Moderada, e a pausa torna a queda visível cedo |
| Razão variável | Após um número imprevisível de respostas | A própria prospecção (algumas ligações conectam), reconhecimento espontâneo, um spiff sorteado entre negócios qualificados | Alto e constante, com quase nenhuma pausa após a recompensa | A maior das quatro, por margem clara |
| Intervalo fixo | A primeira resposta após um período definido | Bônus mensal, avaliação trimestral, avaliação anual | Moderado, com um padrão em escala pronunciado: o esforço dispara perto da data e cai logo depois | Baixa, porque a ausência do pagamento tem uma data óbvia |
| Intervalo variável | A primeira resposta após um período imprevisível | Rondas de segurança sem aviso, auditorias de qualidade aleatórias, um líder que aparece nos standups sem padrão | Moderado, mas genuinamente constante | Sólida, porque não há data em que se note a ausência |
A linha que importa é a de razão variável. Ela produz ao mesmo tempo o maior volume e a maior resistência à extinção. É o mesmo mecanismo por trás dos caça-níqueis, e é por isso que um hábito imprevisível de reconhecimento sustenta um comportamento melhor do que um bônus programado maior.
Isso também explica por que certos esquemas de incentivo são quase impossíveis de desmontar. Uma cultura de vendas construída sobre recompensas imprevisíveis e de alta variância instalou exatamente a programação mais resistente à extinção, então, quando o financeiro propõe algo mais plano, a resistência não é apenas por dinheiro: o padrão antigo persiste muito depois que os pagamentos mudam, e a explosão de extinção que se segue se parece muito com uma crise de moral. Os esquemas de intervalo fixo são o espelho disso, fáceis de remover e fáceis de manipular. A corrida previsível de fim de trimestre não é um problema de disciplina. É uma programação de intervalo fixo fazendo exatamente o que a pesquisa diz que ela faz.
Modificação do comportamento organizacional: a versão aplicada
A aplicação formal da teoria do reforço no trabalho é a Modificação do Comportamento Organizacional, normalmente abreviada como OB Mod, desenvolvida por Fred Luthans e Robert Kreitner em meados dos anos 1970. Sua unidade de análise é a cadeia A-B-C: o antecedente (a ocasião em que o comportamento ocorre), o comportamento em si e a consequência que se segue. O modelo de cinco etapas funciona assim.

| Etapa | O que você faz | Onde costuma dar errado |
|---|---|---|
| 1. Identificar | Delimite os comportamentos que impulsionam o desempenho, usando a observabilidade como teste: você consegue ver, contar e conectar a um resultado? | As organizações tentam reforçar disposições. "Seja mais responsável" reprova no teste, "registre o defeito dentro de um turno" passa |
| 2. Medir | Registre a frequência atual antes de mudar qualquer coisa | Sem linha de base, o efeito da intervenção não se distingue da flutuação normal nem pode ser defendido depois |
| 3. Analisar | Mapeie as contingências existentes: o que precede o comportamento e o que o segue | É pulada, o que esconde o fato de que o comportamento de que você não gosta já é reforçado por algo no sistema |
| 4. Intervir | Mude as consequências, nomeando qual dos quatro tipos você usa e em qual programação | Uma nova recompensa vaga em vez de uma consequência especificada em uma programação especificada |
| 5. Avaliar | Meça novamente em relação à linha de base | Um resultado nulo é lido como motivo para aumentar a recompensa, quando em geral significa que a etapa 3 estava errada |
Funciona de fato?
Melhor do que muitas intervenções de gestão, dentro de seu alcance. Alexander Stajkovic e Fred Luthans fizeram a meta-análise de 72 estudos de gestão comportamental conduzidos em organizações reais e reportaram um tamanho de efeito médio de d = ,47, que eles traduzem como uma melhoria de 16% no desempenho de tarefas e 63% de probabilidade de sucesso. Dinheiro, feedback de desempenho e reconhecimento social tiveram, cada um, um efeito independente significativo: o dinheiro melhorou o desempenho em 23%, o reconhecimento social em 17% e o feedback em 10%.
Dois detalhes merecem atenção. O reconhecimento social superou o feedback de desempenho e chegou perto do dinheiro, a uma fração do custo. E os três combinados produziram um efeito sinérgico 21% maior do que a soma de seus efeitos individuais, embora os autores observem que dinheiro e reconhecimento social combinados não funcionaram tão bem quanto as outras combinações. Portanto, a configuração mais forte não é "pague mais". É pagar, dizer às pessoas como elas estão indo e reconhecê-las. Esse é um dos motivos pelos quais uma prática de feedback direto como a radical candor eleva o desempenho mesmo quando a remuneração não muda.
A ressalva é o escopo. Esses 16% vêm de estudos de desempenho de tarefas mensurável, que tendem ao trabalho observável: produção, presença, conformidade com segurança, transações de atendimento. Não é evidência de que esquemas de reforço melhorem estratégia ou julgamento.
As críticas sérias
A teoria do reforço atrai mais críticas persistentes do que qualquer outro modelo de motivação desta coleção, e as objeções não são triviais.

Recompensas extrínsecas podem expulsar a motivação intrínseca
Este é o desafio empírico mais forte e tem nome: o efeito de superjustificação. Se alguém já gosta de uma atividade por si mesma e você começa a pagá-la por isso, a recompensa pode se tornar o motivo para fazê-la, e o interesse cai quando o pagamento termina.
A meta-análise de 128 experimentos de Edward Deci, Richard Koestner e Richard Ryan é a referência canônica. Recompensas condicionadas ao engajamento, à conclusão e ao desempenho minaram significativamente a motivação intrínseca de livre escolha, com tamanhos de efeito de d = -0,40, -0,36 e -0,28, e o mesmo valeu para recompensas tangíveis e esperadas como categorias amplas. O feedback positivo seguiu na direção oposta, reforçando o comportamento de livre escolha (d = 0,33) e o interesse autorrelatado (d = 0,31).
Leia esses dados em conjunto e a orientação é incomumente clara. O reconhecimento informativo constrói interesse intrínseco. Recompensas tangíveis atreladas a fazer a tarefa, terminá-la ou atingir um número o corroem. É uma constatação difícil para quem tem como estratégia de motivação apenas um plano de bônus. A teoria da autodeterminação explica o porquê: recompensas percebidas como controladoras minam a autonomia, enquanto o feedback percebido como informativo sustenta a competência.
Tratar pessoas como comportamento a ser condicionado é um problema ético
A técnica foi desenvolvida com pombos e ratos e se transfere para os humanos porque o mecanismo de aprendizagem subjacente se transfere, e é exatamente isso que deixa as pessoas desconfortáveis. Um gestor que aplica uma programação de reforço a um profissional adulto assumiu uma posição sobre essa pessoa: a de que a alavanca útil é o comportamento dela, e não o raciocínio.
A versão defensável é a transparência. Se as pessoas sabem o que está sendo reforçado e por quê, e podem discordar da escolha, a objeção de manipulação se enfraquece de forma considerável. A versão indefensável é o condicionamento encoberto. Não é por acaso que o pensamento de reforço fica próximo da Teoria X de McGregor, que pressupõe que as pessoas precisam ser dirigidas e controladas. A técnica não exige essa premissa, mas ela é confortável para gestores que a sustentam, e vale notar esse conforto em você mesmo.
Ignorar a cognição a torna inadequada para trabalho de conhecimento complexo
O desenho de caixa-preta que torna a teoria do reforço prática em uma linha de produção a torna quase inútil em uma decisão de arquitetura. O trabalho complexo envolve julgamento sob ambiguidade, em que o comportamento certo não é observável de antemão e o resultado chega meses depois, mal atribuído. Você não pode reforçar o que não vê, e não pode reforçar prontamente o que só se resolve em dois trimestres. Para esse tipo de trabalho, as teorias cognitivas pesam mais, porque as perguntas que importam são se a pessoa acredita que seu esforço produzirá o resultado (teoria da expectativa), se ela considera o acordo justo (teoria da equidade) e se a meta é específica e difícil o bastante para focalizar o esforço (teoria da definição de metas).
Você obtém exatamente o comportamento que mede
O reforço é indiferente à intenção. Ele fortalece o comportamento que de fato precedeu a recompensa, que pode não ser o que você queria fortalecer.
A versão sistemática desse argumento é "Goals Gone Wild", de Ordóñez, Schweitzer, Galinsky e Bazerman, que sustenta que os benefícios da definição de metas foram exagerados enquanto os danos foram ignorados, e cataloga os efeitos colaterais: um foco estreito que negligencia tudo fora da meta, aumento de comportamento antiético, preferências de risco distorcidas, corrosão da cultura organizacional e redução da motivação intrínseca. Cada um deles é uma falha de reforço. O esquema reforçou um indicador substituto, as pessoas otimizaram esse indicador, e aquilo que ele representava piorou. Recompense tickets fechados e você terá tickets fechados prematuramente.
O padrão por trás disso é que o reforço funciona, e é por isso que um alvo mal escolhido é perigoso, e não apenas ineficaz. Esse é o limite mais agudo da liderança transacional, essencialmente a teoria do reforço operacionalizada como estilo de liderança: a recompensa contingente é eficaz para produzir o comportamento especificado e estruturalmente incapaz de perceber quando a especificação estava errada.
Onde ela ainda funciona de verdade
Nada disso torna a teoria obsoleta. Torna-a uma ferramenta especializada com um alcance bem definido, e dentro desse alcance ela supera quase tudo o mais.
| Domínio | Por que se encaixa | O que reforçar |
|---|---|---|
| Comportamento de segurança | O alvo é observável, e a consequência natural (uma lesão) é rara demais para ensinar qualquer coisa | Usar o equipamento, executar a verificação, relatar o quase-acidente, em uma programação de observação de intervalo variável |
| Qualidade e redução de defeitos | Defeitos são contáveis, as causas são rastreáveis, os ciclos de feedback são rápidos | Detectar um defeito a montante, registrá-lo com precisão, parar a linha quando o padrão não é cumprido |
| Formação de hábitos e onboarding | Novas rotinas precisam de reforço denso no início, e o aprendiz ainda não consegue avaliar o próprio trabalho | Cada passo correto, de forma contínua nas primeiras semanas, reduzindo depois para variável |
| Tarefas repetitivas e observáveis | A produção é mensurável por unidade e a consequência pode vir em minutos | Vazão, precisão, adesão à sequência |
| Moldar um comportamento específico | O escopo restrito é o território da teoria, e evita o problema do indicador substituto | Uma única ação nomeada, definida com rigor suficiente para que dois observadores concordem que ela ocorreu |
O padrão é que a teoria do reforço funciona quando o comportamento é observável, a consequência pode ser imediata e contingente, e o alvo é uma ação específica e não uma atitude. É por isso que "reforçar o engajamento" é um erro de categoria. Engajamento não é um comportamento, ninguém consegue vê-lo acontecer e não há um momento em que entregar uma consequência.
Como aplicá-la com honestidade
Reforce o comportamento, não apenas recompense resultados
É isso que separa a prática competente de um plano de bônus. Os resultados são contaminados por sorte, condições de mercado e trabalho alheio. Os comportamentos são a parte que a pessoa controla. Recompense um negócio fechado e você terá recompensado em parte um trimestre favorável. Reforce a ligação de descoberta que trouxe à tona a objeção real e você terá reforçado algo repetível. As recompensas por resultado ainda têm seu lugar, mas ensinam menos do que as pessoas supõem.

Faça-o imediato e contingente
Essas são as duas variáveis que mais importam, e ambas costumam estar quebradas. Imediato significa que a consequência vem logo o bastante para que a conexão seja óbvia, e é por isso que o reconhecimento no standup de amanhã supera o reconhecimento na avaliação do próximo trimestre por uma margem enorme. Contingente significa que a consequência depende desse comportamento e somente dele. Um bônus que todos recebem não é contingente a nada, portanto não reforça nada. Ainda pode ser justo pagá-lo. Só não é um instrumento de motivação.
Prefira reconhecimento imprevisível a um bônus programado
Dada a pesquisa sobre programações, essa é a mudança de hábito de maior alavancagem disponível para a maioria dos gestores, e não custa nada. Uma recompensa de intervalo fixo produz o padrão em escala: um surto antes da data, uma queda depois. O reconhecimento imprevisível produz comportamento constante e se sustenta por muito mais tempo depois que você para. Na prática, isso significa notar o bom trabalho quando você o vê, em vez de guardá-lo para um ciclo de avaliação.
Nomeie o comportamento também. "Ótimo trabalho esta semana" não reforça nada em particular, porque a pessoa não consegue saber qual das quarenta coisas que fez o mereceu. "Você sinalizou aquela dependência antes de ela bloquear o release, e isso nos poupou dois dias" reforça uma ação específica, e essa especificidade é o que converte uma recompensa em feedback.
Use a extinção deliberadamente e espere a explosão
Se um comportamento é mantido por algo que você controla, em geral é possível pará-lo removendo o reforço em vez de punir. Escalonamentos que contornam o processo cessam quando contornar deixa de funcionar. Apenas planeje a explosão de extinção e decida de antemão que você não restaurará a recompensa antiga na semana em que o comportamento se intensificar.
Verifique o que seu sistema já reforça
Antes de desenhar qualquer coisa, aplique a etapa 3 da OB Mod a si mesmo. Toda organização já é uma máquina de reforço, quer alguém tenha planejado isso ou não. Quem se oferece para trabalho extra e recebe mais trabalho foi punido. A equipe que expõe um risco cedo e recebe uma auditoria foi punida. O colega que absorve o problema em silêncio e é deixado em paz foi reforçado. A maior parte do trabalho de reforço no nível gerencial não é adicionar novas recompensas. É encontrar as contingências que você construiu por acidente e desligá-las.
Uma ressalva para os cinco pontos: um reforçador é definido por seu efeito, não por sua intenção. O elogio público reforça algumas pessoas e pune levemente outras. Teste observando o que o comportamento faz em seguida.
Como ela se posiciona ao lado das outras teorias da motivação
A teoria do reforço é um instrumento dentro de um conjunto, e não uma rival das demais. Ela responde a uma pergunta mais restrita do que qualquer uma delas, e a responde de forma mais concreta.
| Teoria | O que observa | Onde supera a teoria do reforço | Onde a teoria do reforço a supera |
|---|---|---|---|
| Teoria do reforço (Skinner) | Ações observáveis e suas consequências | Em lugar nenhum, em seu próprio terreno | Aplicável diretamente nesta semana e mensurável |
| Hierarquia de Maslow | Necessidades internas em sequência | Explica por que uma recompensa cai no vazio quando uma necessidade inferior não está atendida | Testável, sem adivinhar um estado oculto |
| Teoria dos dois fatores de Herzberg | Fatores de higiene versus motivadores | Explica por que remover uma irritação não cria motivação | Especifica o momento e a contingência que Herzberg deixa vagos |
| Teoria das necessidades de McClelland | Perfis de realização, afiliação e poder | Diz qual reforçador funcionará como tal | Diz quando e com que frequência entregá-lo |
| Teoria da expectativa de Vroom | Expectativa, instrumentalidade e valência | Diagnostica falhas de motivação que nenhuma recompensa resolve | Funciona quando a pessoa não consegue articular o próprio raciocínio |
| Teoria da equidade de Adams | Razões entre insumos e resultados versus um referencial | Explica por que uma recompensa tecnicamente correta sai pela culatra | Lida com o comportamento de uma pessoa, não com uma comparação social |
| Teoria da definição de metas de Locke | Especificidade, dificuldade e comprometimento com a meta | Direciona o esforço antes do comportamento e não depois | Sustenta o comportamento depois que a meta está definida |
| Teoria da autodeterminação | Autonomia, competência e pertencimento | Explica quando as recompensas vão ativamente sair pela culatra | Movimento mais rápido em comportamentos restritos e observáveis |
A síntese a que a maioria dos gestores chega é esta. Use a definição de metas para decidir o que importa, expectativa e equidade para verificar se o acordo é crível e justo, a teoria da autodeterminação para decidir se uma recompensa tangível é apropriada, e a teoria do reforço para cuidar do momento e da especificidade do que você de fato diz quando o comportamento acontece diante de você. Essa última parte é o trabalho diário, e é a parte que a maioria dos programas de desenvolvimento de liderança ignora por completo.
Perguntas Frequentes sobre a Teoria do Reforço
O que é a teoria do reforço, em termos simples?
A teoria do reforço diz que o comportamento é moldado pelo que vem depois dele. Ações seguidas de consequências favoráveis são repetidas, e ações seguidas de consequências desfavoráveis ou de nada desaparecem. Ela ignora deliberadamente o que a pessoa está pensando e trabalha apenas com comportamentos observáveis e consequências observáveis.
Quais são os quatro tipos de reforço?
Estritamente, há dois tipos de reforço e duas formas de diminuir um comportamento. O reforço positivo adiciona algo desejável e o reforço negativo remove algo desagradável, e ambos aumentam o comportamento. A punição adiciona algo desagradável ou remove algo valorizado, e a extinção remove todas as consequências, e ambas o diminuem.
Reforço negativo é o mesmo que punição?
Não, e este é o erro mais comum nos textos de gestão sobre o assunto. O reforço negativo aumenta um comportamento ao remover algo desagradável, como os e-mails de cobrança que cessam quando um relatório é entregue no prazo. A punição diminui um comportamento. São opostos, e "negativo" aqui significa remover, não ruim.
Qual programação de reforço funciona melhor no trabalho?
Para aprender algo novo, o reforço contínuo ensina mais rápido. Para manter um comportamento, a razão variável é a mais forte, porque produz alto volume constante e é a mais resistente à extinção entre as quatro programações. Recompensas de intervalo fixo, como bônus trimestrais, produzem o pior padrão, com um surto antes da data e uma queda depois dela.
A teoria do reforço realmente melhora o desempenho?
Dentro de seu alcance, sim. Stajkovic e Luthans fizeram a meta-análise de 72 estudos de gestão comportamental em organizações reais e reportaram uma melhoria média de 16% no desempenho de tarefas, com dinheiro em 23%, reconhecimento social em 17% e feedback de desempenho em 10%. Esses estudos se concentram no desempenho de tarefas observáveis, então a constatação não se estende a estratégia ou a trabalho de julgamento complexo.
Qual é a principal crítica à teoria do reforço?
A crítica mais forte baseada em evidências é o efeito de superjustificação. A meta-análise de Deci, Koestner e Ryan, com 128 experimentos, constatou que recompensas tangíveis atreladas a fazer, concluir ou executar uma tarefa minaram significativamente a motivação intrínseca, enquanto o feedback positivo a aumentou. Há também objeções éticas ao condicionamento de adultos e um limite prático: o reforço fortalece exatamente o comportamento que você mediu, inclusive quando esse comportamento era o indicador errado.
Quando um gestor deve usar a teoria do reforço?
Use-a quando o comportamento for observável, a consequência puder vir rapidamente e depender somente desse comportamento, e o alvo for uma ação específica e não uma atitude. Segurança, qualidade, formação de hábitos, onboarding e trabalho repetitivo e mensurável são seus casos mais fortes.
A teoria do reforço não é uma filosofia da motivação e não pretende ser. É uma afirmação sobre consequências, e está certa a respeito delas. A disciplina que ela impõe é nomear um comportamento com precisão suficiente para vê-lo acontecer e, depois, ser honesto sobre o que sua organização faz hoje no momento seguinte. A maioria das equipes descobre que vem reforçando algo diferente do que diz valorizar.

On this page
- O que é a teoria do reforço?
- As quatro consequências
- Reforço negativo não é punição, e a maior parte dos textos de gestão erra isso
- Programações de reforço
- Modificação do comportamento organizacional: a versão aplicada
- Funciona de fato?
- As críticas sérias
- Recompensas extrínsecas podem expulsar a motivação intrínseca
- Tratar pessoas como comportamento a ser condicionado é um problema ético
- Ignorar a cognição a torna inadequada para trabalho de conhecimento complexo
- Você obtém exatamente o comportamento que mede
- Onde ela ainda funciona de verdade
- Como aplicá-la com honestidade
- Reforce o comportamento, não apenas recompense resultados
- Faça-o imediato e contingente
- Prefira reconhecimento imprevisível a um bônus programado
- Use a extinção deliberadamente e espere a explosão
- Verifique o que seu sistema já reforça
- Como ela se posiciona ao lado das outras teorias da motivação