Todos os artigos
HumanOS Brief 17.08.2026 Seg - Neuroestrategia

Protocolo de atualização de sistema

O mesmo conselho vale menos vindo de uma máquina · a resistência clínica à IA não é problema de acurácia, é de quem assina

Um estudo recente colocou o mesmo conselho diagnóstico na boca de um especialista humano, de uma IA de regras e de uma IA generativa, e a nota de confiança não mudou pelo conteúdo, mudou por quem falou. Clínicos não distinguem as duas IAs entre si, distinguem as duas de um humano, um sinal de que a resistência não é técnica, é social. Quem lidera adoção de tecnologia em saúde tratando isso como problema de acurácia está resolvendo a equação errada.

HUMAN OS | BRIEF

Um grupo de pesquisadores fez um experimento simples e incômodo. Pegou um conselho diagnóstico, o mesmo, palavra por palavra, e o atribuiu a três fontes diferentes diante de clínicos.

Um especialista humano, uma inteligência artificial baseada em regras e uma inteligência artificial generativa.

Pediu que avaliassem confiabilidade, competência e disposição de adotar a recomendação. O conteúdo não mudou entre as três condições.

A nota mudou. E mudou na direção que a maioria das discussões sobre adoção de IA em saúde ainda não leva a sério o suficiente.

O mesmo texto, exatamente o mesmo, foi lido como mais confiável e mais competente quando veio de um humano do que quando veio de qualquer uma das duas IAs.

Os clínicos não julgaram arquitetura, aplicaram um rótulo

Não houve diferença relevante entre as duas IAs entre si. O que sugere algo mais simples, e mais difícil de resolver, do que um problema de engenharia.

Os clínicos não estão julgando o mérito técnico específico de cada sistema. Estão aplicando um rótulo, é IA.

E o rótulo já decide boa parte da nota antes do conteúdo ser sequer avaliado.

Se a resistência fosse sobre acurácia, ela sumiria quando a acurácia fosse igual

Isso muda a pergunta que quem lidera adoção de tecnologia em saúde deveria estar fazendo.

A pergunta usual é se o sistema acerta o suficiente. É uma pergunta importante, e é a errada para explicar por que sistemas que acertam continuam sendo resistidos.

O achado diz que mesmo quando o conteúdo é idêntico ao de um humano, a origem já desconta confiança antes de qualquer avaliação de mérito acontecer.

Se a resistência fosse sobre acurácia, ela desapareceria quando a acurácia fosse igual.

Ela não desaparece.

Isso é a definição operacional de um problema social sendo tratado como se fosse um problema técnico.

E é exatamente aí que a maioria dos investimentos em adoção de IA em saúde está mirando errado o alvo.

O sistema está certo e o sistema é confiável são duas perguntas, não uma

Separe duas perguntas que a conversa sobre IA em saúde costuma fundir numa só: o sistema está certo, e o sistema é confiável.

Elas parecem a mesma coisa porque, no caso do julgamento humano sobre outro humano, elas costumam andar juntas. Quem acerta consistentemente tende a ganhar confiança.

O achado deste estudo separa as duas de um jeito que a intuição não prevê.

O conteúdo do conselho, a parte que mede se ele está certo, foi mantido idêntico nas três condições.

Só a etiqueta da fonte mudou. E mesmo assim a confiança e a competência percebida caíram para as duas versões de IA.

Isso quer dizer que parte relevante da nota de confiabilidade não estava sendo emitida pelo conteúdo. Estava sendo emitida pela categoria da fonte, antes do conteúdo ser processado.

Melhorar o modelo não fecha uma lacuna que não está no modelo

O erro que isso expõe é assumir que o caminho para adoção é melhorar o sistema até ele ficar bom o suficiente para convencer.

É um raciocínio razoável, e o estudo sugere que ele resolve só uma parte da equação.

Se o desconto de confiança já aparece quando o conteúdo é idêntico ao de um especialista humano, aperfeiçoar ainda mais o sistema não fecha necessariamente a lacuna. Porque a lacuna não está inteira no sistema.

Uma organização que só investe em acurácia, sem tocar na questão de como a recomendação é apresentada, quem a assina, que grau de transparência a acompanha, está otimizando a variável errada para o obstáculo que na verdade está bloqueando a adoção.

A pergunta que estava sendo feita não era "qual arquitetura", era "isso é IA ou é gente"

O segundo achado aprofunda o primeiro. Clínicos trataram a IA de regras e a IA generativa de forma parecida.

São arquiteturas diferentes. Uma segue lógica explícita e auditável, a outra generaliza padrões de um jeito mais opaco.

E ainda assim a diferença entre elas não moveu muito a agulha da confiança.

Isso é evidência de uma heurística de categoria, não de uma avaliação técnica caso a caso.

Quem decide não está perguntando qual arquitetura é mais confiável neste problema específico.

Está perguntando: isso é IA ou é gente.

E a resposta a essa pergunta mais simples já carrega a maior parte do peso do julgamento.

Confiar na fonte é o atalho de quem não pode reconstruir o raciocínio inteiro

Vale entender por que isso acontece, porque a explicação muda o que vale a pena tentar consertar.

Julgar se um conselho é confiável exige um trabalho de verificação que quase nunca é viável fazer por completo.

Ninguém tem tempo de reconstruir o raciocínio inteiro de um diagnóstico antes de decidir se confia nele.

Diante disso, quem decide recorre a atalhos. E um dos atalhos mais usados, em qualquer domínio de julgamento sob incerteza, é confiar na fonte como proxy para confiar no conteúdo.

Um especialista humano carrega, embutido na própria categoria, um histórico implícito de responsabilização, de reputação em jogo, de anos de formação supervisionada. Isso não é avaliado toda vez, é presumido.

A categoria "clínico humano" já vem com um lastro social que o conteúdo isolado não precisa provar de novo.

A categoria "IA" ainda não vem pré-carregada com crédito, e é isso que o experimento mediu

Uma IA, de qualquer arquitetura, ainda não carrega esse lastro embutido na categoria, para a maioria de quem decide.

Não é que o clínico pense conscientemente "esta IA nunca foi supervisionada". É que a categoria em si não vem pré-carregada com o mesmo crédito de confiança que a categoria humana carrega.

Então o julgamento parte de um ponto mais baixo, mesmo quando o conteúdo diante dos olhos é idêntico.

É por isso que a diferença entre IA de regras e IA generativa importou tão pouco.

A distinção que estava sendo feita não era entre arquiteturas. Era entre a categoria que já vem com lastro embutido e a categoria que ainda não vem.

A aversão ao algoritmo não é nova, o que é novo é o desenho que isola a origem

Isso é o que a literatura de decisão chama de aversão ao algoritmo.

A tendência de confiar menos numa recomendação depois de saber que ela veio de um sistema automatizado, mesmo quando o sistema tem desempenho igual ou melhor do que o humano equivalente.

O fenômeno não é novo. O que este estudo faz é mostrar sua versão específica em saúde, com um desenho que isola a origem como variável, mantendo o conteúdo fixo.

É um desenho que deixa pouca margem para outra leitura.

A diferença observada não pode ser atribuída à qualidade do conselho, porque o conselho era o mesmo.

O que este estudo prova, e o que ele ainda não prova

É importante ser preciso sobre o que este resultado sustenta e o que ele ainda não sustenta.

Tratar um achado inicial como veredito fechado é o mesmo tipo de erro de excesso de confiança que a própria pesquisa está descrevendo em outro plano.

O que o estudo sustenta com solidez é o desenho comparativo. O mesmo conselho, três atribuições de fonte, uma diferença de nota que só pode ser explicada pela origem, e não pelo conteúdo. Essa é a força do experimento: ele isola a variável que importa.

O que ainda pede cautela é a extensão do achado. O próprio estudo se apresenta como pesquisa em andamento, um trabalho que está no meio do caminho entre a primeira evidência e a validação mais ampla.

Isso significa que é sólido tratar a direção do efeito como real, e como um problema que quem lidera adoção de IA em saúde precisa levar a sério.

E é prematuro tratar a magnitude exata, ou a generalização para todo contexto clínico e toda cultura organizacional, como estabelecida além de dúvida.

O resultado nulo sobre transparência é informação, não decepção

O que também vale marcar é que o estudo testou a variável de transparência sobre a confiabilidade do caso.

Ou seja: se dizer ao clínico o quão confiável aquele conselho específico é muda a nota de credibilidade e a intenção de adoção.

O resultado foi nulo. A divulgação de confiabilidade por caso não produziu efeito mensurável sobre confiança, competência percebida ou intenção de adoção.

Isso não encerra a pergunta sobre transparência, mas descarta a versão mais simples da resposta.

Avisar o quão confiável um conselho é, caso a caso, não dissolve sozinho o desconto que a origem já aplicou antes desse aviso chegar.

É um resultado que reforça a leitura central deste ensaio. O desconto de confiança mora na categoria da fonte, não numa lacuna de informação que se preenche com mais dado sobre aquele caso específico.

Um sistema tecnicamente superior sendo usado abaixo do potencial

O custo de não separar essas duas coisas, acurácia e confiança social, aparece tarde e caro.

A primeira forma é o investimento mal direcionado. Uma organização que aposta tudo em melhorar o modelo, sem desenhar como a recomendação chega, quem a assina, que camada de transparência a acompanha, resolve uma variável que talvez já estivesse boa o suficiente.

E deixa intacta a variável que estava de fato bloqueando a adoção.

O resultado é um sistema tecnicamente superior sendo usado abaixo do potencial.

Porque ninguém tratou o desconto de confiança como um problema de desenho organizacional. Tratou como um problema de engenharia que mais uma versão do modelo iria resolver.

Adoção de fachada

O sistema implantado, a confiança não

A segunda forma é mais sutil e mais cara a longo prazo: a inconsistência entre o discurso de adoção e o comportamento real de quem decide no chão.

Uma liderança pode anunciar publicamente que confia na ferramenta.

E mesmo assim, na hora da decisão individual, aplicar o desconto que este estudo mediu, porque o desconto opera num nível que a intenção declarada não controla sozinha.

Isso produz adoção de fachada. O sistema está implantado, e o uso efetivo, na hora que importa, continua mediado pela mesma cautela que precede qualquer recomendação rotulada como IA.

Medir adoção pela implantação, e não pelo comportamento real de confiança na hora da decisão, esconde esse custo.

Esconde até ele aparecer como resultado abaixo do esperado, tarde demais para corrigir com uma nova versão de modelo.

Ler resistência social como falta de capacitação técnica ataca a causa errada

A terceira forma é a organizacional. Uma cultura que não nomeia o desconto de confiança tende a atribuí-lo, sem querer, ao lugar errado.

A resistência de quem usa a ferramenta é lida como falta de capacitação técnica.

Quando na verdade é uma resposta social esperada, e treinada, a uma categoria que ainda não carrega o mesmo lastro embutido que a categoria humana carrega.

Treinar mais sobre como o modelo funciona tecnicamente ataca uma causa que talvez não seja a principal.

E deixa sem resposta a causa que este estudo está sinalizando.

Três movimentos para quem lidera adoção de IA em saúde

Tratar o desconto de confiança como variável de desenho, e não como ruído a ser tolerado até a próxima versão do modelo, muda o que vale a pena investir primeiro.

Só uma das duas respostas se resolve com mais uma versão do modelo

Nenhum desses movimentos promete eliminar o desconto de confiança, e seria imprudente prometer isso a partir de uma única pesquisa em andamento.

O que eles fazem é parar de gastar o orçamento inteiro de adoção numa variável, a acurácia, que talvez já não seja o gargalo.

E passar a testar deliberadamente a variável que este achado coloca em evidência: a confiança que se atribui a uma fonte antes mesmo de avaliar o que ela diz.

A pergunta que fica não é se o seu sistema é bom o suficiente.

É se a sua organização sabe distinguir quando a resposta que falta ao sistema é técnica e quando é social. Porque só a primeira se resolve com mais uma versão do modelo.

Dicas de Leitura

  • Dietvorst, Berkeley J., Joseph P. Simmons, & Cade Massey. "Algorithm aversion: People erroneously avoid algorithms after seeing them err." Journal of Experimental Psychology: General, 144(1), 2015. O trabalho seminal que nomeou e mediu o fenômeno da aversão ao algoritmo, mostrando que ele é contingente, as pessoas evitam algoritmos depois de vê-los errar, mesmo quando o algoritmo erra menos que o humano equivalente, o pano de fundo teórico que ajuda a situar por que a origem de um conselho pesa tanto quanto, ou mais, do que seu conteúdo.

Referências (O Fundamento)

  1. Spatscheck, N., Airich, K., & Wirsing, B. (2026). Why clinicians still trust humans over (Gen)AI systems: The anatomy of transparency and algorithm aversion in healthcare. Proceedings of the European Conference on Information Systems (ECIS 2026). https://aisel.aisnet.org/ecis2026/hit/hit/11/
  2. Dietvorst, B. J., Simmons, J. P., & Massey, C. (2015). Algorithm aversion: People erroneously avoid algorithms after seeing them err. Journal of Experimental Psychology: General, 144(1), 114-126.

Gérson Neto. HumanOS Brief.

Dr. Gérson Neto · HumanOS Brief