Raciocínio Clínico e ExamesLer um estudo sem ser enganado

O valor de p responde uma pergunta que ninguém fez

O valor de p mede compatibilidade dos dados com um modelo nulo; não mede benefício, verdade nem probabilidade da hipótese.

01

O caso

Caso 1. Um ensaio comparou duas condutas e encontrou diferença com valor de p igual a 0,04. O resultado entrou numa diretriz e mudou a rotina de muitos serviços. Anos depois, alguém calculou quantos pacientes precisariam ter tido desfecho diferente para que aquele p ultrapassasse 0,05: quatro. Quatro pacientes, num estudo com pouco mais de cem participantes.

Caso 2. Outro ensaio testou uma intervenção e concluiu que ela não funcionou, porque o valor de p foi 0,065. Olhando a tabela com calma, a diferença entre os grupos era grande e clinicamente relevante — só que o estudo tinha oitenta participantes e não conseguiu estreitar a estimativa o suficiente para cruzar a linha convencional.

Os dois resultados foram comunicados pelo mesmo par de palavras: o primeiro "deu significativo", o segundo "não deu". Essas duas expressões carregam mais autoridade do que qualquer número no artigo, e é justamente essa autoridade que este capítulo desmonta.

Pare aqui e faça as perguntas que um aluno de primeiro ano tem todo o direito de fazer:

02

O modelo mental

Um p pequeno não informa a probabilidade de a hipótese nula ser verdadeira nem a importância clínica do efeito. Tamanho amostral, escolhas analíticas, multiplicidade e viés alteram sua interpretação. Um limiar rígido transforma evidência contínua em rótulo.

Em cada etapa, separe descrição, inferência e decisão. Essa distinção torna visível onde a evidência termina, onde começa o julgamento e qual dado exigiria revisão.

Comece pela definição, escrita com todas as condições que costumam ser omitidas. O valor de p é a probabilidade de obter um resultado tão extremo quanto o observado, ou mais extremo, supondo que a hipótese nula seja verdadeira e que todas as demais suposições do estudo — desenho, medida, ausência de viés, modelo estatístico — estejam corretas.

Três consequências saem direto dessa frase. Primeira: o p é uma probabilidade sobre os dados, e não sobre a hipótese. Ele não diz a chance de o tratamento funcionar, nem a chance de a conclusão estar errada. Segunda: o p depende de tudo o que está no estudo, não apenas do acaso — um p pequeno pode nascer de viés, e não de efeito. Terceira: como a conta parte da suposição de que não existe diferença, o p nunca é evidência direta a favor de uma hipótese; ele mede o desconforto dos dados com a hipótese de nada acontecer.

E existe uma quarta, a mais prática de todas: o p mistura duas coisas que a clínica precisa separar — o tamanho do efeito e a quantidade de informação. Um efeito minúsculo, medido em cem mil pessoas, produz p microscópico. Um efeito enorme, medido em vinte pessoas, produz p desconfortavelmente grande. O p sozinho não distingue as duas situações.

Agora o limiar. O número 0,05 não tem origem na biologia nem na clínica: é uma convenção adotada por conveniência histórica e mantida por hábito. E a convenção faz um estrago característico — transforma uma medida contínua em duas caixas. Um estudo com p igual a 0,049 e outro com p igual a 0,051 descrevem praticamente a mesma compatibilidade com o acaso, e são comunicados como se um tivesse descoberto algo e o outro nada.

É por isso que existe uma proposta explícita, em periódicos de metodologia, para trocar a linguagem: falar em divergência estatística no lugar de significância, porque significância sugere importância, e em intervalo de incerteza no lugar de intervalo de confiança, porque confiança sugere certeza. A mesma proposta recomenda interpretar o p de forma contínua, o que reduziria o pensamento binário e a manipulação de análises em busca do número mágico.

Há uma forma elegante de medir o quanto um resultado depende dessa linha: o índice de fragilidade. Ele conta quantos pacientes precisariam ter tido desfecho diferente para que a conclusão estatística mudasse de lado. É uma pergunta simples, e as respostas costumam assustar.

03

A pergunta central

Uma pergunta explícita delimita o que o dado pode e não pode decidir.

  • Qual hipótese e modelo geraram este p, qual é o tamanho do efeito e quantas análises foram tentadas?

    Um p pequeno não informa a probabilidade de a hipótese nula ser verdadeira nem a importância clínica do efeito. Tamanho amostral, escolhas analíticas, multiplicidade e viés alteram sua interpretação. Um limiar rígido transforma evidência contínua em rótulo.

  • O que o valor de p mede?

    Compatibilidade dos dados com a hipótese de nenhum efeito.

  • Ele diz a chance de a conclusão estar errada?

    Não: é probabilidade sobre dados, não sobre hipóteses.

  • Por que 0,05?

    Convenção histórica, sem origem biológica ou clínica.

04

Aplicação passo a passo

Reconstrua a pergunta e o método antes de ler o resultado. Depois integre efeito, incerteza, viés e aplicabilidade à decisão.

  1. 1

    Recusar as duas palavras mágicas

    Deu significativo e não deu escondem tudo o que importa.

    Erro comum: Aceitar o rótulo binário como resumo do estudo.

  2. 2

    Separar tamanho de informação

    Efeito minúsculo em amostra enorme dá p microscópico.

    Erro comum: Confundir precisão da estimativa com relevância clínica.

  3. 3

    Comparar 0,049 com 0,051

    Compatibilidade quase idêntica, comunicação oposta.

    Erro comum: Publicar ou ler os dois como achados de naturezas distintas.

  4. 4

    Olhar também o índice reverso

    Quantos faltaram para o resultado virar significativo.

    Erro comum: Ler estudo não significativo como demonstração de ausência.

  5. 5

    Comparar com a diferença mínima importante

    Mais 81,6 metros ultrapassou o mínimo perceptível.

    Erro comum: Chamar de benefício qualquer diferença estatisticamente detectada.

  6. 6

    Checar registro prévio do desfecho principal

    Apenas 44% dos ensaios definiam um único primário.

    Erro comum: Ignorar a liberdade de escolha do autor depois dos dados.

  7. 7

    Emparelhar p e tamanho do efeito sempre

    É a falha sutil que persiste até em bons periódicos.

    Erro comum: Apresentar o p isolado em apresentação de caso ou aula.

  8. 8

    Fechar pela pergunta de cabeceira

    Qual o tamanho, qual a incerteza e quantos virariam isso?

    Erro comum: Encerrar a leitura no valor de p.

05

Exemplo resolvido

Volte ao caso e aplique o modelo sem pular da seta do laudo para a conclusão. O ponto de controle é: Qual hipótese e modelo geraram este p, qual é o tamanho do efeito e quantas análises foram tentadas?

Pergunta do casoPeça que respondeResposta em uma linha
O que o p mede?Definição condicionalCompatibilidade dos dados com a hipótese de nenhum efeito
Significativo é importante?Tamanho do efeitoNão: o p mistura magnitude com quantidade de informação
Por que 0,05?ConvençãoLimiar histórico, sem fundamento biológico
Quão firme é este resultado?Índice de fragilidadeMediana de 4 pacientes em ensaios que sustentam diretrizes
Não significativo é ausência?IndecisãoÉ o estudo dizendo que não conseguiu decidir

O que o valor de p é e o que ele não é

AfirmaçãoCorreta ou incorreta
Probabilidade de os dados serem tão extremos supondo nenhum efeitoCorreta
Probabilidade de a hipótese nula ser verdadeiraIncorreta
Probabilidade de o resultado ter ocorrido por acasoIncorreta
Medida do tamanho do efeito observadoIncorreta
Medida da importância clínica do achadoIncorreta
Número que depende também do viés e do desenho do estudoCorreta
  • Índice de fragilidade menor que o número de perdas de seguimento significa que a conclusão do estudo depende do desfecho de pacientes que ninguém conseguiu avaliar.
  • A diferença mínima clinicamente importante é a régua que falta ao valor de p: ela informa se a mudança observada é do tamanho que o paciente percebe.
Duas colunas contrastando a definição condicional do valor de p com as perguntas clínicas que ele não responde.
O p responde uma pergunta legítima e estranha: ele parte da hipótese de que nada acontece e devolve uma probabilidade sobre os dados.
Faixa contínua de valores de p com a linha em 0,05 e dois marcadores quase idênticos, 0,049 e 0,051, levando a comunicações opostas.
A linha em 0,05 é convenção, e a distância entre 0,049 e 0,051 é desprezível — a distância entre as duas conclusões publicadas, não.
Grade dois por dois cruzando tamanho do efeito com resultado estatístico, com exemplos reais em dois quadrantes.
Significância e importância são eixos diferentes: só olhando os dois juntos se sabe em qual quadrante o estudo caiu.
Tabela de ensaio antes e depois de trocar o desfecho de quatro pacientes, com os índices de fragilidade medianos reais ao lado.
O índice de fragilidade conta quantos pacientes bastariam para virar a conclusão — e a mediana costuma ser um punhado de gente.
06

Limites e armadilhas

Ler o p como probabilidade da hipótese
Ele é probabilidade sobre dados, condicionada à hipótese nula.
Tratar p pequeno como prova de efeito
Viés e desenho frouxo também produzem valores pequenos.
Confundir significativo com importante
Amostra enorme torna detectável o irrelevante.
Tratar 0,05 como fronteira da natureza
É convenção histórica sobre uma medida contínua.
Chamar de negativo o estudo com p limítrofe
Indecisão não é demonstração de ausência.
Ignorar a fragilidade do resultado
A mediana em diretrizes perioperatórias é de quatro pacientes.
07

Regra prática para o atendimento

Feche o raciocínio em voz alta e deixe um plano que outra pessoa consiga revisar.

  1. 01Leia valor de p junto do efeito, intervalo, desenho, multiplicidade e plausibilidade; não use 0,05 como fronteira de verdade.
  2. 02Recusar o resumo binário do resultado
  3. 03Reconhecer a arbitrariedade do limiar
  4. 04Procurar o tamanho do efeito na tabela
  5. 05Trocar significância por divergência ao comunicar
  6. 06Perguntar quantos pacientes virariam a conclusão
08

Questões (10)

Sorteando as questões…
09

Ponte para o atendimento

No caso vinculado, transforme a dúvida em população, intervenção ou exposição, comparação, desfecho e tempo. Identifique o desenho, reconstrua o risco basal e apresente efeito absoluto, relativo e intervalo; depois localize o principal mecanismo de viés e teste a aplicabilidade.

Conclua dizendo quanto a evidência muda a decisão e qual incerteza ainda precisa ser compartilhada.

10

Revisão espaçada

7 dias

Qual é a definição completa do valor de p, com todas as suposições? Por que um efeito irrelevante pode ter p microscópico e um efeito grande pode ter p limítrofe? O que mede o índice de fragilidade e qual foi sua mediana em ensaios que sustentam diretrizes?

30 dias

Explique os dois casos de abertura por inteiro: por que um resultado com p igual a 0,04 e índice de fragilidade 4 merece confirmação antes de virar rotina, e por que um resultado com p igual a 0,065 e efeito grande não demonstra ausência de efeito. Inclua na resposta o papel da diferença mínima clinicamente importante.

O valor de p responde uma pergunta que ninguém fez — Ciclo básico | OsceLabs