Outras EspecialidadesMedicina Preventiva e Saúde Coletiva

Quem entrou, quem mediu, o que mais mudou

Vieses, confundimento e validade: viés de seleção, viés de aferição, confundimento, mediador, modificação de efeito e validade externa

Você não vai desenhar estudo nenhum. Vai ser convencido por um toda semana — pelo representante, pelo preceptor, pela manchete. Este capítulo é o pequeno número de perguntas que separam o achado que muda conduta do achado que só parece que muda.

Fontes deste capítulo

Brasil. Ministério da Saúde. Secretaria de Ciência, Tecnologia e Insumos Estratégicos. Departamento de Ciência e Tecnologia. Diretrizes metodológicas: elaboração de revisão sistemática e metanálise de estudos observacionais comparativos sobre fatores de risco e prognóstico. Brasília: Ministério da Saúde, 2014. 132 p. ISBN 978-85-334-2171-4.

Brasil. Ministério da Saúde. Secretaria de Ciência, Tecnologia e Insumos Estratégicos. Departamento de Ciência e Tecnologia. Diretrizes metodológicas: elaboração de revisão sistemática e metanálise de estudos de acurácia diagnóstica. Brasília: Editora do Ministério da Saúde, 2014. 116 p. ISBN 978-85-334-2129-5.

Brasil. Ministério da Saúde. Secretaria de Atenção à Saúde. Departamento de Atenção Básica. Rastreamento. Brasília: Ministério da Saúde, 2010. (Série A. Normas e Manuais Técnicos. Cadernos de Atenção Primária, n. 29). ISBN 978-85-334-1729-8.

Instituto Nacional de Câncer José Alencar Gomes da Silva. Detecção precoce do câncer. Rio de Janeiro: INCA, 2021. 72 p. ISBN 978-65-88517-22-2 (versão eletrônica).

Brasil. Ministério da Saúde. Relação Nacional de Medicamentos Essenciais: Rename 2024. Brasília: Ministério da Saúde, 2024.

01

Responda antes de ler

Um representante apresenta uma coorte com 84 mil participantes que encontrou associação entre o uso de um suplemento e menor mortalidade cardiovascular, com risco relativo de 0,79 e intervalo de confiança de 95% de 0,74 a 0,84. Ele argumenta que, com esse número de participantes e um intervalo tão estreito, o achado é seguro. Qual é a avaliação correta desse argumento?

02

O paciente que você vai ver

Quinta-feira, sete e cinco. A enfermaria de clínica médica tem vinte e dois leitos, fica no segundo andar de um hospital de ensino que atende a microrregião inteira, e a passagem de plantão acontece de pé, no corredor, porque a sala de prescrição tem quatro cadeiras e nove pessoas. Você é o interno da equipe A. A folha que a enfermeira Guilhermina Jordão entrega tem os vinte e dois nomes numa coluna e, na coluna de observações, três palavras no máximo para cada um.

O leito 9 é da dona Olinda Jaques, 71 anos, aposentada, que mora com a filha a quarenta quilômetros daqui. Entrou anteontem com pneumonia adquirida na comunidade, chegou taquipneica e hipotensa, foi para a sala de estabilização e subiu para a enfermaria na madrugada de ontem. Está no segundo dia de antibiótico, ainda com cateter nasal a 4 L/min, ainda com frequência respiratória de 26. Não piorou. Também não melhorou. É exatamente o tipo de paciente sobre quem alguém, hoje, vai propor fazer alguma coisa a mais.

Sete e vinte. A residente do segundo ano, Auta Crisóstomo, senta ao seu lado com o notebook aberto e a expressão de quem dormiu pouco por vontade própria. Ela levantou, um por um, os prontuários de todos os pacientes internados com pneumonia grave nesta enfermaria nos últimos três anos. São 118. Separou os que receberam um esquema adjuvante que um staff da casa começou a usar em 2023 — corticoide, vitamina C e tiamina, os três juntos — dos que não receberam. Contou os óbitos. No grupo que recebeu, morreram menos. A diferença é grande, e ela quer duas coisas: submeter o trabalho ao congresso da especialidade e começar o esquema hoje, na dona Olinda.

Você olha a planilha. Os números estão certos. Ela contou direito, não inventou paciente nenhum, não perdeu nenhum prontuário. Todo o levantamento é verdadeiro. E mesmo assim a conclusão pode estar errada — não por fraude, não por descuido, não por conta mal feita, mas por causa de algo que aconteceu antes de a planilha existir: alguém, em cada um daqueles 118 casos, decidiu quem receberia o esquema. E essa pessoa decidiu olhando para o paciente.

Nove e quarenta. A preceptora do dia, doutora Laudelina Gaeta, comenta na visita que no serviço onde trabalhou antes um programa de detecção precoce fez a sobrevida em cinco anos saltar de quarenta e poucos por cento para quase oitenta. Ela conta isso como quem conta uma vitória, e é sincera. O número existe, foi medido, está num relatório. A pergunta que ninguém faz na visita é se alguém morreu menos, ou se as pessoas apenas passaram a saber mais cedo que iam morrer.

Onze e dez, ambulatório. Seu Amélio Rago, 58 anos, hipertenso, cinco anos de acompanhamento, chega com o celular já desbloqueado e a tela virada para você. A manchete diz que quem toma café tem menos infarto. Ele parou o café por conta própria há dois anos, quando um sobrinho disse que fazia mal ao coração, e agora quer autorização para voltar. A reportagem cita um estudo de verdade, com dezenas de milhares de pessoas, publicado numa revista de verdade. A pergunta dele é simples e a resposta não é.

Uma da tarde. Peregrino Ferrari, representante, encontra você no corredor da farmácia e deixa duas coisas: um artigo impresso, grampeado, com um parágrafo já marcado de amarelo no resumo, e um cartão de bolso plastificado com o mesmo resultado em letras grandes. O parágrafo amarelo traz uma razão de chances ajustada, um intervalo de confiança que não cruza o 1, e o verbo mais caro da literatura médica: reduz.

Quatro coisas em seis horas. Uma planilha honesta feita por uma colega competente, uma lembrança verdadeira de uma preceptora experiente, uma manchete que descreve corretamente um estudo real e um resumo cujos números ninguém falsificou. Nenhuma delas é mentira. Todas as quatro podem levar você a uma decisão errada sobre uma pessoa específica — e três delas envolvem, hoje, um paciente com nome, leito e família na sala de espera.

Você não vai desenhar estudo nenhum. Provavelmente nunca vai calcular um escore de propensão, nunca vai decidir o tamanho de amostra de um ensaio, nunca vai preencher um formulário de comitê de ética como pesquisador principal. Isso é ofício de outra gente, e o capítulo que ensina qual desenho responde a qual pergunta é o O desenho decide a pergunta, a quarta posição desta apostila. O que você vai fazer, toda semana, pelo resto da vida profissional, é ser convencido por um estudo que você não desenhou, não conduziu e não vai reproduzir — no corredor, em três minutos, com o paciente esperando.

Para isso não serve saber a taxonomia dos desenhos de cor. Serve um número pequeno de perguntas, sempre as mesmas, feitas sempre na mesma ordem, que separam o achado que muda conduta do achado que só parece que muda. São três perguntas sobre o estudo — quem entrou, quem mediu, o que mais mudou junto — e uma quarta sobre você: isso vale para o paciente que está no meu leito 9?

Deste capítulo em diante, quando alguém disser que um estudo mostrou alguma coisa, você vai ter onde encostar a pergunta. E vai descobrir uma assimetria útil: dos três modos de errar, dois se decidem no momento em que o estudo é feito e não se consertam depois; um deles, o confundimento, é o único que ainda pode ser tratado na análise. É por isso que ele é o primeiro a ser perguntado quando o resultado surpreende — e é por isso que ele é o que mais aparece como desculpa, como conserto e como ilusão de conserto.

03

Quem adoece disso

A primeira coisa a saber sobre vieses é que quem escreve as regras do assunto admite não ter chegado a acordo sobre elas. Existe desde 2014 uma diretriz metodológica federal dedicada só à revisão sistemática de estudos observacionais, e ela registra o estado da arte com uma franqueza que raramente aparece em documento oficial: existem muitas ferramentas para avaliar risco de viés, não há consenso sobre a melhor, e os critérios divergem entre elas — de modo que um mesmo estudo pode ser classificado de maneira diferente dependendo da ferramenta que se use.

Os números que o próprio documento reúne dão a dimensão. Um levantamento identificou 12 ferramentas em uso para estudos observacionais, das quais 6 serviam a revisões sistemáticas. Outro partiu de 182 instrumentos, escolheu as 14 melhores e recomendou 6. Entre os dois levantamentos, apenas 3 ferramentas apareciam em comum. Um terceiro avaliou 86 instrumentos específicos para risco de viés em estudo observacional e terminou sem recomendar nenhum, sugerindo apenas evitar os que têm poucos domínios, os que não são específicos para o desenho, os que não descrevem como foram construídos e os que nunca foram validados.

Isso não é um detalhe burocrático. Significa que a pergunta "este estudo tem viés?" não tem resposta padronizada nem para quem faz revisão sistemática em tempo integral, com dois avaliadores independentes e semanas de prazo. Você vai enfrentar a mesma pergunta no corredor, sozinho, em três minutos. A conclusão prática não é desistir: é que a sua ferramenta tem de ser curta, feita de perguntas que você consiga responder lendo a seção de métodos, e não uma pontuação. Aliás, a diretriz brasileira de acurácia diagnóstica é explícita ao dizer que escore de qualidade não é recomendado — um número final esconde que a importância de cada item e a direção do viés mudam conforme o contexto.

O tamanho do estrago também já foi medido em população brasileira. Numa metanálise sobre tabagismo materno e desmame precoce, os autores classificaram cada estudo conforme o modelo estivesse não ajustado, parcialmente ajustado ou totalmente ajustado para idade, raça e nível socioeconômico. Só o fato de os estudos ajustarem por variáveis diferentes respondia por 14,4% da heterogeneidade entre eles. Ou seja: parte relevante da discordância entre estudos que perguntam a mesma coisa não vem da biologia, nem do acaso, nem da população — vem da lista de variáveis que cada autor decidiu descontar.

Há uma restrição aritmética escondida aí que vale guardar. Para explorar a heterogeneidade por meta-regressão, a régua usual é de cerca de 10 estudos para cada variável ajustada. Como a maioria das metanálises reúne um número moderado de estudos, na prática quase nunca há material para testar todas as covariáveis que interessam. Traduzindo para o corredor: quando alguém lhe disser que a metanálise "controlou" para um conjunto de fatores, pergunte com quantos estudos — a resposta costuma inviabilizar a afirmação.

No terreno do rastreamento, o Caderno de Atenção Primária n. 29 guarda o exemplo mais didático de quanto um detalhe de seleção move um resultado. O primeiro ensaio de rastreamento de câncer colorretal usou voluntários e uma técnica de reidratação de lâminas que elevou muito a taxa de colonoscopia, e encontrou 33% de redução relativa de morte pela doença. Os dois ensaios seguintes, feitos na comunidade e sem a reidratação, encontraram 15% e 18%. Três estudos, a mesma pergunta, a mesma doença, e o primeiro com o dobro do efeito dos outros dois.

E o mesmo caderno mostra, com uma aritmética que cabe num guardanapo, como um teste sozinho — sem tratamento nenhum, sem nada que cure ninguém — transforma a estatística de uma população. Numa população de 100.000 pessoas sem rastreamento havia 5 casos e 2 mortes, uma sobrevida de 60%. Introduzido o teste, os casos passam a 8, porque três lesões que nunca dariam sintoma foram encontradas; as mortes continuam 2; e a sobrevida sobe para 75%. Nenhuma vida foi salva. A conta que refizemos deste exemplo, e o erro que encontramos no texto que a comenta, estão adiante, no bloco de critérios.

Por fim, a estatística que ninguém publica: a frequência com que a conclusão de um estudo chega até você já traduzida por alguém interessado no verbo. Entre o artigo e a sua decisão há pelo menos três traduções — o resumo, o release e a conversa. Cada tradução perde as condições e conserva o efeito. O resumo perde quem foi excluído; o release perde o desenho; a conversa perde o intervalo de confiança. O que sobra, no cartão plastificado que o representante deixou no corredor, é um número e um verbo — e é contra essa versão final, e não contra o artigo, que você precisa de defesa.

04

Por que acontece o que acontece

Um estudo produz um número. Esse número erra de duas maneiras muito diferentes, e a diferença entre elas é a primeira coisa a fixar. O erro aleatório é o que acontece porque a amostra é finita: se o estudo fosse refeito com outras pessoas, o número sairia um pouco diferente, ora para cima, ora para baixo. Ele é o que o intervalo de confiança descreve, e o que aumentar o tamanho da amostra reduz. O viés é erro sistemático: uma tendência que empurra o resultado sempre para o mesmo lado. Ele não é descrito pelo intervalo de confiança, e aumentar a amostra não o corrige — apenas o mede com mais precisão.

Essa é a armadilha central do capítulo, e vale escrever no alto de qualquer resumo que você leia: amostra grande não protege contra viés. Ao contrário: quanto maior a amostra, mais apertado fica o intervalo em volta do lugar errado — e estimativa apertada convence mais do que estimativa frouxa. Cem mil pessoas mal selecionadas produzem uma certeza estatística sobre a resposta errada. A definição que o Caderno n. 29 adota é exatamente essa: viés é qualquer tendência na coleta, na análise, na interpretação, na publicação ou na revisão dos dados que leve a conclusões sistematicamente diferentes da verdade.

Agora as portas por onde a tendência entra. São três, e cada uma corresponde a um momento do estudo. A primeira é a porta de entrada: quem foi parar dentro do estudo, e por que essa pessoa e não outra. Se a regra que decidiu quem entra tem alguma relação com a exposição e com o desfecho ao mesmo tempo, os grupos já nascem diferentes por um motivo que não é o que se quer estudar. A segunda é a porta da medida: como a exposição e o desfecho foram aferidos, e se foram aferidos do mesmo jeito nos dois grupos. A terceira não é uma porta do estudo, é uma propriedade do mundo: junto com a exposição, alguma outra coisa mudou — e essa outra coisa também causa o desfecho.

A terceira é o confundimento, e ela tem um estatuto diferente das outras duas. Viés de seleção e viés de aferição são erros de execução: acontecem quando o estudo é feito, ficam gravados nos dados, e nenhuma análise posterior os desfaz — no máximo se estima o tamanho do estrago. Confundimento não é um defeito de execução; é a estrutura causal do mundo aparecendo dentro de um estudo que não a controlou. Por isso, e só por isso, ele pode ser tratado depois: se a variável foi medida, existe conta que a desconte. Esta é a assimetria prática do capítulo — dos três, o confundimento é o único que ainda tem conserto no fim, e é por isso que é o primeiro a perguntar quando o resultado surpreende.

Mas repare na condição, porque ela é a fonte de quase toda ilusão de segurança em medicina: se a variável foi medida. O ajuste estatístico só alcança o que está em alguma coluna da planilha. O confundidor que ninguém pensou, ou pensou e não coletou, ou coletou de forma grosseira — gravidade anotada como "regular" — continua inteiro dentro do resultado depois do ajuste, e o resultado ajustado tem exatamente a mesma aparência de um resultado limpo. A palavra "ajustado" no resumo não é um certificado; é a lista das variáveis que o autor conseguiu medir.

No caso da planilha da Auta, o confundidor mais forte não tem coluna nenhuma. Quem recebeu o esquema adjuvante foi escolhido por um médico, à beira do leito, olhando para o paciente. Se esse médico oferecia o esquema aos que pareciam ter chance — porque não faz sentido acrescentar coisa a quem já está em cuidados de fim de vida —, então estar no grupo tratado é, em si, um sinal de prognóstico melhor, e a menor mortalidade do grupo tratado estava decidida antes de qualquer medicação entrar na veia. Se ele oferecia aos mais graves, porque eram os que preocupavam, o viés corre para o outro lado e o esquema pode parecer inútil sendo bom. Nos dois casos, o número que sai da planilha mede o julgamento de quem indicou, e não o efeito do que foi indicado.

Falta a quarta pergunta, que não é sobre erro nenhum — é sobre transporte. Um estudo pode estar internamente impecável: seleção limpa, medida cega, confundimento tratado, resultado verdadeiro para as pessoas que estavam nele. Isso é validade interna. Se aquele resultado vale para o seu paciente, que talvez não parecesse nem um pouco com os do estudo, é outra pergunta, e chama-se validade externa. A diretriz brasileira de acurácia diagnóstica separa os dois eixos com clareza: viés distorce a estimativa do estudo; variabilidade entre populações e cenários não enviesa nada, mas limita a aplicabilidade. São problemas diferentes, com soluções diferentes, e confundi-los faz você recusar estudos bons e aceitar estudos irrelevantes.

A ordem importa. Validade interna primeiro, porque se o número está errado não interessa em quem ele valeria. Validade externa depois, e sempre — porque um número certo sobre outra gente continua sendo um número sobre outra gente. Dona Olinda tem 71 anos, mora a quarenta quilômetros do hospital, e depende de a filha conseguir folga para trazê-la de volta. Se o estudo que vai mudar a conduta dela excluiu quem tem mais de 70 anos, o resultado pode ser verdadeiro e ainda assim não ser dela.

Sala de espera de unidade de saúde: as primeiras fileiras de cadeiras estão iluminadas e as pessoas nelas aparecem nítidas; as fileiras do fundo estão em penumbra e as pessoas ali são apenas silhuetas.
A diferença de iluminação representa quem aparece com clareza nos dados e quem fica pouco representado. Critérios de inclusão, perdas de seguimento e formas de mensuração precisam ser examinados para interpretar os resultados de um estudo.
05

Como se apresenta de verdade

Viés não chega até você com o nome dele. Chega vestido de resultado, quase sempre com um verbo forte e um número redondo, e quase sempre por boca de alguém que acredita no que está dizendo. As seis formas abaixo cobrem a maior parte do que um interno encontra num mês de enfermaria e ambulatório. Vale reconhecê-las pela aparência, porque a aparência já indica onde procurar o defeito.

Uma advertência antes: nenhuma dessas formas é desonesta por natureza. O representante pode estar entregando o melhor estudo que existe sobre o assunto; a planilha do colega pode ser o começo de uma pesquisa boa; a preceptora pode estar certa. Reconhecer a forma não é decidir que a informação é falsa — é saber qual pergunta fazer primeiro.

Competência ao final deste capítulo. Avaliar vieses, ajuste e validade externa antes de mudar tratamento por um artigo. No internato, demonstre o raciocínio e a execução supervisionada: o que verificar, o que fazer agora, quando chamar ajuda e como garantir continuidade.

O reprint com o parágrafo marcado de amarelo

É a apresentação mais reconhecível e a menos perigosa, justamente porque o interesse está declarado. O material vem impresso, grampeado, com um trecho do resumo já destacado, e ao lado dele um cartão de bolso que repete o número em corpo maior. O parágrafo amarelo traz sempre a mesma tríade: uma medida de associação, um intervalo de confiança que não cruza o valor nulo, e um verbo de causa.

O que a marcação faz não é mentir: é escolher. O amarelo está no resultado e nunca nos métodos. Nenhum representante já destacou a frase que diz quem foi excluído do estudo, nem a que diz que o desfecho primário não atingiu significância e o que está sendo mostrado é um desfecho secundário, nem a que diz que a comparação foi com controle histórico. A defesa é mecânica e leva trinta segundos: leia primeiro o parágrafo que não está marcado. Se o material impresso não traz a seção de métodos, isso já é uma informação sobre o material.

Uma pista específica: quando a medida apresentada é ajustada e o texto não diz para quê, o ajuste está sendo usado como selo de qualidade e não como informação. A lista de variáveis ajustadas é curta e cabe numa frase; se ela foi omitida, foi omitida por alguma razão.

A planilha de prontuário feita por um colega

Esta é a mais delicada, porque quem a traz é competente, trabalhou de graça e está do seu lado. O formato é sempre parecido: um levantamento retrospectivo de prontuários de um período, dois grupos separados por terem ou não recebido alguma coisa, e uma contagem de desfechos. Os dados são reais e o esforço é honesto.

O defeito não está nos dados: está no que os separou. Num levantamento de prontuário, quem entrou em cada grupo foi decidido por um médico, no passado, olhando para aquele paciente. Nenhuma coluna da planilha registra o que ele viu. A pergunta que abre o problema é sempre a mesma, e é melhor fazê-la como pergunta do que como objeção: quem decidia quem recebia, e com base em quê?

Há um segundo defeito frequente e mais discreto: o período. Se o esquema começou a ser usado em determinado ano, comparar quem recebeu com quem não recebeu é, em parte, comparar dois períodos do serviço — e entre eles mudaram o protocolo de sepse, a equipe de enfermagem, o antibiótico da casa e o tempo até a primeira dose. Tudo isso muda desfecho, e nada disso está na planilha.

O que dizer a esse colega está no bloco de conversa, e a resposta certa quase nunca é que o trabalho não presta: é qual pergunta esse desenho ainda responde bem, e qual ele não responde de jeito nenhum.

A frase que começa com “no meu serviço a gente vê”

A experiência clínica acumulada é uma fonte legítima de hipótese e uma fonte terrível de estimativa de efeito, por um motivo estrutural: o serviço só vê quem chega, quem fica e quem volta. Quem melhorou sozinho e nunca voltou não está na memória de ninguém; quem piorou e procurou outro serviço também não. A amostra que forma a impressão do preceptor foi selecionada por um mecanismo invisível e permanente.

A variante mais comum e mais convincente dessa forma é a que a doutora Laudelina trouxe na visita: um programa foi implantado e a sobrevida subiu. A sobrevida é a medida mais vulnerável de toda a medicina, porque ela é contada a partir do diagnóstico — e qualquer coisa que anteveja o momento do diagnóstico a aumenta sem prolongar vida nenhuma.

Quando a afirmação vier em sobrevida, a pergunta é uma só: e a mortalidade? Sobrevida em cinco anos é uma medida que começa a contar no dia em que alguém decidiu chamar aquilo de doença. Mortalidade na população conta mortes num denominador que não depende de quando o diagnóstico foi feito.

A manchete no celular do paciente

Chega com a tela já virada para você e com uma pergunta prática embutida: posso voltar a tomar café, posso parar o remédio, devo pedir esse exame. O texto costuma descrever corretamente um estudo real. O que se perde no caminho entre o artigo e a manchete é sempre o mesmo: o desenho vira apenas “um estudo”, a associação vira causa, e a população estudada some.

Duas perguntas resolvem quase todos os casos, e você pode fazê-las na frente do paciente sem constrangimento. A primeira: o estudo acompanhou quem já tinha o hábito, ou sorteou quem passaria a ter? A segunda: quem tem e quem não tem o hábito diferem em mais alguma coisa que também mexe com o coração? No caso do café, a resposta clássica da segunda pergunta é o cigarro — e é exatamente o exemplo que a diretriz metodológica do Ministério da Saúde usa para explicar variável de confusão.

Não caia na tentação de encerrar dizendo que aquilo é só associação. É verdadeiro e é inútil: o paciente veio com uma decisão para tomar, e vai tomá-la com você ou sem você. O bloco de conversa traz o que dizer no lugar.

O resumo que só publica a medida ajustada

Quando o resumo publica apenas a medida ajustada, o texto completo pode esclarecer como o ajuste foi construído e se a estimativa bruta também está disponível. A comparação é útil, mas não é um teste diagnóstico de confundimento.

Coletar medidas brutas e ajustadas quando disponíveis, identificando população analisada, covariáveis e estimando. A diferença numérica não quantifica automaticamente confundimento: pode refletir controle de confundidores, ajuste inadequado, diferenças de amostra e, para OR, não colapsabilidade. Estimativas parecidas não provam ausência de confundimento; estimativas diferentes não demonstram, por si, sua causa.

Quando só há o ajustado, procure a lista de covariáveis nos métodos e leia-a como quem lê uma prescrição: cada item ali é uma escolha do autor, e a ausência de um item é uma escolha também.

A recomendação que anda em círculo

A última forma é institucional e a mais difícil de enxergar, porque vem com autoridade. Uma recomendação cita um consenso, o consenso cita uma revisão narrativa, a revisão narrativa cita dois estudos observacionais, e um deles é o mesmo que já sustentava a recomendação anterior. A cadeia parece profunda e é rasa.

O Caderno n. 29 registra o desconforto com essa cadeia de forma direta ao justificar por que adotou recomendações de força-tarefa independente em vez das de sociedades de especialidade: consensos de corporações e associações médicas sofrem influência do mercado e das práticas de especialistas focais, que não se transferem bem para o trabalho da atenção primária. É uma frase de 2010 num documento federal, e continua desconfortável.

A defesa aqui é uma só e é trabalhosa: puxar uma referência para trás. Não todas — uma. Quando a recomendação for pesada e recente, abra a citação que a sustenta e veja se ela diz o que a recomendação afirma que ela diz. Numa parte relevante das vezes ela diz menos.

06

Como fechar o diagnóstico

Aqui está a anatomia. Cada seção abaixo trata de um modo de errar, e cada uma termina no mesmo lugar: o que você faz com o número depois de reconhecer o problema. Duas advertências de fronteira antes de começar, porque elas economizam confusão.

A primeira: qual viés é doméstico de qual desenho — perda de seguimento na coorte, seleção de controles no caso-controle, critério de elegibilidade no ensaio — está organizado por desenho no capítulo O desenho decide a pergunta, quarta posição desta apostila. Ele é dono do desenho; este capítulo é dono do que dá errado dentro de qualquer um deles. Por isso a organização aqui não é por desenho, e sim pelo momento em que o erro entra: na entrada, na medida, ou na estrutura causal do mundo. Se você quiser a tabela por desenho, é lá.

A segunda: validade interna versus externa, viés de aferição, a diferença entre confundidor e mediador e o viés de verificação não têm dono em nenhum capítulo deste nível. Este capítulo os assume e declara que os assumiu.

As duas validades, e por que a ordem entre elas importa

Todo julgamento de um estudo tem dois andares. O primeiro pergunta se o número está certo para as pessoas que estavam no estudo. Isso é validade interna, e é onde moram os vieses. O segundo pergunta se aquele número, mesmo certo, vale para o seu paciente. Isso é validade externa, e ali não há viés nenhum — há apenas gente diferente.

A diretriz metodológica brasileira de acurácia diagnóstica faz essa separação com uma frase que vale decorar em tradução livre: viés distorce a estimativa e produz resultado errôneo; variabilidade entre estudos — população incluída, cenário, protocolo, definição da condição-alvo — não enviesa a estimativa, mas limita a aplicabilidade do teste na prática. São dois problemas, com duas soluções. Contra viés, não há conserto no consumidor: o estudo é bom ou não é. Contra falta de aplicabilidade, há uma decisão sua: aplicar mesmo assim, com o desconto explícito, ou não aplicar.

O checklist Downs and Black, que a mesma diretriz apresenta, dedica três das suas 27 questões à validade externa, e todas as três perguntam a mesma coisa por caminhos diferentes: os achados são generalizáveis para a população que tem as mesmas condições da que foi incluída? Repare no cuidado da formulação — não é para qualquer população, é para uma população com as mesmas condições. Generalizar é um ato de julgamento clínico, não um resultado do estudo.

A ordem entre as duas não é opcional. Validade interna primeiro, porque discutir para quem vale um número errado é perder tempo duas vezes. Validade externa sempre depois, e sempre — porque o erro mais comum na enfermaria não é aceitar um estudo ruim, é aceitar um estudo bom que fala de outra gente. Um ensaio impecável em pacientes de 45 a 70 anos, sem demência, sem doença renal crônica avançada, recrutados em centros terciários, é um ensaio impecável sobre pessoas que não são a dona Olinda.

Uma consequência prática que quase ninguém aplica: os critérios de exclusão são o mapa da validade externa, e eles estão nos métodos, não nos resultados. Ler a lista de exclusão de um ensaio leva quarenta segundos e responde de imediato se aquele estudo tem alguma coisa a dizer sobre o paciente à sua frente. Se o seu paciente teria sido excluído do estudo, o estudo não fala dele — e isso não é um defeito do estudo, é um limite dele.

Quem entrou: viés de seleção e as três formas em que ele aparece

O Caderno de Atenção Primária n. 29 define viés de seleção de um jeito que serve para tudo: ele está presente quando as amostras que serão comparadas têm características diferentes capazes de influenciar o desfecho. A frase é curta e esconde a parte difícil, que é reconhecer a regra invisível de entrada. Em quase todo estudo alguém decidiu quem entra — um pesquisador, um médico, um sistema de encaminhamento, ou o próprio paciente ao se voluntariar. Se essa regra tem relação, ao mesmo tempo, com a exposição e com o desfecho, os grupos já nascem diferentes.

A primeira forma é o voluntário saudável, e ela é a mais subestimada porque parece um detalhe operacional. O mesmo caderno descreve o tipo: quem se voluntaria tende a aderir mais às orientações, a ser mais saudável, a se preocupar mais com a própria saúde, e tem mortalidade menor não só pela doença estudada, mas por tudo. É por isso que um efeito aparece em estudo com voluntários e encolhe quando o mesmo procedimento é levado à comunidade.

O exemplo que o caderno traz é honesto e vale examinar com cuidado, porque ele ensina duas coisas. O primeiro ensaio de rastreamento de câncer colorretal usou voluntários e uma técnica de reidratação de lâminas que elevou muito a taxa de colonoscopia, e encontrou 33% de redução relativa de morte pela doença; os dois ensaios seguintes, na comunidade e sem reidratação, encontraram 15% e 18%. A primeira lição é o tamanho: a diferença entre 33% e 15% é a diferença entre adotar e não adotar. A segunda lição é mais sutil e o próprio texto oficial a deixa em aberto — nesse exemplo, dois mecanismos mudaram juntos, o tipo de participante e o limiar do teste, e não é possível dizer quanto da diferença cabe a cada um. Atribuir uma diferença a um viés específico é mais difícil do que reconhecer que há viés.

A segunda forma é o viés do sobrevivente, que aparece sempre que só é possível estudar quem chegou até o ponto de observação. Numa enfermaria, os pacientes que você vê com determinada complicação são os que sobreviveram tempo suficiente para desenvolvê-la e para serem internados. Quem morreu antes não está na sua série, e a doença parece mais benigna do que é. A versão ambulatorial é a mesma: a coorte de quem está em uso crônico de uma medicação há dez anos é, por construção, a coorte de quem tolerou a medicação por dez anos.

A terceira forma é a perda de seguimento, e ela merece atenção especial porque é a única que costuma vir declarada no artigo, em número, de graça. Perder pacientes não é o problema; o problema é perdê-los de maneira diferente entre os grupos, ou por um motivo ligado ao desfecho. Quem abandona um estudo por efeito adverso e quem abandona por ter melhorado saem pela mesma porta e contam histórias opostas. A régua prática é comparar a perda com o tamanho do efeito: se 20% se perderam e o efeito é de 3 pontos percentuais, a perda pode conter o resultado inteiro, para qualquer lado.

Há um critério objetivo que a diretriz brasileira de estudos observacionais dá para coortes, e que você pode usar como pergunta de bolso: se nem todos os pacientes elegíveis foram incluídos consecutivamente, o risco de viés de seleção é alto. Inclusão consecutiva significa que ninguém escolheu. Quando o artigo não diz que a inclusão foi consecutiva, alguém escolheu, e a pergunta seguinte é quem e como.

A defesa contra viés de seleção, do lado de quem lê, é uma frase única: procure, nos métodos, a sentença que descreve quem foi incluído e por qual porta, e escreva ao lado dela quem ficou de fora. Se essa sentença não existir no texto, não existe defesa — e a conclusão razoável não é rejeitar o estudo, é rebaixá-lo a gerador de hipótese.

Quem mediu: viés de aferição e o valor do cegamento

A segunda porta é a da medida. A diretriz metodológica brasileira de estudos observacionais define o problema com precisão ao descrever o domínio correspondente do checklist Downs and Black: viés de aferição diferencial ocorre quando os métodos de mensuração da exposição ou do desfecho são sistematicamente diferentes entre os grupos. Guarde a palavra diferencial: é ela que separa o incômodo do desastre.

Medida imperfeita, mas igualmente imperfeita nos dois grupos, é o caso benigno. Ela costuma diluir o efeito — empurra a estimativa na direção do nulo, faz o estudo achar menos do que existe. É um problema, mas é um problema que trabalha contra quem afirma. Medida imperfeita de um jeito num grupo e de outro jeito no outro grupo é o caso maligno: ela pode inventar efeito onde não há, ou apagar efeito que há, e não há como saber a direção sem entender o mecanismo.

A primeira face prática é o observador que sabe o grupo. Quem sabe quem recebeu o tratamento, ao avaliar um desfecho que exige julgamento, tende a julgar diferente sem má-fé nenhuma. Não é preciso trapacear: basta um limiar de dúvida um pouco mais generoso para um lado. É por isso que a diretriz brasileira de acurácia diagnóstica exige que o teste índice e o padrão de referência sejam interpretados por pessoas cegas ao resultado do outro. E é por isso que a força de um desfecho depende de quanto ele é imune ao julgamento: óbito e alta hospitalar quase não se deixam distorcer; melhora clínica, resposta radiológica e resolução do quadro se deixam bastante.

A segunda face é a memória do doente. Quem já adoeceu revisita o passado procurando explicação e lembra de exposições que o saudável não lembra, sem mentir. Esse mecanismo é o que faz do relato retrospectivo de exposição uma medida frágil sempre que o entrevistado já conhece o desfecho. A localização desse erro dentro do desenho de caso-controle está no capítulo da quarta posição; o que interessa aqui é o mecanismo, que é geral: quando a medida depende do relato e o relato vem depois do diagnóstico, a medida está contaminada pelo desfecho.

A terceira face é a mais invisível e a mais frequente em levantamento de prontuário: o instrumento diferente entre grupos. Se um grupo foi acompanhado num período em que a pressão era medida com aparelho de coluna e o outro num período de aparelho automático; se um grupo tem gasometria diária porque ficou na unidade intensiva e o outro tem gasometria só na entrada; se um grupo tem prontuário eletrônico com campos obrigatórios e o outro tem papel — em todos esses casos, a diferença entre os grupos inclui a diferença entre os instrumentos.

Um caso particularmente traiçoeiro dessa terceira face é o que se pode chamar de vigilância desigual: o grupo que recebe uma intervenção nova costuma ser olhado com mais atenção. Mais exames, mais visitas, mais registro. Nesse arranjo, o grupo tratado acumula diagnósticos que o outro também tinha e ninguém procurou. Se o desfecho for algo que precisa ser procurado para ser encontrado — trombose assintomática, lesão renal aguda por critério laboratorial, delirium hipoativo —, o grupo mais vigiado terá mais desfecho por ser mais vigiado.

A defesa é curta. Pergunte quem mediu o desfecho, se essa pessoa sabia o grupo, e se os dois grupos foram olhados com a mesma frequência. Quando a resposta às três for desconhecida, o desfecho mole perde valor e o desfecho duro continua de pé. Numa planilha de prontuário, o único desfecho que sobrevive é quase sempre o óbito.

O que mais mudou junto: confundimento, e as três formas de lidar com ele

A terceira porta não é um defeito do estudo; é o mundo. Confundimento existe quando uma terceira variável caminha junto com a exposição e, por conta própria, produz o desfecho — sem ser um degrau do mecanismo que liga uma coisa à outra. O resultado observado, então, é uma soma: parte é efeito da exposição, parte é efeito da terceira variável, e a conta bruta não separa as duas.

A diretriz metodológica brasileira usa o exemplo do café. Encontra-se associação entre consumo de café e infarto do miocárdio; o tabagismo, porém, associa-se tanto ao consumo de café quanto ao risco de infarto. O tabagismo é o fator de confusão, e é preciso isolar o efeito dele para que sobre a associação entre café e infarto. É exatamente a pergunta que o seu Amélio trouxe no celular — e é bom saber que a resposta dele está num documento federal desde 2014.

Para reconhecer um confundidor, três condições, e as três precisam valer ao mesmo tempo. Primeira: ela anda junto com a exposição — fumantes tomam mais café. Segunda: ela produz o desfecho sozinha, independentemente da exposição — cigarro causa infarto em quem nunca tomou café. Terceira, e é a que se esquece: ela não pode ser um degrau do mecanismo que liga exposição a desfecho. Se ela é um degrau do mecanismo, não é confundidor, e a seção seguinte explica por que isso muda tudo.

Há três formas de lidar com confundimento, e é útil separá-las por momento. Duas delas acontecem no desenho, antes de existir um dado. A mais forte é a aleatorização: sortear quem recebe o quê distribui, em média, todas as variáveis — inclusive as que ninguém pensou em medir, inclusive as que ninguém sabe que existem — igualmente entre os grupos. É a única ferramenta que alcança o confundidor desconhecido, e é por isso que o ensaio ocupa o lugar que ocupa. As outras duas do desenho são restringir (só incluir não fumantes, e então o cigarro não confunde mais nada, ao custo de perder validade externa) e parear (para cada exposto, um não exposto com a mesma idade e sexo).

A terceira forma acontece na análise, depois que os dados existem, e é a que aparece nos artigos. A diretriz brasileira lista três técnicas. A análise estratificada divide a população em estratos — fumantes e não fumantes — e roda a análise separada em cada um; é a mais transparente e a mais limitada, porque os estratos se multiplicam depressa. A regressão múltipla insere cada fator de confusão no modelo junto com a exposição principal, e o resultado bruto sofre, nas palavras do próprio documento, um desconto da influência desses fatores, produzindo a medida ajustada. E o escore de propensão resume as covariáveis numa única probabilidade por indivíduo, usada depois para comparar ou parear semelhantes com semelhantes.

Sobre o escore de propensão é preciso ser exato, porque a definição que consta da diretriz brasileira de estudos observacionais está trocada, e a troca importa. O escore de propensão é a probabilidade de a pessoa receber a exposição dadas as suas características — não a probabilidade de apresentar o desfecho. A conta e a discussão desse achado estão em criterio.notas; aqui basta a consequência prática: o escore de propensão modela como as pessoas foram parar em cada grupo, e é isso que o torna útil justamente no problema da planilha da Auta, em que a alocação foi decidida por julgamento clínico.

E agora o limite que vale para as três técnicas de análise, sem exceção: elas só alcançam o que foi medido. A diretriz brasileira afirma que, após o escore de propensão, a medida de associação estará livre da influência das variáveis de confusão. Essa frase é forte demais e não se sustenta: nenhuma técnica estatística remove o efeito de uma variável que não está na planilha. O que resta depois do ajuste chama-se confundimento residual, e ele tem a mesma aparência de um resultado limpo. Diante de um resultado ajustado, a pergunta certa não é se houve ajuste, é qual confundidor plausível ficou de fora.

Em comparações observacionais de tratamentos, considerar confusão por indicação: o motivo de tratar também pode prever o desfecho. Parte dessa informação pode estar medida por gravidade, comorbidades e outras variáveis; outra parte pode não ter sido registrada adequadamente. Perguntar quem decidiu e com base em quê, sem supor que todo ajuste falhou nem que o viés tenha direção universal.

Confundidor, mediador e modificador de efeito: onde o ajuste conserta e onde estraga

Três variáveis podem ocupar aparentemente o mesmo lugar num modelo e exigem três condutas opostas. Confundir os três é o erro conceitual mais caro deste capítulo, porque ele não produz um resultado obviamente absurdo — produz um resultado plausível e errado.

O confundidor está fora do caminho causal e distorce a associação. Conduta: ajustar. Depois do ajuste, o que sobra é mais próximo do efeito da exposição.

O mediador está dentro do caminho causal: é um degrau do mecanismo pelo qual a exposição produz o desfecho. Conduta: não ajustar, se a pergunta é sobre o efeito total. Ajustar por um mediador remove do resultado exatamente a parte do efeito que passa por ele — e a exposição aparece como se não funcionasse, quando na verdade ela funciona por ali. É o único caso em que o ajuste, feito com boa intenção e técnica correta, destrói o achado verdadeiro.

Um exemplo clínico para fixar. Suponha que se queira estimar o efeito de um programa de atividade física supervisionada sobre eventos cardiovasculares. A atividade física reduz a pressão arterial, e a pressão arterial mais baixa reduz eventos. Se o modelo ajustar para pressão arterial, ele está descontando do resultado justamente o caminho pelo qual o programa funciona, e o programa aparecerá com efeito muito menor — ou nenhum. O modelo não errou de conta: respondeu outra pergunta, a do efeito que sobra por caminhos que não passam pela pressão. Essa pergunta às vezes é legítima e interessante, mas é outra pergunta, e precisa ser declarada como tal.

A regra de bolso é temporal e funciona quase sempre: se a variável foi determinada antes da exposição, ela pode ser confundidor; se ela mudou por causa da exposição, ela é mediadora. Idade, sexo e comorbidade prévia são candidatos a confundidor. Qualquer coisa medida depois de a exposição começar — pressão, peso, nível de um marcador, tempo de internação — precisa ser examinada antes de entrar num modelo. Este capítulo assume esta distinção e declara que a assume: não há, entre os documentos brasileiros em uso, um que separe mediador de confundidor com essas palavras, e a formulação acima é leitura do mecanismo feita por este capítulo, não citação.

Modificação de efeito é variação da medida entre estratos e depende da escala escolhida. Estimar separadamente quando útil, avaliar interação e controlar confundidores apropriados. Não demonstrar modificação apenas comparando o efeito conjunto de duas exposições com o de uma delas em um estrato; tampouco proibir ajuste de forma geral.

O exemplo do documento é do câncer de esôfago. A combinação de tabagismo e consumo de álcool associa-se ao desfecho com razão de chances de 8,9, com intervalo de 95% de confiança de 6,2 a 13,0. Avaliado apenas o tabagismo, em quem não consome álcool, a associação permanece, com razão de chances de 3,0 e intervalo de 1,5 a 6,2. O cigarro faz mal sozinho; faz muito mais mal acompanhado. O álcool não é confundidor aqui — é modificador de efeito. Ajustar por ele produziria um número médio que não descreve nenhum dos dois pacientes reais: nem o que bebe, nem o que não bebe.

A diferença prática para o interno é direta. Diante de uma modificação de efeito, a resposta certa não é um número, são dois — e o seu paciente pertence a um dos estratos. É esse raciocínio que sustenta a frase mais útil de qualquer discussão de conduta: para este paciente, com estas características, o efeito esperado é o do estrato dele, e não a média da população do estudo.

Um último cuidado, e o documento brasileiro é enfático: análises de subgrupo têm de ser pré-especificadas, com justificativa escrita antes de olhar os dados, porque análises pré-especificadas diminuem a probabilidade de resultado espúrio. Subgrupo encontrado depois de o resultado principal ter falhado é a forma mais elegante de inventar um efeito — e é a forma em que a modificação de efeito, que é um fenômeno real, vira desculpa.

Quando o próprio diagnóstico é o viés

Há uma família de vieses que não age sobre a exposição nem sobre o tratamento, e sim sobre o ato de diagnosticar. Ela é traiçoeira porque não parece metodologia: parece medicina boa. Reuni-la aqui é decisão deste capítulo, e cada peça tem destino declarado no vizinho a quem pertence o terreno.

O viés de verificação, também chamado work-up bias, é o mais frequente e tem definição em documento federal brasileiro. A diretriz metodológica de acurácia diagnóstica o define assim: ele ocorre sempre que a amostra é submetida ao teste índice mas nem todos os pacientes são submetidos ao padrão de referência, de modo que a acurácia é relatada apenas para quem teve o estado de doença validado. Isso é rotina quando o padrão de referência é invasivo — biópsia, angiografia, laparotomia —, porque ninguém biopsia quem teve exame negativo.

O processo de verificação pode enviesar a acurácia; sua direção precisa ser avaliada no desenho concreto, sem regra universal. Traduzindo para o consultório: um teste validado apenas em quem foi adiante na investigação parece mais capaz de achar doença e menos capaz de descartá-la do que realmente é. O cálculo de sensibilidade, especificidade e preditivos é do capítulo A metade que o laboratório não sabe, terceira posição desta apostila; o que este capítulo entrega é a pergunta que antecede a conta — todos os pacientes foram ao padrão de referência, ou só os positivos?

O viés de incorporação ocorre quando o teste que está sendo avaliado faz parte do padrão de referência que deveria julgá-lo. Os dois deixam de ser independentes e a concordância entre eles é parcialmente artificial, superestimando sensibilidade e especificidade ao mesmo tempo. Acontece o tempo todo quando o diagnóstico final é fechado por um comitê que leu tudo o que havia no prontuário, inclusive o exame em julgamento. A mesma diretriz lembra que o padrão de referência é sempre assumido como tendo 100% de acurácia, e que isso não corresponde à realidade.

O viés de inspeção é o parente diagnóstico do viés de aferição: o conhecimento prévio do resultado de um exame influencia a interpretação do outro. A defesa é a mesma do resto do capítulo — cegamento —, e a pergunta de leitura é se o radiologista, o patologista ou o comitê sabiam o resultado do outro teste quando julgaram.

Um caso de seleção que se disfarça de desenho: a diretriz brasileira chama de caso-controle diagnóstico o arranjo em que o estado da doença já é conhecido antes de o paciente ser submetido ao teste índice — doentes com quadro florido de um lado, pessoas sadias de outro. É um desenho válido para uma fase inicial de avaliação, e é péssimo para estimar o desempenho na prática, porque a população real está cheia de casos leves e de diagnósticos concorrentes. O nome dessa perda de desempenho é viés de espectro, e ele é tratado no capítulo da terceira posição, ao qual este remete; o que fica aqui é o reconhecimento de que se trata do mesmo mecanismo geral da seção sobre quem entrou, aplicado ao terreno do diagnóstico.

Para organizar tudo isso, existe ferramenta pronta e recomendada em documento brasileiro: o QUADAS-2, com quatro domínios — seleção de pacientes, teste índice, padrão de referência, e fluxo e tempo. A mesma diretriz observa que escore de qualidade não é recomendado nesse campo, porque a importância de cada item e a direção do viés variam com o contexto, e que o julgamento deve ser por domínio, como baixo, alto ou incerto. Para um interno, o valor do QUADAS-2 não é aplicá-lo: é saber que existem exatamente quatro lugares onde procurar, e que fluxo e tempo — quantos pacientes saíram e quanto tempo passou entre um teste e outro — é um deles.

Falta a peça que mais aparece na vida real, e ela vem da medida e não do teste. Quando a afirmação é feita em sobrevida, o momento do diagnóstico entra na conta: antecipar o diagnóstico aumenta o tempo entre diagnóstico e morte sem mover a data da morte, e detectar preferencialmente doenças de evolução lenta enche a série de casos de bom prognóstico. Os nomes disso são viés de tempo de antecipação — que o INCA também chama de viés de tempo ganho — e viés de tempo de duração, e o tratamento completo dos dois, com as figuras, está no capítulo O nível não está no exame, oitava posição, a quem pertence o terreno do rastreamento. O que este capítulo sustenta é a regra geral da qual eles são o caso particular: sobrevida é uma medida que depende de quando o relógio começou, e mortalidade na população não. Isso vale para rastreamento e vale para qualquer situação em que a definição ou o momento do diagnóstico tenha mudado entre os grupos comparados — inclusive entre dois períodos do mesmo serviço.

O caso extremo dessa regra é a mudança de definição de caso no meio da observação. Se a definição de caso muda enquanto se está contando casos, incidência, letalidade e sobrevida mudam sem que nada tenha acontecido com as pessoas. É por isso que uma alteração de definição no meio de uma investigação de surto é um evento metodológico e não administrativo, e precisa ser registrada com data: o capítulo O terceiro caso, décima posição, trata da definição de caso na investigação; aqui ela entra como exemplo do mecanismo geral, porque a mesma coisa acontece, mais devagar e sem ninguém anunciar, quando um serviço adota um exame novo e passa a chamar de doente quem antes não era chamado.

07

A régua de três minutos, e o que as contas dos documentos oficiais mostraram

Duas metades compõem este bloco. Na primeira está a régua: quatro perguntas, três variáveis que se confundem entre si, e um mapa de por onde cada viés entra e para que lado ele empurra o número — as três primeiras tabelas servem para usar no corredor. Na segunda está a conferência das contas dos documentos brasileiros que sustentam o capítulo, refeitas uma a uma em Python contra o texto original. Aparecem aqui as que falharam e também as que não falharam: um capítulo sobre erro sistemático que não conferisse as próprias fontes seria uma piada, e a conta que fecha informa tanto quanto a que não fecha. Cinco achados mudam o que se deve ensinar a partir desses documentos; um deles está na Relação Nacional de Medicamentos Essenciais e não tem nada a ver com metodologia.

Não concluir o mecanismo pelo resultado do ajuste. Uma variável medida após a exposição pode ser mediadora, confundidora dependente do tempo ou marcador de outro processo; o diagrama causal e o tempo definem o que ajustar. Interação depende da escala e da comparação de efeitos nos estratos, não apenas de uma associação conjunta maior. Verificação parcial ou diferencial do diagnóstico produz viés, mas a direção de sensibilidade e especificidade não é universal.

  1. 1Antes de qualquer coisa: isto é um resultado ou uma tradução de resultado? Cartão de bolso, manchete e frase de corredor não são estudo. Peça o artigo, ou pelo menos o resumo inteiro.
  2. 2Pergunta 1 — quem entrou. Ache nos métodos a frase que diz quem foi incluído e por qual porta. Ache também quem foi excluído. Se a inclusão não foi consecutiva, alguém escolheu.
  3. 3Pergunta 2 — quem mediu. Quem avaliou o desfecho sabia o grupo? Os dois grupos foram olhados com a mesma frequência? Desfecho duro sobrevive à resposta desconhecida; desfecho mole não.
  4. 4Pergunta 3 — o que mais mudou junto. Existe medida bruta e ajustada? O quanto o ajuste mexeu? Qual confundidor plausível ficou de fora da lista de covariáveis?
  5. 5Se a comparação for de tratamento e a alocação não foi sorteada, pare e pergunte: quem decidia quem recebia, e olhando para quê? Essa é a confusão por indicação, e ela raramente tem coluna na planilha.
  6. 6Confira se a variável ajustada não é mediadora. Foi determinada antes da exposição, ou mudou por causa dela? Ajuste por mediador apaga o efeito verdadeiro.
  7. 7Se houver diferença entre subgrupos, pergunte se ela foi pré-especificada. Se não foi, é hipótese, não resultado.
  8. 8Se a afirmação vier em sobrevida, converta a pergunta: e a mortalidade? Se vier em incidência que subiu sem mortalidade que caiu, considere sobrediagnóstico.
  9. 9Pergunta 4 — vale para o meu paciente. O meu paciente teria sido excluído deste estudo? Se sim, o resultado pode estar certo e não ser dele.
  10. 10Decida em voz alta e por escrito no prontuário o que muda hoje e o que não muda. Um estudo que não muda conduta hoje pode mudar a conversa de amanhã, e isso também é uma decisão.

As quatro perguntas, e o que cada resposta ruim autoriza você a fazer com o estudo

PerguntaOnde a resposta estáO que uma resposta ruim significaO que ainda dá para fazer com o estudo
Quem entrou, e quem ficou de fora?Métodos: critérios de inclusão e exclusão, e a frase sobre inclusão consecutivaOs grupos podem já nascer diferentes por um motivo ligado ao desfecho; nenhuma análise desfaz issoUsar como gerador de hipótese; nunca como estimativa de efeito
Quem mediu o desfecho, e sabia o grupo?Métodos: cegamento, quem adjudicou desfecho, frequência de exames em cada grupoDesfechos que dependem de julgamento perdem valor; desfecho duro resisteLer só o desfecho duro do estudo e ignorar os moles
O que mais mudou junto com a exposição?Métodos: lista de covariáveis; resultados: medida bruta ao lado da ajustadaO efeito observado é parte exposição e parte outra coisa; sobra confundimento residualAceitar a direção do efeito, desconfiar da magnitude; exigir confirmação aleatorizada
Isso vale para o meu paciente?Métodos: critérios de exclusão, idade, cenário, gravidade, paísO número pode estar certo e falar de outra gente; é limite, não defeitoAplicar com desconto explícito e dito ao paciente, ou não aplicar

Três variáveis que ocupam o mesmo lugar no modelo e pedem condutas opostas

VariávelComo reconhecerConduta no modeloO que acontece se errar
ConfundidorAssocia-se à exposição, causa o desfecho por si, e está fora do caminho causal; costuma ser anterior à exposição (idade, sexo, comorbidade prévia)Ajustar, estratificar ou parear; no desenho, aleatorizar ou restringirNão ajustar deixa no resultado o efeito da outra variável; a associação existe e a causa é outra
MediadorEstá dentro do caminho causal; muda por causa da exposição e é medido depois dela (pressão, peso, marcador, tempo de internação)Não ajustar quando a pergunta é o efeito total; ajustar só de propósito e declarando que se busca o efeito diretoAjustar apaga justamente a parte do efeito que passa por ele; a intervenção que funciona aparece como inútil
Modificador de efeitoO efeito tem magnitude diferente em subgrupos, mas existe em ambos; a diretriz brasileira o chama de variável de interaçãoEstimar efeitos por estrato e escala, usando interação quando apropriado; controlar confundimento continua necessário.Ajustar produz uma média que não descreve nenhum paciente real; e subgrupo achado depois vira efeito inventado

Por onde cada viés entra e para que lado ele empurra o número

ViésPorta de entradaDireção típicaPergunta que o detecta
Voluntário saudávelEntrada: quem se apresentaInfla o benefício da intervenção estudadaOs participantes se voluntariaram, ou foram incluídos consecutivamente?
SobreviventeEntrada: só se observa quem chegouFaz a doença parecer mais benigna e a exposição crônica parecer mais seguraQuem morreu ou saiu antes do ponto de observação teria entrado nesta série?
Perda de seguimentoEntrada, depois da inclusãoQualquer direção; grave quando difere entre os grupos ou se liga ao desfechoQuantos se perderam em cada grupo, e a perda é maior que o efeito?
Aferição não diferencialMedida, igual nos dois gruposDilui: empurra a estimativa na direção do nuloO instrumento é impreciso, mas foi o mesmo nos dois grupos?
Aferição diferencialMedida, desigual entre gruposQualquer direção; pode criar efeito onde não háO desfecho foi medido do mesmo jeito, pela mesma pessoa, na mesma frequência, nos dois grupos?
Vigilância desigualMedida: quem é mais olhado acumula mais diagnósticoInfla o desfecho no grupo mais monitoradoO grupo tratado fez mais exames que o grupo controle?
ConfundimentoEstrutura causal do mundoQualquer direção, conforme o confundidorO que mais mudou junto com a exposição, e está na lista de covariáveis?
Confusão por indicaçãoEstrutura causal, via julgamento clínicoCostuma piorar o tratado, porque o mais grave é quem recebe; pode inverterQuem decidia quem recebia o tratamento, e com base em quê?
Verificação (work-up)Diagnóstico: só o positivo vai ao padrão de referênciaDireção depende do processo de verificação e dos erros dos padrões usados; não é universal.Todos os pacientes foram ao padrão de referência, ou só os que testaram positivo?
IncorporaçãoDiagnóstico: o teste faz parte do próprio padrão de referênciaSuperestima sensibilidade e especificidade juntasO exame avaliado entrou na definição do diagnóstico final?
InspeçãoDiagnóstico: quem lê um exame sabe o resultado do outroInfla a concordância entre os dois testesOs dois exames foram interpretados por pessoas cegas uma ao resultado da outra?
Medida de sobrevidaDesfecho: o relógio começa no diagnósticoInfla a sobrevida sem mover a data da morteE a mortalidade na população, caiu?

Conta declarada nos documentos brasileiros × conta refeita em Python

DocumentoO que ele afirmaConta refeitaFecha?
Caderno de Atenção Primária n. 29 (2010), cenário sem rastreamentoIncidência 5/100.000, mortalidade 2/100.000, sobrevida 60%3 sobreviventes em 5 casos = 60,00%Fecha
Caderno n. 29, cenário com rastreamento8 casos, 2 mortes, sobrevida total 75%, sobrevida dos rastreados 100%6 em 8 = 75,00%; 5 em 5 = 100%; incidência sobe 60% e a mortalidade não se moveFecha
Caderno n. 29, comentário do mesmo exemploTodos os detectados sobreviveram contra “somente 33% da fase sem o rastreamento”33,3% = 1 em 3 é o braço clínico do cenário COM rastreamento; a fase sem rastreamento é 60%Não fecha
Caderno n. 29, ensaios de rastreamento colorretal33% no primeiro ensaio; 15% e 18% nos dois seguintes33/15 = 2,20x; 33/18 = 1,83x; sobre a média dos dois, exatamente 2,00xFecha
Diretrizes metodológicas — observacionais (2014), interação no câncer de esôfagoOR 8,9 (IC 95% 6,2–13,0) e OR 3,0 (IC 95% 1,5–6,2)Centro geométrico dos intervalos: 8,98 e 3,05, desvio de 0,9% e 1,7% — compatível com arredondamento a uma decimalFecha
Diretrizes metodológicas — observacionais (2014), escore de propensãoÉ a probabilidade de cada participante apresentar o desfecho de interesseO escore de propensão é a probabilidade de receber a exposição dadas as covariáveis; a troca aparece duas vezes no mesmo trechoNão fecha
Diretrizes metodológicas — observacionais (2014), efeito do ajusteApós o escore de propensão, a medida estará livre da influência das variáveis de confusãoNenhuma técnica alcança variável não medida; sobra confundimento residual por definiçãoNão fecha
Diretrizes metodológicas — observacionais (2014), lista de quadrosQuadro 7 — Principais vieses encontrados em revisões sistemáticasO Quadro 7, na página em que aparece, intitula-se “Principais vieses de publicação”Não fecha
Diretrizes metodológicas — acurácia diagnóstica (2014), viés de verificaçãoEspecificidade, definida como ausência da patologia em pacientes com resultado de teste negativoIsso é o valor preditivo negativo; especificidade condiciona no não doente, não no teste negativo — e a sensibilidade, duas linhas acima, está definida corretamenteNão fecha
Diretrizes metodológicas — acurácia diagnóstica (2014), direção do viés de verificaçãoO processo de verificação pode enviesar a acurácia; sua direção precisa ser avaliada no desenho concreto, sem regra universal.É a direção esperada da verificação parcial; confereFecha
Diretrizes metodológicas — acurácia diagnóstica (2014), ferramentasQUADAS original com 14 questões; QUADAS-2 com quatro domínios14 itens e quatro domínios — seleção, teste índice, padrão de referência, fluxo e tempoFecha
Rename 2024, sachê de micronutrientesO mesmo produto aparece duas vezes: numa listagem com vitamina B6 0,5 g, na outra com 0,5 mgFator de 1.000 entre as duas; a 0,5 g a piridoxina seria 55,7% do sachê de 1 g e pesaria 8,72x a soma dos outros 14 componentesNão fecha
Rename 2024, elenco do esquema da vinhetaConsulta ao índice sobre corticoide, vitamina C e tiaminaSuccinato sódico de hidrocortisona 100 mg e 500 mg injetável, componente Básico; ácido ascórbico não consta; tiamina só como comprimido de 300 mgFecha

ACHADO 1 — o mais didático, porque está num documento que ensina justamente a não errar assim. O Caderno de Atenção Primária n. 29 monta um exemplo aritmético de sobrediagnóstico numa população de 100.000 pessoas: sem rastreamento há 5 casos, 2 mortes e sobrevida de 3 em 5, isto é, 60%; com rastreamento os casos passam a 8 porque três lesões que nunca dariam sintoma foram encontradas, as mortes continuam 2, e a sobrevida passa a 6 em 8, isto é, 75%. Todas essas contas fecham. O comentário que se segue, porém, escreve que todos os casos descobertos pelo rastreamento sobreviveram “quando comparados com somente 33% da fase sem o rastreamento, além do mais, a sobrevida global melhorou de 60% para 75%”. Na mesma frase, portanto, a fase sem rastreamento vale 33% e 60%. Refazendo: 1 em 3 = 33,3% é a sobrevida do braço diagnosticado clinicamente DENTRO do cenário com rastreamento (2 fatais e 1 não fatal); a fase sem rastreamento é 3 em 5 = 60%. O rótulo está trocado. Ensinado como está, o exemplo faz o sobrediagnóstico parecer maior do que já é — e não precisa: o número honesto, 60% para 75% sem uma vida salva, já é devastador.

ACHADO 2 — conceitual, e o de maior consequência para quem lê artigo. A diretriz metodológica de estudos observacionais (2014) descreve o escore de propensão como a técnica que usa as potenciais variáveis de confusão “para estimar a probabilidade de cada indivíduo participante apresentar o desfecho de interesse”, e repete a definição entre parênteses algumas linhas adiante, ao explicar o escore de propensão pareado. O escore de propensão é a probabilidade de o indivíduo RECEBER A EXPOSIÇÃO, condicionada às covariáveis observadas — é essa a definição que o torna útil, porque o que ele modela é o mecanismo de alocação, não o prognóstico. A troca não é semântica: quem aprende a definição errada não entende por que o escore de propensão é a ferramenta natural para o problema da confusão por indicação, e pode acabar construindo um modelo do desfecho e chamando-o de escore de propensão. A definição correta é a que este capítulo ensina, e a divergência com a fonte fica registrada aqui.

ACHADO 3 — de calibragem, no mesmo documento e no mesmo parágrafo. Depois de descrever o escore de propensão, o texto conclui que a medida de associação “estará livre da influência das variáveis de confusão”. Nenhuma técnica de ajuste — regressão múltipla, estratificação ou escore de propensão — alcança variável que não foi medida. O que resta depois do ajuste tem nome e é o assunto central de qualquer discussão séria sobre estudo observacional: confundimento residual. A própria diretriz reconhece o limite em outras passagens, quando discute a variabilidade das listas de covariáveis entre estudos; a frase absoluta, isolada, é mais forte do que o método permite. Trata-se de calibragem e não de erro de conta, porque é julgamento de leitura — mas é uma frase que, ensinada literalmente, produz confiança indevida em resultado ajustado.

ACHADO 4 — definicional, na diretriz metodológica de acurácia diagnóstica (2014), e é o mais fácil de propagar porque está dentro de uma explicação correta. Ao descrever o viés de verificação, o documento define sensibilidade corretamente, como teste positivo quando a doença está presente, e duas linhas depois define especificidade como “ausência da patologia em pacientes com resultado de teste negativo”. Isso não é especificidade: é valor preditivo negativo. Especificidade condiciona no não doente e pergunta que fração dele testa negativo; o preditivo negativo condiciona no teste negativo e pergunta que fração dela não tem a doença. A inversão é exatamente o erro que o capítulo A metade que o laboratório não sabe, terceira posição desta apostila, existe para desfazer — e aqui ela está, num documento federal, na frase seguinte a uma definição correta. A direção do viés que o documento afirma, no entanto, está certa: verificação parcial superestima sensibilidade e subestima especificidade.

ACHADO 5 — de licença, e é uma contradição interna. A diretriz metodológica de acurácia diagnóstica traz, na página de ficha catalográfica, a frase “2014 Ministério da Saúde. Todos os direitos reservados”; três páginas adiante, na página de créditos, declara que a obra é disponibilizada nos termos da Licença Creative Commons Atribuição–Não Comercial–Sem Derivações 4.0 Internacional, com reprodução parcial ou total permitida desde que citada a fonte. As duas afirmações não convivem. Some-se a isso que o volume irmão, da mesma série, do mesmo ano, do mesmo departamento e do mesmo termo de cooperação — o de estudos observacionais — adota Creative Commons Atribuição–Não Comercial–Compartilhamento pela mesma licença 4.0, que é uma licença diferente. Nada disso muda a medicina; muda quem pode reproduzir o quê, e vale registrar porque a busca da cláusula precisa ser feita com o texto normalizado: a extração de PDF cola as palavras e faz “Creative Commons” desaparecer de uma busca literal.

ACHADO 6 — de catálogo, no volume de estudos observacionais. A lista de quadros, na abertura, anuncia o “Quadro 7 – Principais vieses encontrados em revisões sistemáticas”. O quadro que efetivamente aparece na página indicada intitula-se “Principais vieses de publicação” e trata só de viés de publicação, com tipos como o viés de tempo para publicação. Quem procura no sumário uma tabela geral de vieses não a encontra, porque ela não existe no documento. É um erro pequeno e vale registrar porque muda o que se pode dizer que o documento contém.

ACHADO 7 — fora da metodologia, e é o que mais pode mudar conduta. A Relação Nacional de Medicamentos Essenciais 2024 lista o sachê de micronutrientes duas vezes, em seções diferentes, com a composição escrita por extenso nas duas. As duas listagens são idênticas em catorze componentes e divergem no décimo quinto: numa delas a vitamina B6 aparece como 0,5 g, na outra como 0,5 mg. Fator de 1.000. A leitura de 0,5 mg é a que fecha com o produto: a soma dos catorze componentes restantes dá 57,32 mg, e o total fica em 57,82 mg num sachê de 1 g. Na leitura de 0,5 g, a piridoxina sozinha passaria a 55,7% da massa do sachê e pesaria 8,72 vezes a soma de todos os outros catorze componentes juntos, o que é impossível para uma formulação de micronutrientes em pó. O erro é de digitação e está no documento que define o elenco nacional; quem conferir só uma das duas listagens não tem como saber que existe a outra.

CONFERÊNCIA QUE FICOU ABERTA, e fica registrada como tal. A Figura 3.1 do Caderno n. 29 ilustra o viés de tempo de antecipação com três linhas do tempo: A, não rastreada, com 4 anos de período assintomático e 3 de doença clínica; B, rastreada, com 2 e 5; e C, apresentada no texto como o caso em que houve incremento real de sobrevida além da antecipação do diagnóstico. Na extração do PDF, C carrega os mesmos rótulos de B — 2 anos e 5 anos —, o que tornaria C idêntica a B e, portanto, incapaz de mostrar ganho real nenhum: nas duas, o intervalo do início à morte é de 7 anos, igual ao de A. Ou a figura repete os números por engano, ou a extração de texto perdeu os rótulos próprios de C, o que é comum em rótulo de figura. Decidir entre as duas hipóteses exigiria ver a arte original, e por isso esta nota não afirma que há erro na figura: afirma que a conferência ficou aberta. A parte verificável da figura, essa sim, fecha e é o essencial: A e B morrem no mesmo momento, e a diferença de 2 anos entre 3 e 5 é sobrevida aparente, não vida ganha.

CONFERÊNCIA QUE FECHOU, e vale porque é a que sustenta a seção sobre modificação de efeito. Os dois pares do exemplo de câncer de esôfago são internamente consistentes: para tabagismo com álcool, a razão de chances de 8,9 tem centro geométrico do intervalo de confiança em raiz de 6,2 × 13,0 = 8,98, desvio de 0,9%; para tabagismo sem álcool, 3,0 tem centro geométrico em raiz de 1,5 × 6,2 = 3,05, desvio de 1,7%. Ambos os desvios são compatíveis com arredondamento a uma casa decimal, e os dois intervalos são simétricos na escala logarítmica, como devem ser. A razão entre as duas estimativas é 2,97 — o cigarro acompanhado de álcool associa-se ao desfecho com quase o triplo da força do cigarro sozinho, e o cigarro sozinho continua associado. É o retrato aritmético de modificação de efeito: a associação não desaparece no estrato, muda de tamanho.

CONFERÊNCIA QUE FECHOU, sobre o estado das ferramentas. Os três levantamentos citados pela diretriz de observacionais são internamente coerentes: 12 ferramentas identificadas com 6 aplicáveis a revisões sistemáticas; 14 “melhores” escolhidas entre 182, com 6 recomendadas — 7,7% e 3,3% do total; 86 instrumentos específicos avaliados sem recomendação de nenhum; e apenas 3 ferramentas em comum entre os dois primeiros levantamentos. Os percentuais de finalidade do terceiro levantamento — 15% para revisões, 36% para contexto geral e 34% para contextos específicos — somam 85%, e o documento não afirma que a classificação é exaustiva, de modo que os 15% restantes não constituem contradição. A soma fica registrada porque percentual que não fecha em 100 é um dos lugares onde erro costuma se esconder — e aqui não havia erro.

CONFERÊNCIA QUE FECHOU, na Rename 2024, feita por busca exata no texto já normalizado, e nunca por lembrança de leitura, porque este capítulo tem uma vinheta em que alguém propõe um esquema de três drogas. Succinato sódico de hidrocortisona consta como pó para solução injetável em duas apresentações, 100 mg e 500 mg, no Componente Básico. Ácido ascórbico não consta: zero ocorrência no índice e zero no texto bruto, sob esse nome. Sob o nome “vitamina C” há duas ocorrências, e a conferência à mão mostrou que ambas são a composição do sachê de micronutrientes, com 30 mg por sachê de 1 g, no Componente Estratégico — não existe apresentação de vitamina C como medicamento isolado, e muito menos injetável. Tiamina consta em uma única apresentação: cloridrato de tiamina, comprimido de 300 mg, Componente Básico. Não há tiamina injetável na Rename 2024. Isso não é um detalhe de fim de capítulo: significa que, mesmo se o estudo que sustentasse o esquema fosse impecável, dois dos três componentes não existiriam no elenco nacional para serem prescritos por essa via.

SOBRE A DATAÇÃO, e é um resultado do capítulo. As duas diretrizes metodológicas do Ministério da Saúde usadas aqui são de 2014 e continuam sendo a régua: a página de Diretrizes Metodológicas da Conitec, consultada em 07/09/2026, publica ambas como 1ª edição e não lista substituto. O Caderno de Atenção Primária n. 29 é de 2010 e passa no teste mais forte que existe — um documento mais novo o cita como a régua em uso: o INCA, em “Detecção precoce do câncer” (2021), atribui a ele nominalmente os vieses de tempo de duração e de antecipação, e a referência aparece quatro vezes na lista bibliográfica daquele documento. Vale ainda um detalhe da própria página de rosto do Caderno n. 29, que ilustra o cuidado que este capítulo pede: a nota de direitos diz “É permitida a reprodução total ou parcial ou total desta obra, desde que citada à fonte” — com “total” repetido e a crase indevida, exatamente assim, no original.

SOBRE O QUE NÃO EXISTE, e este é um achado do capítulo. Não há documento brasileiro em uso que ensine viés, confundimento e validade ao clínico. O que existe é excelente e é dirigido a outro público: as duas diretrizes metodológicas do Ministério da Saúde falam a quem produz revisão sistemática dentro do processo de avaliação de tecnologias, com dois revisores independentes e prazo de semanas; o Caderno n. 29 fala a quem organiza rastreamento na atenção primária e trata dos vieses daquele terreno específico. Não há manual, caderno, protocolo ou nota técnica nacional que ensine ao interno ou ao médico assistencial como julgar um estudo em três minutos no corredor. As quatro perguntas deste capítulo, a regra temporal para separar mediador de confundidor e a ordem entre validade interna e externa são construção deste capítulo a partir daquelas fontes, e não citação de régua brasileira — porque a régua brasileira, para esse uso, não existe. Está dito com todas as letras, como deve ser.

08

A conduta, hora a hora

A conduta deste capítulo não é uma prescrição: é uma sequência de decisões tomadas num dia de enfermaria, cada uma com consequência para uma pessoa com nome. O que segue é a quinta-feira da cena, do começo ao fim, com o que dizer e o que escrever em cada ponto.

Duas coisas valem antes. A primeira: a decisão padrão diante de um achado observacional não é adotar nem rejeitar — é não mudar a conduta hoje e dizer por quê. Isso não é covardia nem imobilismo; é reconhecer que a inércia terapêutica tem uma assimetria a seu favor, porque a conduta atual já sobreviveu a algum escrutínio e a nova ainda não. A segunda: quase todas as decisões abaixo passam por uma conversa, e conversar mal transforma uma decisão certa numa briga.

O esquema que aparece na vinheta é adjuvante, ou seja, acrescenta-se ao tratamento estabelecido — não o substitui. Em nenhum momento se discute suspender antibiótico, oxigênio ou suporte. Essa distinção é o que torna a decisão discutível: acrescentar parece barato, e por parecer barato é acrescentado sem prova.

Aplicar a crítica ao tratamento real. Não iniciar combinação adjuvante com base apenas em coorte frágil. Isso não exclui indicações independentes de corticoide ou de tiamina em situações específicas, que devem ser avaliadas pelo protocolo clínico. RENAME informa política de acesso, não toda disponibilidade hospitalar nem eficácia. Reavaliar pneumonia pela trajetória e gravidade, sem esperar 24 horas diante de deterioração. Discordância que ameaça segurança deve ser explicitada de forma respeitosa no momento necessário.

  1. 7h20 — a planilha, antes de qualquer opinião

    A Auta abre o notebook e mostra o resultado antes dos métodos, como todo mundo faz. Sua primeira tarefa não é avaliar o achado: é reconstituir a pergunta. Peça para ver, nessa ordem, quem entrou, quantos ficaram de fora e por quê, e como foi decidido quem recebia o esquema. Faça isso com interesse genuíno, porque é genuíno: o levantamento é bom trabalho e a pergunta é boa. O que está em jogo é o que ele pode responder. Nomeie o desenho em voz alta — coorte retrospectiva de prontuário — e diga o que esse desenho entrega bem: incidência de óbito nos dois grupos, descrição do que o serviço vem fazendo, e a hipótese. E o que ele não entrega: o verbo reduziu.

    Prescrição
    • Peça a frase de inclusão: todos os internados com pneumonia grave no período, ou os que tinham prontuário localizável?
    • Pergunte quantos prontuários foram excluídos e por qual motivo; anote o número.
    • Pergunte quem indicava o esquema e com base em quê. Se a resposta for “o plantonista decidia”, você achou a confusão por indicação.
    • Peça a medida bruta ao lado da ajustada, se houver ajuste.
    • Não use a palavra viés na primeira frase. Use “quem decidia”.
  2. 7h45 — a pergunta que salva o trabalho da Auta

    Há uma diferença enorme entre destruir um trabalho e reorientá-lo, e ela cabe numa pergunta: o que este conjunto de dados responde sem discussão? A resposta costuma ser valiosa e ninguém a valoriza — quantos pacientes com pneumonia grave este serviço internou em três anos, qual a letalidade, quanto tempo até a primeira dose de antibiótico, quantos foram para a unidade intensiva. Isso é epidemiologia do serviço, é publicável, é útil para a gestão e não depende de nenhuma suposição sobre alocação. A comparação entre tratados e não tratados, essa, vira a seção de hipótese: o esquema merece um ensaio, e o levantamento serve para calcular o tamanho de amostra dele.

    Prescrição
    • Ofereça a reformulação por escrito, num parágrafo, para a Auta levar ao orientador.
    • Sugira apresentar a descrição da coorte inteira como resultado principal e a comparação como hipótese explicitamente rotulada.
    • Ofereça calcular, com os números dela, quantos pacientes um ensaio precisaria — é o uso legítimo e generoso da planilha.
  3. 8h10 — leito 9, dona Olinda: a decisão de hoje

    A proposta é iniciar o esquema adjuvante nela. A decisão é não iniciar, e a justificativa não é metodológica na frente da paciente: é clínica. Ela está no segundo dia de antibiótico, não piorou, e o critério para julgar resposta a antibiótico em pneumonia é de dias, não de horas. Acrescentar três drogas hoje tem dois custos concretos: se ela melhorar, ninguém saberá do que; e se ela apresentar hiperglicemia, delirium ou infecção secundária, haverá três candidatos novos a explicação. A conduta é manter, reavaliar com hora marcada, e definir de antemão o que contaria como piora.

    Prescrição
    • Manter o esquema antimicrobiano em curso e o suporte de oxigênio; reavaliar em 24 horas com hora marcada.
    • Definir e escrever agora os gatilhos de mudança: queda de saturação, aumento da frequência respiratória, necessidade de aumentar oxigênio, hipotensão, confusão nova.
    • Registrar no prontuário que o esquema adjuvante foi discutido e não iniciado, com o motivo em uma linha.
    • Não escrever “sem evidência” no prontuário: escrever o raciocínio clínico que sustenta manter.
  4. 9h40 — a visita, e a frase da preceptora

    A doutora Laudelina disse que a sobrevida em cinco anos saltou. Questionar com respeito e dados é parte do trabalho; quando há risco imediato, a correção não deve ser adiada apenas para evitar discordância diante da equipe. O que se faz é perguntar, com curiosidade real, se havia dado de mortalidade — porque muitas vezes há, e às vezes ele confirma o que ela disse. A pergunta é legítima, respeitosa, e ensina a todos que estão ouvindo. Se ela não souber, a conversa termina em “vale a pena procurar”, e você procura.

    Prescrição
    • Pergunte pela mortalidade, não pela sobrevida, e pergunte como quem quer saber.
    • Ofereça procurar o dado e trazer amanhã; depois traga mesmo.
    • Se o programa era de rastreamento, o capítulo O nível não está no exame, oitava posição desta apostila, tem o terreno inteiro — vá lá antes de opinar.
  5. 11h10 — ambulatório, seu Amélio e o café

    A pergunta dele é se pode voltar a tomar café, e a resposta honesta tem duas partes. A primeira é sobre o estudo: ele observou quem já tomava, não sorteou quem passaria a tomar, e quem toma café difere de quem não toma em várias coisas que também mexem com o coração — a mais óbvia é o cigarro. Isso não torna o estudo inútil; torna a conclusão frágil. A segunda parte é a que ele veio buscar: para um hipertenso em acompanhamento, sem arritmia sintomática e sem insônia relevante, café em quantidade moderada não é o que decide o risco cardiovascular dele. O que decide é a pressão controlada, o cigarro, o peso e a caminhada. Devolver o café e reposicionar a conversa para o que importa é a conduta certa, e a mais difícil, porque é menos vistosa do que uma proibição.

    Prescrição
    • Autorize o retorno do café em quantidade moderada, explicitando que a decisão não depende da manchete.
    • Afira a pressão nesta consulta e reveja adesão à medicação em uso.
    • Redirecione a conversa para os fatores que de fato decidem: pressão, tabagismo, peso, atividade física.
    • Diga a frase de segurança: se aparecer palpitação ou insônia nova, reduza e me conte no retorno.
  6. 13h — o corredor da farmácia, e o reprint do representante

    Aceite o material, agradeça e não decida ali. O que se faz com um reprint é uma coisa só: ler o parágrafo que não está marcado. Procure, nos métodos, os critérios de exclusão e a frase que descreve a alocação. Procure, nos resultados, se o número destacado é o desfecho primário ou um secundário. Se o material não trouxer métodos, ele não é um estudo, é publicidade com bibliografia — e isso não é crime, é só uma informação sobre o que você tem na mão. A conduta é guardar a pergunta para a sessão clínica, onde ela vale por dez pessoas em vez de por uma.

    Prescrição
    • Leia primeiro critérios de exclusão e definição do desfecho primário.
    • Verifique se o número do cartão é o desfecho primário; se for secundário, o cartão está omitindo isso.
    • Não prescreva no mesmo dia em que recebeu o material, por regra pessoal e não por desconfiança do interlocutor.
    • Leve o artigo para a sessão clínica da semana.
  7. 14h30 — a pergunta do elenco, que quase ninguém faz

    Suponha que você tivesse sido convencido. Antes de qualquer coisa, existe uma pergunta prática que antecede a metodologia e é frequentemente decisiva no SUS: isso existe para ser prescrito? A consulta ao elenco nacional, feita para este capítulo, mostra que o corticoide injetável do esquema consta da Relação Nacional de Medicamentos Essenciais 2024 em duas apresentações, no Componente Básico; que ácido ascórbico não consta; e que tiamina consta apenas como comprimido de 300 mg, sem apresentação injetável. Dois terços do esquema não existem no elenco na via proposta. Isso não decide se o esquema funciona — decide o que acontece se você o prescrever: pedido de compra, judicialização, ou uma prescrição que a farmácia devolve.

    Prescrição
    • Antes de adotar qualquer esquema novo, confira o elenco: consta, em que apresentação, por qual componente.
    • Se não constar, saiba disso antes de prometer à família, e não depois.
    • Registre a checagem — a pergunta do elenco é parte da decisão clínica, não burocracia.
  8. 17h — o prontuário, e o que fica escrito

    O registro é onde a decisão vira ato. Escreva o que foi decidido, o que foi considerado e não feito, e o que fará você mudar de ideia. Essa terceira parte é a que quase ninguém escreve e é a que diferencia julgamento de teimosia: quem define de antemão o que o faria mudar de conduta não está sendo conservador, está sendo testável. No caso da dona Olinda: mantida a conduta atual, discutido e não iniciado o esquema adjuvante, reavaliação em 24 horas, e os gatilhos de piora listados. Se ela piorar dentro desses gatilhos, a conduta muda — e terá mudado por um critério escrito antes, não por pressão de corredor.

    Prescrição
    • Escreva os três itens: o que foi feito, o que foi considerado e recusado, e o que mudaria a decisão.
    • Comunique a decisão à enfermagem, porque quem vai perceber a piora primeiro está no posto e não na visita.
    • Deixe a reavaliação com hora, não com “conforme evolução”.
09

Como saber se está funcionando

Decisão sobre evidência não se reavalia olhando para o paciente apenas: reavalia-se olhando também para o próprio julgamento. Os parâmetros abaixo misturam as duas coisas de propósito, porque no dia seguinte elas chegam juntas.

O critério geral é o mesmo do resto da medicina: um julgamento que nunca muda não é julgamento, é hábito; e um julgamento que muda a cada corredor não é julgamento, é vento. O que separa os dois é ter escrito antes o que faria você mudar.

Resposta clínica da paciente em quem você decidiu não acrescentar nada24 horas após a decisão, com hora marcada, e não “conforme evolução”

Esperado: Queda da frequência respiratória, redução da necessidade de oxigênio, melhora do estado geral — a resposta a antibiótico em pneumonia se julga em dias

Se não melhora: Reavalie o diagnóstico e a cobertura antimicrobiana antes de reavaliar o adjuvante. A falha de resposta é argumento para revisar o que está estabelecido, não para acrescentar o que não está provado.

Diferença entre a medida bruta e a ajustada, quando o artigo completo chegar às suas mãosAo ler o artigo, e não o resumo

Esperado: As duas medidas publicadas lado a lado, com a lista de covariáveis explícita

Se não melhora: Buscar a análise completa, as covariáveis e a justificativa causal do ajuste. A ausência da medida bruta limita uma comparação, mas a diferença bruto/ajustado também não mede diretamente o confundimento. Julgar magnitude e direção pelo conjunto de vieses, medidas e pressupostos.

Aparecimento de ensaio aleatorizado sobre a mesma perguntaSempre que a pergunta voltar — e ela volta, porque quem defende um esquema o defende de novo

Esperado: Se houver ensaio, ele decide; a evidência observacional passa a servir para gerar hipótese e para descrever quem foi tratado fora do ensaio

Se não melhora: Se não houver ensaio e a pergunta for importante, essa ausência é em si um dado: pergunte por que ninguém aleatorizou. Às vezes a resposta é boa (impossibilidade ética), e às vezes é que ninguém tem interesse em saber.

Consistência entre incidência e mortalidade, quando alguém afirmar sucesso de um programaToda vez que a afirmação vier em sobrevida, taxa de detecção ou número de casos encontrados

Esperado: Se o programa funciona, a mortalidade da população cai; a incidência pode subir no começo e depois se acomodar

Se não melhora: Incidência que sobe e permanece alta com mortalidade parada é a assinatura descrita pelo INCA para sobrediagnóstico. O terreno é do capítulo O nível não está no exame, oitava posição; o que cabe aqui é fazer a pergunta.

Sua própria frequência de mudança de conduta por estudo observacionalUma vez por semestre, de memória, sem cerimônia

Esperado: Perto de zero mudanças de conduta terapêutica motivadas apenas por estudo observacional, e várias mudanças de conversa, de hipótese e de vigilância

Se não melhora: Se você mudou conduta várias vezes no semestre por achado observacional, o problema não é o seu conhecimento de método — é a distância entre saber e aplicar sob pressão de corredor. A defesa é procedimental: não decidir no mesmo dia.

Qualidade operacional do gatilho que você escreveu no prontuárioNa revisita do dia seguinte, lendo o que você mesmo escreveu

Esperado: O gatilho deve ser executável por quem está no posto às três da manhã, sem interpretar: número, sinal, ou evento observável

Se não melhora: Se o que você escreveu foi “se piorar”, você não escreveu gatilho nenhum. Reescreva com número. Gatilho subjetivo é a versão de prontuário do desfecho mole.

Destino do trabalho do colega depois da sua conversaUma semana depois

Esperado: O levantamento reorientado para o que ele responde bem, com a comparação rotulada como hipótese

Se não melhora: Se o trabalho foi abandonado, a conversa falhou — você tinha razão e destruiu trabalho bom. Se foi submetido sem mudança, também falhou. Nos dois casos, o que faltou está no bloco de conversa, e não no de método.

10

Onde o erro machuca

Tratar tamanho de amostra como garantia de qualidade — “são cinquenta mil pacientes, não tem como estar errado”

O dano: Aumentar o número de participantes encolhe a variação de amostragem e não move um milímetro a tendência sistemática. O que se obtém é uma estimativa muito bem medida do lugar errado, e uma estimativa bem medida convence muito mais do que uma vaga. Foi assim que associações observacionais enormes sustentaram condutas que ensaios depois desmentiram.

Como pegar a tempo: Separe as duas perguntas antes de olhar o n. Precisão é quanto o número varia se o estudo for refeito; viés é para que lado ele erra sempre. Só a primeira melhora com tamanho. Diante de um estudo gigante, pergunte quem entrou — não quantos.

Ler a palavra “ajustado” como se fosse um selo de qualidade

O dano: O ajuste alcança apenas o que está em alguma coluna da planilha. O confundidor que ninguém pensou, ou pensou e não coletou, ou coletou de forma grosseira, continua inteiro dentro do resultado — e o resultado ajustado tem exatamente a mesma aparência de um resultado limpo. Quando o levantamento compara tratamentos em prontuário, o que mais distorce a comparação é a razão pela qual cada paciente recebeu o que recebeu — e essa razão viveu na cabeça de quem prescreveu, nunca numa planilha.

Como pegar a tempo: Leia a lista de covariáveis como se lê uma prescrição: item por item, e reparando no que não está lá. Depois faça a pergunta única: qual confundidor plausível ficou de fora? Se você conseguir nomear um em dez segundos, o ajuste não resolveu.

Ajustar por uma variável que está no caminho causal — isto é, por um mediador

O dano: É o erro que destrói achado verdadeiro com técnica correta. Ajustar por pressão arterial ao estimar o efeito de um programa de atividade física sobre eventos cardiovasculares desconta do resultado justamente o caminho pelo qual o programa funciona; a intervenção aparece inútil. O modelo não errou de conta: respondeu outra pergunta sem avisar.

Como pegar a tempo: Aplique a regra temporal antes de aceitar qualquer covariável: foi determinada antes da exposição, ou mudou por causa dela? Idade, sexo e comorbidade prévia são candidatos a confundidor; qualquer coisa medida depois de a exposição começar precisa ser examinada antes de entrar no modelo.

Ajustar por um modificador de efeito, ou celebrar um subgrupo que ninguém pré-especificou

O dano: São os dois lados do mesmo mal-entendido. Ajustar por modificador produz uma média que não descreve nenhum paciente real — nem o do estrato de efeito grande, nem o do estrato de efeito pequeno. E subgrupo procurado depois de o resultado principal falhar é a maneira mais elegante de inventar um efeito: com estratos suficientes, sempre aparece um em que funciona.

Como pegar a tempo: Diante de efeito diferente entre estratos, mostre dois números, não um, e situe o seu paciente num deles. E pergunte sempre se o subgrupo foi declarado antes: a diretriz metodológica brasileira é explícita ao dizer que análises pré-especificadas diminuem a probabilidade de resultado espúrio.

Aceitar afirmação feita em sobrevida sem converter a pergunta para mortalidade

O dano: Sobrevida conta o tempo a partir do diagnóstico, e por isso qualquer coisa que anteveja o diagnóstico a aumenta sem prolongar vida nenhuma. O exemplo aritmético do Caderno n. 29 mostra uma população em que a introdução de um teste — sem tratamento algum — leva a sobrevida de 60% para 75% e a incidência de 5 para 8 por 100.000, com a mortalidade parada em 2. Nenhuma vida salva, e a estatística inteira melhorou.

Como pegar a tempo: Tenha uma pergunta única e automática para toda afirmação em sobrevida: morreu menos gente? Óbitos sobre a população é a única medida cujo denominador ignora a data em que o diagnóstico foi feito. Se a resposta for “não medimos”, a afirmação é de detecção, não de benefício.

Confundir “este estudo não vale para o meu paciente” com “este estudo é ruim”

O dano: O erro custa dos dois lados. Para um lado, faz descartar ensaio impecável por implicância metodológica, e o paciente perde um tratamento que funcionaria. Para o outro, e é o mais comum na enfermaria, faz aplicar resultado excelente sobre gente que teria sido excluída do estudo — idosos com múltiplas comorbidades, renais crônicos, pacientes de serviço sem retaguarda — e chamar isso de medicina baseada em evidência.

Como pegar a tempo: Julgue nos dois andares e nesta ordem. Primeiro validade interna: o número está certo para quem estava lá? Depois validade externa: o meu paciente teria sido incluído? A diretriz brasileira de acurácia é útil aqui — viés produz resultado errôneo; variabilidade entre populações não enviesa nada e apenas limita a aplicabilidade.

11

O que dizer ao paciente e à família

Tudo o que este capítulo ensina precisa passar por uma conversa para virar conduta, e é aí que a maioria dos internos perde. O conhecimento de método tem um efeito colateral social conhecido: transforma quem o adquiriu numa pessoa insuportável por cerca de seis meses. Vale evitar essa fase.

Três regras servem para todas as falas abaixo. Primeira: pergunte, não corrija — quase toda objeção metodológica cabe numa pergunta, e a pergunta preserva o interlocutor. Segunda: nunca use a palavra viés como acusação; ela descreve o estudo, não quem o cita. Terceira: nomeie o que o estudo ainda sustenta antes de dizer o que ele não sustenta, porque quase sempre ele sustenta alguma coisa, e reconhecer isso é o que faz o resto ser ouvido.

As falas estão escritas para serem ditas em voz alta, do jeito que se fala mesmo. Ajuste ao seu vocabulário; o que não se deve ajustar é a ordem.

Ao colega que fez o levantamento de prontuário e quer implantar o achado

“Cara, isso deu um trabalho enorme e o dado é bom. Deixa eu entender uma coisa antes: nesses três anos, quem decidia quem recebia o esquema? Era protocolo escrito ou era o plantonista na hora? Pergunto porque se foi o plantonista olhando o paciente, a gente tem um problema chato — não com o teu trabalho, com o que ele consegue provar. E olha, tem uma coisa aqui que ninguém do serviço sabe e teu dado responde sozinho: quantos pacientes com pneumonia grave a gente interna por ano e qual a nossa letalidade. Isso vale uma apresentação por si só.”

Não diga: Evite “isso é só uma coorte retrospectiva” e qualquer frase que comece com “o problema é que”. E evite dar a aula de confusão por indicação antes de o colega ter respondido quem decidia — a resposta dele é que abre a conversa, e ele chega sozinho onde você quer.

À preceptora que citou aumento de sobrevida como prova de que um programa funcionou

“Doutora, fiquei curioso com esse número. A senhora chegou a ver se tinha dado de mortalidade também? Pergunto porque nesses programas a sobrevida às vezes sobe pela simples antecipação do momento em que se dá o nome à doença, e eu queria entender se aí a mortalidade acompanhou. Se a senhora quiser, eu procuro e trago amanhã.”

Não diga: Evite explicar viés de tempo de antecipação na frente da equipe inteira — é corrigir preceptor em público, e o custo é alto e desnecessário. Evite também o tom de quem já sabe a resposta. E se você se ofereceu para procurar, procure de verdade e traga; não fazer isso é pior do que não ter perguntado.

Ao paciente que chega com a manchete no celular

“Deixa eu ver... esse estudo é de verdade, seu Amélio, e ele acompanhou quem já tomava café — não sorteou quem ia tomar. A diferença importa porque quem toma café costuma ser diferente de quem não toma em outras coisas que também mexem com o coração, o cigarro principalmente. Então esse estudo não prova que o café protege. Mas eu vou te responder o que o senhor veio perguntar: pode voltar a tomar. No seu caso, o que decide o risco do seu coração é a pressão controlada, o cigarro e a caminhada — não é o café.”

Não diga: Evite terminar em “isso é só associação, não causa”: é verdadeiro, é incompreensível e deixa o paciente sem resposta, e ele vai decidir sozinho. Evite também proibir por precaução — proibição sem base gasta a confiança que você vai precisar quando proibir com base.

Ao representante que deixou o material no corredor

“Obrigado, vou ler com calma. Uma coisa que me ajuda: esse número aqui destacado é o desfecho primário do estudo ou é secundário? E vocês têm o artigo completo, com os métodos? Eu não decido conduta no mesmo dia em que recebo material — é regra minha, não é nada com você. Se eu tiver dúvida depois de ler, eu procuro.”

Não diga: Evite hostilidade e evite constrangimento: recusar o material não o torna mais íntegro, e aceitar não o compromete. O que compromete é prescrever no mesmo dia. Evite também discutir metodologia no corredor com quem foi treinado para essa conversa — você perde por falta de tempo, não por falta de razão.

À família da paciente, quando alguém já comentou do “remédio novo” no corredor

“A senhora ouviu falar de um esquema que alguns serviços estão usando, e eu quero ser honesto: ele até pode funcionar, mas ainda não foi testado do jeito que dá segurança para a gente. Hoje, na sua mãe, o antibiótico está no segundo dia e ela não piorou — isso é o esperado, e é cedo para julgar. Combinei com a equipe de reavaliar amanhã de manhã, no mesmo horário, e deixei escrito no prontuário o que a gente vai considerar piora. Se acontecer qualquer uma dessas coisas antes disso, a enfermagem me chama e a gente muda.”

Não diga: Evite “não tem evidência” — a frase soa como recusa de esforço. Evite também prometer que o esquema seria dado depois; e evite mencionar que existe um estudo sem dizer o que ele não mostra, porque a família guarda a existência do estudo e esquece a ressalva.

Na sessão clínica, ao apresentar um artigo que você acha frágil

“Antes de discutir o resultado, queria que a gente olhasse três frases dos métodos: quem foi incluído, quem foi excluído e quem decidiu a alocação. A minha leitura é que o estudo sustenta bem a descrição da população e a hipótese, e não sustenta o verbo que está no título. Mas eu posso estar sendo duro — alguém leu diferente?”

Não diga: Evite apresentar a crítica como conclusão fechada; a sessão clínica é o lugar de deixar aberto. Evite listar seis vieses: escolha o que muda a decisão. Um problema bem exposto convence; seis problemas viram implicância.

Quando alguém devolve “então nada serve, você nunca acredita em nada”

“Não é isso. Eu acredito, sim — o que eu faço é ajustar quanto o estudo me autoriza a mudar. Esse aqui me autoriza a levantar a hipótese e a ficar de olho; não me autoriza a mudar prescrição de paciente grave. São coisas diferentes e as duas são decisões. Se aparecer um ensaio aleatorizado com o mesmo resultado, eu mudo no mesmo dia.”

Não diga: Evite defender a própria consistência com exemplos antigos e evite ironia. E evite a armadilha de virar a pessoa que nunca muda de conduta: ceticismo que nunca é revisto é apenas outro hábito. Diga em voz alta o que faria você mudar — é isso que separa julgamento de teimosia.

12

Onde bons médicos discordam

Nestes pontos as fontes não dizem a mesma coisa. Cada posição vem com quem a sustenta — e com o que pesa na hora de decidir para o seu paciente.

Numa síntese de estudos observacionais, deve-se combinar as medidas ajustadas ou as brutas? A própria diretriz brasileira registra que não há consenso documentado sobre como sintetizar achados ajustados e não ajustados — e a escolha muda o número que chega até você.

Combinar as medidas brutas, aceitando a heterogeneidade do ajuste como ruído

É a via mais simples e a única que garante que todos os estudos entrem na mesma conta. Como cada autor ajustou por uma lista diferente de covariáveis, combinar medidas ajustadas é combinar coisas que não são a mesma coisa; a diferença entre as listas é, ela própria, uma fonte de heterogeneidade — numa metanálise brasileira sobre tabagismo materno e desmame precoce, o grau de ajuste respondia por 14,4% da heterogeneidade entre os estudos. Combinando as brutas, ao menos se sabe o que foi somado. A diretriz metodológica registra essa opção e também a sua fraqueza: é o tipo de análise que se usa em metanálise de ensaios aleatorizados, que têm na aleatorização o meio de eliminar o efeito das variáveis de confusão — o que não é o caso dos observacionais, de modo que o resultado é de difícil interpretação.

Brasil. Ministério da Saúde/Decit. Diretrizes metodológicas: revisão sistemática e metanálise de estudos observacionais, 2014, seção sobre síntese quantitativa.

Combinar apenas os estudos que ajustaram para um conjunto pré-definido de covariáveis

Se o problema é que as listas divergem, fixa-se a lista: define-se antes quais confundidores são indispensáveis e entram na metanálise apenas os estudos que os controlaram. O número que sai é mais interpretável, porque descreve o efeito depois de descontado o mesmo conjunto de fatores em todos os estudos. A mesma diretriz registra a objeção, e ela é séria: essa abordagem restringe o número de evidências disponíveis para responder à pergunta, contrariando o princípio básico da revisão sistemática, que é apresentar toda a evidência existente. Na prática, com poucos estudos disponíveis, o critério pode esvaziar a metanálise — e a régua usual de dez estudos por variável ajustada mostra o tamanho do aperto: quatro covariáveis exigiriam quarenta estudos.

Brasil. Ministério da Saúde/Decit. Diretrizes metodológicas: revisão sistemática e metanálise de estudos observacionais, 2014, mesma seção, com as duas objeções declaradas pelo próprio documento.

Como decidir

Identificar se a síntese combinou estimativas brutas ou ajustadas, com quais covariáveis e critérios de seleção. Confundimento pode aumentar, reduzir ou inverter uma associação: a medida bruta não é necessariamente um teto. Comparar análises ajuda a avaliar robustez, mas não quantifica por si o confundimento, especialmente para OR não colapsáveis. Interpretar a confiança pela pergunta causal, qualidade dos estudos, heterogeneidade e plausibilidade dos ajustes, sem transferir automaticamente o resultado à conduta.

Diante de uma variável que pode ser confundidor ou mediador — pressão arterial num estudo sobre exercício e eventos, peso ao nascer num estudo sobre exposição materna e desfecho neonatal —, ajusta-se ou não?

Ajustar, porque confundidor não controlado é o risco maior e mais frequente

Quem sustenta esta posição parte de uma assimetria de frequência: na medicina observacional, o erro que aparece toda semana é o confundimento não tratado, e o ajuste por mediador é um problema mais raro e mais acadêmico. Deixar de ajustar por medo de mediação abre a porta para o erro comum a fim de evitar o incomum. Há ainda um argumento prático: nem sempre se sabe se a variável é mediadora, e a estrutura causal não vem escrita no artigo; ajustar produz, ao menos, uma estimativa conservadora, que erra na direção de achar menos efeito — o que é o lado seguro do erro quando o que está em jogo é adotar um tratamento novo.

Posição inferida do modo como as diretrizes metodológicas brasileiras tratam o ajuste: elas descrevem as três técnicas de controle de confundimento em detalhe e não trazem, nesses volumes, a distinção entre confundidor e mediador nem advertência contra ajustar por variável posterior à exposição.

Não ajustar por variável determinada depois da exposição, e declarar qual efeito se está estimando

Quem sustenta esta posição parte da direção do erro: o ajuste por mediador não erra para o lado seguro, erra para o lado de apagar um efeito verdadeiro, e um tratamento que funciona aparece como inútil. Além disso, o mesmo modelo passa a responder uma pergunta diferente — o efeito direto, que não passa pelo mediador — sem que isso seja declarado em lugar nenhum. A regra que decorre é temporal e simples: variável determinada antes da exposição pode ser confundidor; variável que mudou por causa da exposição precisa ser examinada antes de entrar no modelo, e o que se estima com ela dentro tem de ser dito com todas as letras.

Não há documento brasileiro em uso que faça esta distinção com estas palavras. A formulação acima, inclusive a regra temporal, é leitura deste capítulo sobre o mecanismo, e está declarada como tal também no bloco de investigação.

Como decidir

Decida pela pergunta que o seu paciente faz, e não pela elegância do modelo. Se a pergunta é “vale a pena entrar neste programa?”, o que interessa é o efeito total, com todos os caminhos incluídos — e então ajustar pelo mediador é errado. Se a pergunta é “este benefício vem só da queda de pressão, ou há mais coisa?”, aí o efeito direto é o alvo e o ajuste é o método, desde que a pergunta seja dita. Diante de um artigo, aplique a regra temporal à lista de covariáveis: se alguma delas foi medida depois de a exposição começar e o texto não explica por que ela está ali, rebaixe a confiança na magnitude — o efeito verdadeiro pode ser maior do que o publicado, e não menor, que é o oposto do que o leitor costuma supor.

Quando aleatorizar é inviável ou antiético, evidência observacional basta para mudar conduta? Dois documentos brasileiros vigentes respondem de maneiras difíceis de conciliar.

Não basta: sem ensaio aleatorizado com desfecho duro, a prática é experimental e o paciente tem de saber disso

É a posição escrita no Caderno de Atenção Primária n. 29, de 2010, e ela é mais dura do que a prática cotidiana. O documento afirma que, dada a natureza complexa e imprevisível dos vieses, o meio mais confiável de provar efetividade é demonstrar redução de mortalidade ou morbidade em ensaios clínicos aleatorizados com análise por intenção de tratar; e conclui que os procedimentos que não passaram por esse padrão deveriam ser considerados experimentais, com benefícios não comprovados, e que os pacientes deveriam ser informados disso antes de consentir. A força da posição é a coerência: ela não abre exceção conforme a conveniência, e transfere a decisão para o paciente informado em vez de resolvê-la no consultório.

Brasil. Ministério da Saúde/DAB. Rastreamento. Cadernos de Atenção Primária n. 29, 2010, seção sobre avaliação dos testes de rastreamento — documento cujo caráter de régua em uso é confirmado por citação nominal do INCA em 2021.

Basta, sob método explícito: é para isso que existe metodologia de síntese de estudos observacionais

O mesmo Ministério da Saúde dedicou, em 2014, um volume metodológico completo à síntese de estudos observacionais sobre fatores de risco e prognóstico, justificado pela lacuna na produção nacional e pela necessidade de padronizá-la. Documento de método não se escreve para evidência que não vai ser usada: a existência da diretriz reconhece que decisões — inclusive de incorporação de tecnologia — se apoiam em evidência observacional quando não há ensaio. A força desta posição é prática: há perguntas que nunca serão aleatorizadas, por impossibilidade ética ou logística, e recusar-se a decidir também é uma decisão, tomada às cegas e sem método.

Brasil. Ministério da Saúde/Decit. Diretrizes metodológicas: revisão sistemática e metanálise de estudos observacionais, 2014, apresentação e justificativa.

Como decidir

Diante de um paciente concreto, o que resolve não é saber qual das duas posições vence no abstrato: é medir de que lado fica o dano maior. Pergunte três coisas. Primeira: o que acontece se eu adotar e estiver errado? Se a intervenção é barata, reversível e pouco tóxica, o custo do erro é baixo e a evidência observacional pode bastar. Se ela é invasiva, tóxica ou irreversível, o custo do erro é alto e a exigência sobe. Segunda: o que acontece se eu não adotar e estiver errado? Numa doença sem alternativa, o custo da omissão é grande e muda a conta. Terceira: existe alguém que poderia ter aleatorizado e não quis? Se sim, a ausência de ensaio é informação sobre o interesse, e não sobre a viabilidade. No caso da vinheta — esquema adjuvante, três drogas, paciente que não está piorando, ensaio perfeitamente factível e ainda não feito —, as três respostas apontam para o mesmo lado. Em outro paciente, com outra doença, elas podem apontar para o outro, e isso não é incoerência: é a decisão sendo tomada onde ela deve ser tomada. Onde essa fronteira fica no rastreamento populacional, que é um caso especial e mais rígido, é assunto do capítulo O nível não está no exame, oitava posição desta apostila.

13

O raciocínio, em voz alta

Sete e vinte de uma quinta-feira, sala de prescrição da enfermaria de clínica médica. A residente Auta Crisóstomo mostra o levantamento: 118 pacientes internados com pneumonia adquirida na comunidade grave nos últimos três anos, identificados pelo código de alta. Trinta e nove receberam um esquema adjuvante de três drogas que um dos staffs passou a usar a partir de 2023; setenta e nove não receberam. Óbito hospitalar em 4 dos 39 que receberam e em 19 dos 79 que não receberam. Ela já calculou: cerca de 10% contra 24%, e um valor de p pequeno. O texto do resumo que ela escreveu diz que o esquema reduziu a mortalidade. Ela quer submeter ao congresso e quer começar hoje na dona Olinda Jaques, do leito 9. Os números estão corretos; ninguém errou uma conta. Trabalhe o caso com as quatro perguntas, na ordem.

  1. Passo 1 — nomeie o desenho antes de olhar o resultado, e diga o que ele entrega

    É uma coorte retrospectiva de prontuário: os pacientes foram agrupados pela exposição — receber ou não o esquema — e seguidos até o desfecho, que já havia ocorrido quando os dados foram coletados. Esse desenho entrega bem incidência de óbito em cada grupo, descrição da população internada e geração de hipótese. Não entrega o verbo reduziu, porque quem entrou em cada grupo não foi sorteado. A taxonomia dos desenhos e o que cada um responde estão no capítulo O desenho decide a pergunta, quarta posição; aqui a nomeação serve só para calibrar o que se pode afirmar.

  2. Passo 2 — pergunta 1: quem entrou, e quem ficou de fora

    Duas coisas a apurar. A primeira: a identificação foi pelo código de alta, o que significa que entraram os pacientes que alguém codificou como pneumonia grave — quem morreu na emergência antes de ser internado e codificado provavelmente não está na série, e quem tem o diagnóstico registrado de outro jeito também não. É um viés de seleção na porta, e ele tende a excluir os mais graves. A segunda: a inclusão foi consecutiva? A diretriz brasileira de estudos observacionais é direta ao dizer que, se nem todos os elegíveis foram incluídos consecutivamente, o risco de viés de seleção é alto. Aqui, todos os localizáveis entraram — o problema não é a exclusão deliberada, é a porta de entrada do código.

  3. Passo 3 — pergunta 2: quem mediu, e mediu igual nos dois grupos

    O desfecho é óbito hospitalar. Essa é a melhor notícia do trabalho: é um desfecho duro, que não depende de julgamento de quem avalia e não se deixa distorcer por observador que sabe o grupo. Se o desfecho fosse melhora radiológica ou resolução do quadro, ele estaria contaminado. Mas há um detalhe de aferição a checar: óbito hospitalar exclui quem morreu depois da alta, e se um dos grupos recebeu alta mais cedo, o desfecho está medido em janelas diferentes. Pergunte se há mortalidade em 30 dias — se houver, é ela que vale.

  4. Passo 4 — pergunta 3: o que mais mudou junto, e onde ele não está

    Aqui está o problema central, e ele não é sutil. Quem recebeu o esquema foi escolhido por um médico, à beira do leito, olhando para o paciente. Essa escolha é o confundidor mais forte da comparação e não tem coluna nenhuma na planilha: é a confusão por indicação. A pergunta que abre tudo é quem decidia e olhando para quê. Se o staff oferecia o esquema aos que pareciam ter chance, estar no grupo tratado já é sinal de prognóstico melhor, e a diferença estava decidida antes de qualquer droga entrar na veia. Se ele oferecia aos mais graves, o viés corre para o outro lado. As duas hipóteses são compatíveis com os mesmos números, e a planilha não distingue entre elas.

  5. Passo 5 — o confundidor que ninguém suspeita: o calendário

    O esquema começou a ser usado em 2023, e a série cobre três anos. Isso significa que a comparação entre tratados e não tratados é, em parte, uma comparação entre períodos do serviço. Entre 2023 e hoje mudaram o antibiótico empírico da casa, o tempo até a primeira dose, a escala de enfermagem e talvez o critério de vaga na unidade intensiva. Qualquer uma dessas coisas move mortalidade em pneumonia grave, e nenhuma delas está na planilha. É por isso que comparação com controle histórico é frágil mesmo quando o efeito é grande: o mundo inteiro é a variável não medida.

  6. Passo 6 — o que o ajuste resolveria, e o que não resolveria

    Suponha que a Auta ajuste por idade, comorbidades e um escore de gravidade da admissão, ou construa um escore de propensão. Vale a pena, e melhora o trabalho — e é aqui que a definição correta importa: o escore de propensão modela a probabilidade de o paciente receber a exposição dadas as suas características, e não a probabilidade de ele morrer. É exatamente por modelar a alocação que ele é a ferramenta natural para o problema da indicação. Mas nenhum ajuste alcança o que não foi medido, e o que decidiu a alocação aqui — a impressão do plantonista sobre aquele paciente naquela noite, a conversa com a família, a sensação de que valia a pena tentar — não está em coluna alguma. Depois de tudo ajustado, sobra confundimento residual com aparência de resultado limpo.

  7. Passo 7 — pergunta 4: e a dona Olinda?

    Mesmo que o achado fosse verdadeiro, faltaria a pergunta de transporte. A dona Olinda tem 71 anos, está no segundo dia de antibiótico e não piorou. Nos 39 tratados da série, quantos eram desse perfil? Se o esquema foi usado sobretudo em quem estava em deterioração, a série não fala de uma paciente estável no segundo dia. Um número certo sobre outra gente continua sendo um número sobre outra gente.

  8. Passo 8 — a decisão, e a frase que a sustenta

    Não iniciar o esquema hoje; manter antibiótico e suporte; reavaliar em 24 horas com hora marcada e gatilhos escritos. Registrar no prontuário que o esquema foi discutido e não iniciado, com o motivo em uma linha. E, à parte da decisão clínica, existe a pergunta do elenco: a consulta à Relação Nacional de Medicamentos Essenciais 2024 mostra que o corticoide injetável consta, que ácido ascórbico não consta e que tiamina consta apenas como comprimido de 300 mg — dois dos três componentes não existem no elenco nacional na via proposta. A frase que resume o caso para a Auta é uma só, e não desqualifica o trabalho dela: o levantamento mede muito bem o julgamento de quem indicou, e é esse julgamento, e não o esquema, que separa os dois grupos.

14

Faça você

Terça-feira, dez da manhã, sala de reuniões da unidade de pronto atendimento. A coordenação apresenta um teste de imagem à beira do leito que a gestão quer implantar para descartar uma condição cirúrgica abdominal e reduzir o encaminhamento ao hospital de referência, a cento e dez quilômetros. O material traz um estudo com 412 pacientes atendidos num serviço de emergência, sensibilidade de 96% e especificidade de 88%, e a conclusão de que o teste permite excluir com segurança a doença. Na seção de métodos, três frases importam. Primeira: foram incluídos pacientes com suspeita clínica encaminhados ao setor de imagem. Segunda: o padrão de referência foi o achado cirúrgico, e os pacientes com teste negativo que não foram operados tiveram o diagnóstico definido pela evolução registrada em prontuário. Terceira: o radiologista que interpretou o teste tinha acesso ao prontuário e ao laudo do ultrassom prévio. O seu Leonel Fidalgo, 62 anos, está no leito 3 da observação com dor abdominal há dezoito horas, e a decisão de transferi-lo ou não vai ser tomada hoje com base nesse teste. Trabalhe os passos e só então leia a resposta.

  1. Passo 1

    Comece pela porta de entrada. Quem entrou nesse estudo? Escreva com suas palavras que população os 412 pacientes representam e em que ela difere da população que chega à sala de observação de uma unidade de pronto atendimento.

  2. Passo 2

    Olhe o padrão de referência. Todos os 412 foram submetidos ao mesmo padrão? Se não, quem foi para um e quem foi para outro — e o que determinou isso?

  3. Passo 3

    Nomeie os vieses de verificação presentes e explique por que não é possível fixar a direção de erro nas duas medidas apenas com esse resumo.

  4. Passo 4

    Volte à terceira frase dos métodos, sobre o radiologista. Que viés ela descreve, e o que ela faz com a concordância entre o teste novo e o padrão de referência?

  5. Passo 5

    Pergunte-se se algum dos problemas identificados é corrigível na análise, como o confundimento seria. Justifique.

  6. Passo 6

    Decida sobre o seu Leonel: você usaria o teste, e para quê? Escreva a conduta e a frase que você diria a ele.

Ver como fecharíamos

A amostra é de pacientes selecionados para imagem, cuja gravidade e probabilidade de doença podem diferir das pessoas na UPA. Nem todos receberam o mesmo padrão de referência, e a escolha foi influenciada pelo teste índice: há risco de verificação parcial e diferencial. Não se pode afirmar a direção exata do erro em sensibilidade e especificidade sem conhecer verificação, perdas e desempenho do padrão alternativo. Acesso a dados clínicos pode ser parte do uso pretendido do exame; é necessário distinguir esse contexto de conhecimento do padrão de referência, que gera viés de revisão. Incorporação só ocorre se o teste integra a definição de referência, algo a verificar, não a presumir. Métodos estatísticos podem explorar alguns vieses sob pressupostos fortes, mas não criam a informação ausente. Para Leonel, o estudo não sustenta usar sozinho o resultado negativo para dar alta nem o positivo como prova suficiente para operar. Integrar sinais, evolução, exame físico e avaliação cirúrgica; diante de peritonismo, instabilidade ou outra gravidade, encaminhar urgentemente sem esperar nova janela de observação. A gestão precisa validar a estratégia diagnóstica no cenário-alvo, com referência adequada, interpretação definida e seguimento dos negativos.

Gabarito da questão de abertura
Comentário

Erro aleatório e erro sistemático são coisas distintas e respondem a intervenções distintas. O erro aleatório vem do tamanho finito da amostra, é o que o intervalo de confiança descreve, e diminui quando a amostra cresce. O viés é uma tendência que empurra a estimativa sempre para o mesmo lado, não é descrito pelo intervalo de confiança e não é corrigido pelo tamanho da amostra — aumentar o n apenas mede o valor deslocado com mais precisão. É por isso que uma coorte enorme pode produzir um intervalo estreitíssimo em torno de um número errado, e é por isso que um número preciso convence mais do que um impreciso, o que agrava o problema. Risco relativo é justamente a medida própria da coorte, porque há denominador de pessoas em risco, de modo que a objeção sobre razão de chances não se sustenta. E o intervalo, além de testar o nulo, informa sim a faixa plausível de magnitude. A resposta correta é a que separa precisão de acurácia e nega que o tamanho da amostra proteja contra viés.

15

Teste-se

Cada uma é um ponto de bifurcação: o que você faz agora. O comentário abre a cada decisão ou só no fim — você escolhe.

Sorteando as questões…
16

Plano de revisão

Em 7 dias

Sem consultar o texto, resolva a cena de abertura: Avaliar vieses, ajuste e validade externa antes de mudar tratamento por um artigo. Descreva os achados que sustentam a decisão, um erro evitável e o plano para mudança do quadro; depois compare com o caso resolvido.

Em 30 dias

Retome um caso real acompanhado sob supervisão ou simule o caso do capítulo. Explique o que mudou na sua decisão, confira se o próximo passo ocorreu e identifique uma melhoria concreta. Não use dados identificáveis fora do ambiente autorizado. Competência a demonstrar: Avaliar vieses, ajuste e validade externa antes de mudar tratamento por um artigo.

17

Agora atenda

Agora atenda: homem de 62 anos, diabético, segurança patrimonial, internado há quatro dias na enfermaria por celulite na perna direita, que reclama que a febre não passa apesar do antibiótico. Conduza o caso com busca ativa de outros focos. Antes de aceitar a conclusão pronta — febre depois de três dias de antibiótico é falha, troque o antibiótico —, passe-a pela ordem do capítulo, em palavras de enfermaria: de que pacientes vem essa regra, quem mediu a febre e como, o que mais mudou nele nesses mesmos dias e se a regra serve para ele. Feche com o plano de conduta e diga em voz alta, e escreva, o que faria você mudar de ideia.

Vieses, confundimento e validade – Quem entrou, quem mediu, o que mais mudou — Internato | OsceLabs