Outras EspecialidadesEpidemiologia e bioestatística

Sensibilidade, especificidade e valores preditivos

Sensibilidade, especificidade, valores preditivos e curva ROC

Tabela 2×2, desempenho diagnóstico e efeito da prevalência

01

Responda antes de ler

Escolha uma alternativa agora, mesmo sem certeza. Errar aqui faz parte — é o que faz a resposta certa grudar depois.

Questão de abertura

Em uma campanha de rastreamento, um novo teste para determinada doença é aplicado em 1.000 pessoas. A prevalência real da doença nessa população é de 100 casos. O teste identificou corretamente 90 dos 100 doentes como positivos e classificou corretamente 810 dos 900 não doentes como negativos. Com base nesses dados, qual é, aproximadamente, o valor preditivo positivo (VPP) do teste nessa população?

02

Como esse tema cai

Este capítulo não tem diretriz para decorar. Sensibilidade, especificidade, valor preditivo e área sob a curva são definições matemáticas: nenhuma sociedade médica as revisa, nenhuma versão nova sai no ano que vem. O que a prova cobra é se você sabe montar uma tabela de quatro casas e escolher o denominador certo — e, sobretudo, se você sabe o que acontece com cada medida quando a prevalência da doença muda.

Esse é o movimento único que aparece na maioria absoluta das questões do tema, em todas as bancas: pegam um teste com sensibilidade e especificidade fixas, mudam o cenário — do ambulatório de referência para o rastreamento populacional, do pronto-socorro para a unidade básica — e perguntam o que aconteceu. Quem entendeu que sensibilidade e especificidade vivem dentro das colunas da tabela, e que os valores preditivos vivem dentro das linhas, responde sem calculadora. Quem decorou as fórmulas soltas erra por denominador trocado.

As fontes brasileiras existem e são boas. O Ministério da Saúde publicou, pelo rebrats, uma diretriz metodológica inteira sobre estudos de acurácia diagnóstica, com a tabela 2×2, todas as fórmulas e dois exemplos numéricos resolvidos que demonstram o efeito da prevalência. A Sociedade Brasileira de Pneumologia e Tisiologia publicou uma série curta de educação continuada sobre o mesmo tema. Todo número deste capítulo vem de lá ou de material didático de instituição pública brasileira, e todo cálculo está feito passo a passo — a ideia é que você refaça cada um no rascunho da prova, sem calculadora.

03

O que muda decisão

A tabela 2×2: quem manda nas colunas é o padrão de referência

Todo o tema cabe numa tabela de quatro casas. A convenção da diretriz metodológica do Ministério da Saúde é a que as bancas usam: nas colunas vai a verdade — doença presente (+) ou ausente (−) —, definida pelo padrão de referência, que é o melhor teste disponível e é assumido como quem estabelece a verdadeira presença ou ausência da doença. Nas linhas vai o teste índice, aquele que está sendo avaliado: positivo, quando o valor fica acima do ponto de corte, ou negativo, quando fica abaixo.

Os quatro quadrantes recebem letras. A célula a é o verdadeiro-positivo: teste positivo em quem tem a doença. A célula b é o falso-positivo: teste positivo em quem não tem. A célula c é o falso-negativo: teste negativo em quem tem a doença. A célula d é o verdadeiro-negativo: teste negativo em quem não tem. Somando pelas colunas você obtém o total de doentes (a+c) e o total de não-doentes (b+d). Somando pelas linhas você obtém o total de testes positivos (a+b) e o total de testes negativos (c+d). O total geral é N = a+b+c+d.

Aí está o capítulo inteiro, e vale gastar dez segundos com isso antes de qualquer conta. Medida que divide pelo total de uma coluna condiciona à doença: é sensibilidade ou especificidade, e responde 'dado que a pessoa tem (ou não tem) a doença, o que o teste faz?'. Medida que divide pelo total de uma linha condiciona ao resultado do teste: é valor preditivo, e responde 'dado que o teste deu este resultado, o que a pessoa tem?'. Quem erra este tema quase sempre erra exatamente aqui: acerta o numerador e divide pelo denominador da direção errada.

Uma advertência de leitura: nem toda prova desenha a tabela com a doença nas colunas — algumas invertem, e algumas nem desenham tabela nenhuma, entregando só percentuais no texto. Não decore posição; decore denominador. Sensibilidade sempre divide pelo número de doentes. Especificidade sempre divide pelo número de não-doentes. Valor preditivo positivo sempre divide pelo número de testes positivos. Valor preditivo negativo sempre divide pelo número de testes negativos. Se você monta a tabela lendo os denominadores, a orientação escolhida pelo enunciado deixa de importar.

Sensibilidade e especificidade: as medidas que a prevalência não move

A sensibilidade é a probabilidade condicional de o teste ser positivo dado que a doença está, de fato, presente. Em letras: sensibilidade = a/(a+c). A especificidade é a probabilidade condicional de o teste ser negativo dado que a doença está, de fato, ausente: especificidade = d/(b+d). São medidas condicionadas ao estado de doença — cada uma calculada dentro de uma coluna só.

Um cálculo com os números do próprio documento oficial. No primeiro exemplo da diretriz do Ministério da Saúde, a tabela tem a = 81, b = 591, c = 45 e d = 674, num total de 1.391 pessoas. A coluna dos doentes soma 81 + 45 = 126; a dos não-doentes, 591 + 674 = 1.265. Sensibilidade = 81/126 = 0,64: na amostra, 64% dos pacientes que têm a doença foram corretamente identificados pelo teste índice. Especificidade = 674/1.265 = 0,53: 53% dos que não têm a doença foram corretamente liberados. Repare que o cálculo nunca cruzou de uma coluna para a outra.

Cada uma serve a um resultado. Sensibilidade alta significa poucos falsos-negativos — logo, um resultado negativo de um teste muito sensível afasta bem a doença. Especificidade alta significa poucos falsos-positivos — logo, um resultado positivo de um teste muito específico confirma bem. É a ponta que costuma ser trocada nas alternativas: 'teste altamente sensível, portanto o positivo confirma o diagnóstico' está errado; o que o teste sensível faz bem é descartar quando dá negativo.

O ponto que decide a maioria das questões: sensibilidade e especificidade não são afetadas pela prevalência da doença. A razão é aritmética e não exige fé. Se a prevalência cai, a coluna dos doentes encolhe — mas encolhem juntos o numerador (verdadeiros-positivos) e o denominador (todos os doentes), e a proporção fica onde estava. Mudar a prevalência muda o tamanho das colunas; não muda a proporção dentro de cada uma. Há uma condição fina, que a diretriz também registra e que aparece na seção sobre vieses: isso vale enquanto o perfil e a gravidade dos pacientes forem os mesmos. Prevalência diferente por causa de espectro de doença diferente é outra coisa — e aí sensibilidade e especificidade podem, sim, mudar.

Vale nomear desde já os complementos, porque eles reaparecem na curva ROC. A fração de falsos-positivos é 1 − especificidade = b/(b+d). A fração de falsos-negativos é 1 − sensibilidade = c/(a+c). No exemplo acima: 1 − 0,53 = 0,47 de falsos-positivos e 1 − 0,64 = 0,36 de falsos-negativos.

VPP e VPN: as medidas que a prevalência move — e o cálculo que prova

O valor preditivo positivo é a probabilidade de o indivíduo ter realmente a doença, dado que apresentou um resultado positivo: VPP = a/(a+b). O valor preditivo negativo é a probabilidade de o indivíduo realmente não ter a doença, dado que apresentou um resultado negativo: VPN = d/(c+d). São medidas condicionadas ao resultado do teste — cada uma calculada dentro de uma linha só. É o que a pessoa sentada na sua frente pergunta: ela não quer saber o que o teste faz com os doentes em geral; ela quer saber o que o resultado dela significa.

Agora a demonstração. Pegue um único teste, com sensibilidade de 90% e especificidade de 90%, e aplique-o em dois cenários que diferem apenas na prevalência. Nada no teste muda: mesmo kit, mesmo ponto de corte, mesmo tipo de paciente.

Cenário 1 — ambulatório de referência, prevalência de 30%, 1.000 pacientes. Doentes: 30% de 1.000 = 300. Não-doentes: 700. A sensibilidade de 90% sobre 300 doentes dá a = 270 verdadeiros-positivos e deixa c = 30 falsos-negativos. A especificidade de 90% sobre 700 não-doentes dá d = 630 verdadeiros-negativos e deixa b = 70 falsos-positivos. Então: VPP = 270/(270+70) = 270/340 = 0,79, ou 79%. VPN = 630/(630+30) = 630/660 = 0,95, ou 95%.

Cenário 2 — inquérito populacional, prevalência de 1%, 10.000 pessoas. Doentes: 1% de 10.000 = 100. Não-doentes: 9.900. A sensibilidade de 90% sobre 100 doentes dá a = 90 verdadeiros-positivos e c = 10 falsos-negativos. A especificidade de 90% sobre 9.900 não-doentes dá d = 8.910 verdadeiros-negativos e b = 990 falsos-positivos. Então: VPP = 90/(90+990) = 90/1.080 = 0,083, ou 8,3%. VPN = 8.910/(8.910+10) = 8.910/8.920 = 0,999, ou 99,9%.

O veredito. O mesmo teste, com a mesma sensibilidade de 90% e a mesma especificidade de 90%, tem valor preditivo positivo de 79% num cenário e de 8,3% no outro. A causa é visível na conta: os falsos-positivos saem do grupo dos não-doentes, e quando a doença é rara esse grupo é enorme. Dez por cento de 9.900 pessoas são 990 falsos-positivos, contra apenas 90 verdadeiros-positivos — onze resultados positivos falsos para cada um verdadeiro. É exatamente o que a diretriz do Ministério da Saúde escreve: quando a prevalência é baixa, o valor preditivo positivo é baixo, independentemente dos valores de sensibilidade e especificidade.

A direção é sempre a mesma e vale guardá-la como regra fixa: prevalência sobe, o VPP sobe e o VPN cai; prevalência cai, o VPP cai e o VPN sobe. Metade das questões do tema se resolve só com essa direção, sem conta nenhuma. A outra metade pede o número, e aí a receita é a das duas contas acima: escolha um N redondo, quebre a população em doentes e não-doentes pela prevalência, aplique sensibilidade na coluna dos doentes e especificidade na dos não-doentes, e só então divida pela linha.

Um último detalhe que a diretriz registra e que ajuda a interpretar tabela de estudo: 'prevalência' na tabela 2×2 é (a+c)/N, a proporção de doentes segundo o padrão de referência. Se o estudo recrutou doentes e controles em números escolhidos pelo pesquisador — o chamado caso-controle diagnóstico —, essa proporção é um artefato do recrutamento, e qualquer VPP calculado a partir dela não descreve população nenhuma.

Duas populações do mesmo tamanho com os resultados positivos destacados: na de alta prevalência quase todos os destacados são realmente doentes; na de baixa prevalência os destacados são majoritariamente falsos-positivos.
O mesmo teste, duas populações. Quando a doença é rara, a maior parte dos resultados positivos vem do grupo enorme dos não-doentes — e o valor preditivo positivo desaba sem que a sensibilidade ou a especificidade tenham mudado uma vírgula.

Acurácia: por que ela mente quando a doença é rara

A acurácia global é a proporção de acertos do teste: acurácia = (a+d)/N. Parece a medida definitiva — é o único número que olha as quatro casas de uma vez — e é a mais enganosa das cinco.

Ela tem dois problemas. O primeiro é que mistura as duas colunas num número só, com peso proporcional ao tamanho de cada uma: quanto maior a coluna dos não-doentes, mais a acurácia vira um retrato da especificidade. O segundo decorre do primeiro: como o peso vem do tamanho das colunas, a acurácia depende da prevalência. A própria diretriz do Ministério da Saúde lista a prevalência entre as fontes de viés justamente porque ela altera as estimativas que levam em conta dados de prevalência, e cita a acurácia como exemplo.

A demonstração é curta e brutal. No cenário de rastreamento da seção anterior — prevalência de 1%, teste com sensibilidade e especificidade de 90% —, a acurácia é (90 + 8.910)/10.000 = 9.000/10.000 = 90%. Agora imagine um 'teste' que responde negativo para todo mundo, sem olhar para o paciente, sem coletar nada. Ele erra os 100 doentes e acerta os 9.900 sadios: acurácia = 9.900/10.000 = 99%. O aparelho inútil tem acurácia melhor do que o teste bom, e sua sensibilidade é zero.

A consequência prática é que a acurácia só informa alguma coisa em duas condições: quando as duas colunas têm tamanho comparável e quando errar para um lado custa o mesmo que errar para o outro. Em medicina, a segunda condição quase nunca é verdadeira — deixar passar uma meningite não custa o mesmo que pedir uma tomografia a mais.

Se a prova pedir um resumo de acurácia que não dependa da prevalência, o candidato é o índice de Youden: sensibilidade + especificidade − 1. Ele varia de 0, quando o teste não tem valor diagnóstico, a 1, quando a acurácia é máxima, e atribui pesos iguais aos dois erros — falsos-negativos e falsos-positivos. No exemplo do rastreamento: 0,90 + 0,90 − 1 = 0,80. A diretriz do Ministério da Saúde registra que o índice não fornece interpretação probabilística direta; ele serve como índice geral, não como resposta clínica.

Razão de verossimilhança: a medida que atravessa a mudança de prevalência

A razão de verossimilhança positiva é a probabilidade de encontrar um teste positivo em quem tem a doença dividida pela probabilidade de encontrar um teste positivo em quem não tem. Em letras: RV+ = sensibilidade / (1 − especificidade), ou, direto da tabela, [a/(a+c)] / [b/(b+d)]. Ela responde a uma pergunta específica: quantas vezes é mais provável um resultado positivo em quem tem a doença do que em quem não a tem.

A razão de verossimilhança negativa faz o mesmo com o resultado negativo: RV− = (1 − sensibilidade) / especificidade, ou [c/(a+c)] / [d/(b+d)]. Quantas vezes é mais provável um resultado negativo em quem tem a doença do que em quem não tem.

A leitura é a mesma para as duas. Razão igual a 1 significa que o resultado é igualmente provável nos dois grupos — o teste não muda nada. Acima de 1, o resultado empurra a probabilidade para cima. Abaixo de 1, empurra para baixo. As faixas clássicas, de Jaeschke e colaboradores: RV+ acima de 10 ou RV− abaixo de 0,1 produzem mudanças grandes e frequentemente conclusivas; RV+ entre 5 e 10 ou RV− entre 0,1 e 0,2, mudanças moderadas; RV+ entre 2 e 5 ou RV− entre 0,2 e 0,5, mudanças pequenas, às vezes importantes; valores perto de 1 quase não mexem em nada.

Por que ela sobrevive à mudança de prevalência: porque é feita exclusivamente de sensibilidade e especificidade, duas medidas de coluna. Nenhum termo dela olha para o tamanho relativo das colunas. É por isso que a razão de verossimilhança é a medida que se pode carregar de um cenário para outro — do estudo publicado para o seu pronto-socorro — enquanto o VPP do artigo fica preso à população daquele artigo.

O motor é o teorema de Bayes escrito em forma de chance: chance pós-teste = chance pré-teste × razão de verossimilhança. Chance e probabilidade não são a mesma coisa, e a conversão é obrigatória nos dois sentidos: chance = p/(1 − p) e, de volta, p = chance/(1 + chance). Passo a passo com o rastreamento da seção anterior (sensibilidade e especificidade de 90%, prevalência de 1%). Chance pré-teste = 0,01/0,99 = 0,0101. RV+ = 0,90/(1 − 0,90) = 0,90/0,10 = 9. Chance pós-teste = 0,0101 × 9 = 0,0909. Probabilidade pós-teste = 0,0909/(1 + 0,0909) = 0,083, ou 8,3%.

Repare no que acabou de acontecer: 8,3% é exatamente o valor preditivo positivo que a tabela 2×2 tinha dado. As duas rotas chegam ao mesmo lugar, e essa identidade é útil como conferência na prova. A diferença é conceitual e vale ouro: a razão de verossimilhança pertence ao teste, e o valor preditivo pertence ao teste naquela população. Trocar a prevalência muda o segundo e deixa o primeiro intacto.

Existe ainda a razão de chances diagnóstica, que resume o desempenho num único número: RCD = RV+/RV− = (sens × espec) / [(1 − sens) × (1 − espec)] = (a×d)/(b×c). Ela tem pouca relevância clínica direta — não diz como um resultado específico muda a probabilidade —, mas aparece nas provas porque é o parâmetro central dos modelos de metanálise de estudos de acurácia.

Curva ROC e área sob a curva: o teste inteiro, não um ponto

Quando o teste devolve um número — glicemia, procalcitonina, um escore —, não existe 'positivo' antes de alguém escolher um ponto de corte. E cada corte escolhido gera um par sensibilidade/especificidade diferente. A curva ROC é o gráfico de todos esses pares, varrendo o limiar de positividade ao longo de todos os seus valores possíveis.

Os eixos, na convenção da diretriz do Ministério da Saúde: no eixo vertical (y) vai a sensibilidade, isto é, a fração de verdadeiros-positivos; no eixo horizontal (x) vai 1 − especificidade, isto é, a fração de falsos-positivos. Cada ponto da curva é um ponto de corte. Cuidado com essa leitura, porque é a pegadinha mais comum do gráfico: 1 − especificidade é falso-positivo, não falso-negativo. O falso-negativo é 1 − sensibilidade e mora no eixo vertical, como distância do ponto até o teto.

A geometria conta a história. A diagonal que vai de (0,0) a (1,1) é o teste que não discrimina nada: cada ponto de sensibilidade ganho custa exatamente um ponto de especificidade. Quanto mais a curva se afasta da diagonal em direção ao canto superior esquerdo, melhor o teste. O teste perfeito sairia da origem, subiria vertical até (0,1) e seguiria horizontal até (1,1): sensibilidade de 100% sem um único falso-positivo.

A área sob a curva resume a curva inteira num número. Ela tem uma interpretação intuitiva que vale decorar: é a probabilidade de que, sorteando ao acaso um doente e um não-doente, o valor do teste seja maior no doente. Os dois pontos ancorados pela diretriz brasileira: 0,5 é a diagonal, o teste sem aplicabilidade clínica; 1 é o teste perfeito.

As faixas de leitura entre esses dois extremos vêm da revisão metodológica de 2023 no Turkish Journal of Emergency Medicine: área maior ou igual a 0,90, excelente; de 0,80 a 0,89, considerável; de 0,70 a 0,79, razoável; de 0,60 a 0,69, fraca; de 0,50 a 0,59, falha. A série da Sociedade Brasileira de Pneumologia e Tisiologia usa um corte único e mais simples — valores acima de 0,8 indicam precisão muito boa. As duas leituras concordam no essencial: abaixo de 0,7 o teste discrimina mal, e a partir de 0,8 discrimina bem.

Uma limitação que a prova gosta de cobrar: a área sob a curva compara testes, mas não escolhe o ponto de corte. Dois testes com a mesma área podem ter curvas de formatos diferentes e servir a propósitos diferentes — um deles ótimo na região de alta sensibilidade, o outro na de alta especificidade. Escolher o ponto vem depois, e vem da clínica, não da geometria.

O ponto de corte: quando se prefere sensível, quando se prefere específico

Mover o ponto de corte é um jogo de soma quase zero. Baixar o limiar de positividade — chamar mais gente de positiva — sobe a sensibilidade e derruba a especificidade. Subir o limiar faz o contrário: menos positivos, especificidade alta, sensibilidade baixa. Não existe corte que melhore as duas ao mesmo tempo; se existisse, o teste seria outro. A diretriz do Ministério da Saúde é explícita: a escolha do limiar envolve uma decisão entre aumentar a sensibilidade à custa de reduzir a especificidade, e vice-versa.

Prefere-se um teste (ou um corte) sensível quando o desastre é o falso-negativo. É o caso do rastreamento populacional, em que perder o caso significa perder a janela de tratamento; das doenças graves e tratáveis, em que o custo de não diagnosticar é desproporcional; e das situações em que o falso-positivo só gera um exame confirmatório a mais. A diretriz dá o exemplo do teste em suspeita de infecção pelo HIV e a regra: se a preocupação maior é evitar o falso-negativo, o corte deve buscar o máximo de sensibilidade. O material didático brasileiro dá o exemplo da triagem sorológica em banco de sangue, em que se persegue 100% de sensibilidade aceitando o aumento de falsos-positivos, porque a não detecção acarreta risco para a população.

Prefere-se um teste (ou um corte) específico quando o desastre é o falso-positivo. É o caso da confirmação diagnóstica e das situações em que o resultado positivo dispara um tratamento tóxico, uma cirurgia de risco ou um rótulo pesado. Mesma diretriz, mesma frase invertida: se a principal preocupação é evitar o resultado falso-positivo — porque o resultado do teste pode indicar uma cirurgia arriscada para o paciente —, o corte deve buscar o máximo de especificidade.

A arquitetura padrão do rastreamento usa as duas coisas em ordem: um teste sensível na frente, para não perder ninguém, e um teste específico atrás, para limpar os falsos-positivos do primeiro. Praticamente todo programa de rastreamento tem essa forma, e ela explica por que um valor preditivo positivo baixo na triagem não condena o programa: a triagem não fecha diagnóstico, ela seleciona quem vai para o exame confirmatório.

Testes em série e em paralelo

Quando se combinam dois testes, o critério de positividade do conjunto decide tudo. Em paralelo, os testes são aplicados ao mesmo tempo e basta um resultado positivo para o conjunto ser considerado positivo. Isso captura todo mundo que qualquer um dos testes pegaria: a sensibilidade do conjunto sobe, ficando acima da do teste mais sensível isolado. Em troca, o conjunto herda os falsos-positivos dos dois testes, e a especificidade cai.

Em série, os testes são aplicados em sequência e só é considerado positivo quem for positivo em todos. Isso exige concordância: a especificidade do conjunto sobe, ficando acima da do teste mais específico isolado, porque um falso-positivo do primeiro teste é filtrado pelo segundo. Em troca, basta um dos testes falhar para o caso escapar, e a sensibilidade cai.

Se preferir uma frase só, guarde esta: 'ou' aumenta sensibilidade, 'e' aumenta especificidade. Paralelo é 'ou' — positivo em A ou em B. Série é 'e' — positivo em A e em B. A confusão desaparece quando você percebe que exigir menos para chamar de positivo sempre aumenta a sensibilidade, e exigir mais sempre aumenta a especificidade.

Cada arranjo tem seu cenário. O paralelo serve à emergência e ao rastreamento, quando não há tempo de esperar e perder o caso é o pior desfecho. A série serve à consulta e ao seguimento, quando há tempo para confirmar e o custo do falso-positivo é alto — é o arranjo clássico da triagem sensível seguida de confirmação específica, e é a forma como os programas do SUS estão desenhados.

Vieses do estudo de acurácia: espectro, verificação e incorporação

Todo número deste capítulo vem de um estudo, e estudo de acurácia diagnóstica tem um desenho próprio, que a diretriz do Ministério da Saúde descreve com precisão: é transversal por definição, com uma série consecutiva de pacientes com suspeita da doença-alvo, todos submetidos ao teste índice e todos submetidos ao mesmo padrão de referência, com os dois testes interpretados por pessoas cegas em relação ao resultado do outro, e com intervalo curto o bastante entre eles para que a doença não mude de estágio no meio do caminho. Cada desvio desse desenho tem nome, e a banca cobra o nome.

Viés de espectro. O desempenho de um teste muda conforme o perfil e a gravidade dos pacientes incluídos — características demográficas e gravidade da doença são o que a diretriz chama de espectro da doença, e as lista como fontes de variação entre estudos. O estudo que compara doentes muito graves contra controles sadios (o desenho de caso-controle diagnóstico) produz sensibilidade e especificidade infladas, porque o teste está separando extremos e não a mistura ambígua que aparece no consultório. O verdadeiro valor de um teste diagnóstico só se estabelece, escreve a diretriz, em estudos que incluem pacientes parecidos com os da prática clínica — pacientes sem nenhum achado óbvio que já confirme ou exclua o diagnóstico.

Viés de verificação, também chamado de work-up bias. Ocorre quando todos fazem o teste índice, mas apenas parte dos pacientes segue para o padrão de referência — tipicamente porque o padrão é invasivo (uma biópsia, por exemplo) e só se encaminha quem testou positivo. O efeito, na descrição da própria diretriz: como a grande maioria dos verificados terá resultado positivo no teste índice, a sensibilidade fica superestimada; e como pouquíssimos pacientes sem a doença chegam a ter o resultado negativo confirmado, a especificidade fica subestimada.

Viés de incorporação. Ocorre quando o resultado do teste índice entra na composição do padrão de referência — os dois deixam de ser independentes. O efeito é a superestimação tanto da sensibilidade quanto da especificidade, porque o teste está, em parte, sendo comparado consigo mesmo. Aparece com frequência quando o padrão de referência é um 'diagnóstico clínico final' montado por um comitê que teve acesso ao exame em avaliação, ou quando o padrão é composto por uma bateria de exames que inclui o próprio teste índice.

Viés de inspeção. O leitor de um dos testes conhece o resultado do outro e é influenciado por ele; a prevenção é a leitura cega dos dois lados. A diretriz separa ainda duas variantes úteis de conhecer: o viés de inspeção clínica, em que a disponibilidade de idade, sexo, sintomas e comorbidades durante a leitura afeta a estimativa; e o viés de contexto, em que quem interpreta o teste num cenário de alta prevalência tende a classificar mais exames como anormais.

As duas ferramentas que a prova pode citar pelo nome. Para avaliar o risco de viés de um estudo de acurácia, o padrão é o QUADAS-2, estruturado em quatro domínios: seleção de pacientes, teste índice, padrão de referência, e fluxo e tempo. Cada domínio é julgado como risco baixo, alto ou incerto, sem soma de pontuação — a diretriz é explícita ao recomendar contra escores de qualidade, porque eles atribuem peso igual a itens cuja importância varia com o contexto. Para o relato do estudo, o padrão é o STARD 2015: uma lista de 30 itens essenciais, agrupados em seis domínios (título e resumo, introdução, métodos, resultados, discussão e outras informações).

Reprodutibilidade: concordância bruta e kappa

Antes de perguntar se um teste é válido, vale perguntar se ele é reprodutível: dois observadores lendo o mesmo exame chegam ao mesmo laudo? Reprodutibilidade alta não garante validade — os dois podem estar igualmente errados —, mas reprodutibilidade baixa limita tudo o que vem depois. A diretriz do Ministério da Saúde lista a variabilidade de observação entre as fontes de variação dos estudos de acurácia justamente por isso.

A medida ingênua é a concordância bruta: a proporção de leituras em que os dois observadores disseram a mesma coisa. O problema é que parte dessa concordância acontece por puro acaso, e a fatia do acaso cresce quanto mais desbalanceadas forem as categorias — ou seja, quanto mais rara a doença.

O kappa desconta o acaso: κ = (Po − Pe) / (1 − Pe), onde Po é a proporção de concordâncias observadas e Pe a proporção de concordâncias esperadas apenas pelo acaso, calculada a partir das margens da tabela. Nas letras da tabela 2×2 de concordância: Po = (a+d)/N e Pe = [(a+b)(a+c) + (c+d)(b+d)] / N².

O cálculo, com o exemplo resolvido do material didático. Cento e vinte lâminas de gota espessa para pesquisa de malária foram lidas por dois microscopistas independentes. Os dois concordaram em 18 lâminas positivas e em 88 negativas; discordaram em 14. Po = (18 + 88)/120 = 106/120 = 0,883 — 88,3% de concordância bruta, um número que parece excelente. Agora o acaso: o primeiro microscopista achou 20 positivas e 100 negativas; o segundo achou 30 positivas e 90 negativas. Pe = [(30 × 20) + (90 × 100)] / 120² = (600 + 9.000)/14.400 = 0,667. Logo κ = (0,883 − 0,667)/(1 − 0,667) = 0,217/0,333 = 0,65. Uma concordância 'de 88%' vira um kappa de 0,65, porque dois terços daquela concordância já eram esperados sem que ninguém olhasse a lâmina.

A escala de leitura, adaptada de Landis e Koch: abaixo de 0, nenhuma concordância; de 0 a 0,20, fraca; de 0,21 a 0,40, sofrível; de 0,41 a 0,60, regular; de 0,61 a 0,80, boa; de 0,81 a 0,99, ótima; 1,00, perfeita. O kappa de 0,65 do exemplo cai, portanto, em concordância boa.

Duas advertências de interpretação. A primeira: o kappa depende da prevalência do achado — prevalências muito baixas puxam o kappa para baixo mesmo com o procedimento bem executado, porque a concordância esperada pelo acaso fica alta. Por isso a prevalência deve ser informada junto com o resultado do kappa, e por isso um kappa medíocre nem sempre acusa um método ruim. A segunda: reduzir o número de categorias (positivo/negativo em vez de quatro graus) tende a aumentar a concordância artificialmente — comparar kappas de escalas com números diferentes de categorias não faz sentido.

04

Régua de cálculo — a tabela 2×2 e as cinco divisões que saem dela

Monte a tabela antes de qualquer conta. Depois é só escolher o denominador: dividir pelo total de uma COLUNA condiciona à doença (sensibilidade, especificidade); dividir pelo total de uma LINHA condiciona ao resultado do teste (valor preditivo positivo, valor preditivo negativo). A tabela abaixo é as duas coisas ao mesmo tempo — o esqueleto 2×2 e a fórmula que sai de cada margem, com a informação que decide a maioria das questões: se aquela medida se mexe ou não quando a prevalência muda.

  1. 1Separe os dois eixos do enunciado: o que define a VERDADE (padrão de referência: biópsia, cultura, seguimento, autópsia) vai nas colunas; o que está sendo AVALIADO (teste índice) vai nas linhas. Se a prova desenhou ao contrário, redesenhe antes de calcular.
  2. 2Preencha a, b, c e d. Se o enunciado der percentuais em vez de contagens, invente um N redondo — 1.000, 10.000 ou 100.000 — grande o bastante para que a prevalência caia em número inteiro de pessoas.
  3. 3Quebre a população pela prevalência ANTES de aplicar o teste: primeiro quantos têm a doença e quantos não têm; só então aplique a sensibilidade sobre a coluna dos doentes e a especificidade sobre a coluna dos não-doentes.
  4. 4Some as quatro margens antes de dividir: doentes (a+c), não-doentes (b+d), testes positivos (a+b), testes negativos (c+d). Metade dos erros deste tema é denominador trocado, não conta errada.
  5. 5Identifique o que a questão pede pela forma da pergunta. 'Dos doentes, quantos o teste detecta?' é coluna. 'Dado este resultado positivo, qual a chance de a pessoa estar doente?' é linha.
  6. 6Se a questão mexeu apenas na prevalência, não recalcule sensibilidade nem especificidade — elas não mudam. Recalcule VPP, VPN e acurácia, e lembre a direção: prevalência sobe, VPP sobe e VPN cai.
  7. 7Se a questão pede o desempenho do teste independentemente do cenário, ou pede para levar um resultado de um serviço para outro, vá para as razões de verossimilhança: RV+ = S/(1−E) e RV− = (1−S)/E.

AUC ≥ 0,90 — excelente

A curva cola no canto superior esquerdo: existe ponto de corte com sensibilidade alta pagando pouquíssimo falso-positivo. A linha tracejada é a diagonal do acaso.

AUC 0,80–0,89 — considerável

Discrimina bem, mas cada ganho de sensibilidade já custa especificidade visível. É a faixa em que a escolha do ponto de corte passa a decidir o uso clínico.

AUC 0,50–0,59 — falha

A curva quase encosta na diagonal: o teste não separa doentes de não-doentes melhor que o acaso. Entre as pontas ficam 0,70–0,79 (razoável) e 0,60–0,69 (fraca).

Tabela 2×2Doença PRESENTE (padrão de referência +)Doença AUSENTE (padrão de referência −)Lendo a LINHA — condiciona ao RESULTADO do teste
Teste índice POSITIVOa — verdadeiro-positivob — falso-positivoVPP = a/(a+b). Dado um teste positivo, qual a probabilidade de ter a doença. MUDA com a prevalência (sobe quando ela sobe).
Teste índice NEGATIVOc — falso-negativod — verdadeiro-negativoVPN = d/(c+d). Dado um teste negativo, qual a probabilidade de não ter a doença. MUDA com a prevalência (cai quando ela sobe).
Lendo a COLUNA — condiciona à DOENÇASensibilidade = a/(a+c). Dos doentes, quantos o teste detecta. NÃO muda com a prevalência. Complemento: 1 − S = c/(a+c) é a fração de falsos-negativos.Especificidade = d/(b+d). Dos não-doentes, quantos o teste libera. NÃO muda com a prevalência. Complemento: 1 − E = b/(b+d) é a fração de falsos-positivos (eixo x da curva ROC).Acurácia = (a+d)/N. Proporção global de acertos. MUDA com a prevalência — e engana quando a doença é rara, porque a coluna dos não-doentes domina o cálculo.

Derivadas apenas das duas medidas de coluna e, por isso, imunes à prevalência: RV+ = sensibilidade/(1 − especificidade); RV− = (1 − sensibilidade)/especificidade; índice de Youden = sensibilidade + especificidade − 1 (0 = sem valor diagnóstico, 1 = acurácia máxima); razão de chances diagnóstica = RV+/RV− = (a×d)/(b×c).

Para transformar razão de verossimilhança em probabilidade: chance pré-teste = prevalência/(1 − prevalência); chance pós-teste = chance pré-teste × razão de verossimilhança; probabilidade pós-teste = chance/(1 + chance). A probabilidade pós-teste de um resultado positivo é o próprio VPP naquela população — use isso como conferência do cálculo pela tabela.

Faixas de razão de verossimilhança (Jaeschke e col., 1994): RV+ acima de 10 ou RV− abaixo de 0,1 mudam muito a probabilidade e frequentemente decidem a conduta; RV+ de 5 a 10 ou RV− de 0,1 a 0,2, mudança moderada; RV+ de 2 a 5 ou RV− de 0,2 a 0,5, mudança pequena; valores próximos de 1 não mudam quase nada.

Reprodutibilidade entre observadores: κ = (Po − Pe)/(1 − Pe), com Po = (a+d)/N e Pe = [(a+b)(a+c) + (c+d)(b+d)]/N². Leitura adaptada de Landis e Koch (1977): abaixo de 0 nenhuma; 0 a 0,20 fraca; 0,21 a 0,40 sofrível; 0,41 a 0,60 regular; 0,61 a 0,80 boa; 0,81 a 0,99 ótima; 1,00 perfeita.

Combinação de testes: em paralelo (positivo se UM for positivo, critério 'ou') a sensibilidade do conjunto sobe e a especificidade cai; em série (positivo só se TODOS forem positivos, critério 'e') a especificidade sobe e a sensibilidade cai.

05

Onde as fontes divergem

Nestes pontos as fontes não dizem a mesma coisa. Cada posição vem com quem a sustenta — e com o que fazer diante de uma vinheta de prova.

Por qual critério se escolhe o ponto de corte de um teste com resultado contínuo

Critério estatístico — o ponto que maximiza o par sensibilidade/especificidade

Escolhe-se, sobre a curva ROC, o ponto que fornece as maiores sensibilidade e especificidade possíveis para aquele teste — o ponto mais próximo do canto superior esquerdo, equivalente ao máximo do índice de Youden. É a prática mais frequente nos estudos primários que derivam um corte novo.

Ministério da Saúde, Diretrizes metodológicas: estudos de acurácia diagnóstica (2014), Apêndice 4: 'Muitos autores preferem definir este limiar baseado no ponto que maximiza a curva. Esse ponto fornecerá as maiores sensibilidades e especificidades possíveis para o teste.'

Critério clínico — a intenção do teste e o custo de cada erro

O corte é definido pela consequência dos dois erros no cenário em que o teste vai ser usado: se o falso-negativo é o desastre (rastreamento, doença grave e tratável, triagem de banco de sangue), busca-se o máximo de sensibilidade; se o falso-positivo dispara procedimento de risco, busca-se o máximo de especificidade. O ponto estatisticamente ótimo pode não ser o clinicamente aceitável.

Ministério da Saúde, Diretrizes metodológicas (2014), Apêndice 4 ('a estratégia geral seria dependente da intenção do teste'; exemplos da cirurgia arriscada e da suspeita de HIV) e Anexo E, que classifica a escolha do limiar que maximiza sensibilidade e especificidade como fonte de superestimação das medidas de desempenho. Mesma orientação no material didático de epidemiologia da Universidade Federal de Goiás (triagem sorológica em banco de sangue).

Na prova

O enunciado entrega qual dos dois critérios a questão está usando. Se o texto fala em curva ROC, 'melhor ponto de corte', índice de Youden ou 'ponto mais próximo do canto superior esquerdo', o recorte é estatístico e o item cobrado é a geometria. Se o texto descreve o cenário de uso — programa de rastreamento do SUS, banco de sangue, triagem de doença grave e tratável, ou um resultado positivo que indica cirurgia —, o recorte é clínico e o item cobrado é a consequência do erro, não a curva. As alternativas também denunciam: distrator que traz um valor numérico de corte sem dizer para que o teste serve pertence ao mundo estatístico; distrator que fala em 'evitar deixar passar casos' ou 'evitar submeter paciente saudável a procedimento invasivo' pertence ao clínico. Vale a régua geral: prova oficial do MEC tende a cenário e conduta SUS, o que empurra o recorte para o critério clínico; outras bancas dependem do que as alternativas revelam.

Onde fica, na área sob a curva ROC, o limite de 'teste com boa acurácia'

Corte único em 0,8 (Sociedade Brasileira de Pneumologia e Tisiologia, 2018)

A série de educação continuada do Jornal Brasileiro de Pneumologia adota um limiar de leitura único: valores de área sob a curva acima de 0,8 indicam que a precisão do teste diagnóstico é muito boa. A série não subdivide o que está abaixo disso.

Ferreira JC, Patino CM. Entendendo os testes diagnósticos. Parte 3. J Bras Pneumol. 2018;44(1):4.

Escala ordinal em cinco faixas (revisão metodológica de 2023)

Área maior ou igual a 0,90, excelente; de 0,80 a 0,89, considerável; de 0,70 a 0,79, razoável; de 0,60 a 0,69, fraca; de 0,50 a 0,59, falha. A escala separa graus que o corte único agrupa e sustenta que a área sozinha não decide a utilidade clínica do teste.

Çorbacıoğlu ŞK, Aksel G. Receiver operating characteristic curve analysis in diagnostic accuracy studies. Turk J Emerg Med. 2023;23(4):195-198, Tabela 2.

Apenas os dois extremos ancorados (diretriz metodológica brasileira, 2014)

A diretriz do Ministério da Saúde não propõe faixas intermediárias. Registra apenas que o valor de 0,5 é obtido quando o teste não tem aplicabilidade clínica — é a diagonal do gráfico — e o valor de 1 quando o teste é perfeito, com a curva passando por (0,1).

Ministério da Saúde, Diretrizes metodológicas: estudos de acurácia diagnóstica (2014), p. 48 e Apêndice 4.

Na prova

Questão que pede um rótulo verbal para um valor de área sob a curva ('a acurácia global deste teste pode ser classificada como...') está usando alguma escala ordinal, e as próprias alternativas mostram qual: se aparecem cinco graus, é a escala em faixas; se o item é dicotômico entre 'boa' e 'insuficiente', o corte único costuma ficar em 0,8. Questão que pede interpretação sem rótulo verbal quase sempre se resolve pelos dois extremos ancorados: 0,5 é o acaso, 1 é o teste perfeito, e o que interessa é a distância até a diagonal. Enunciado que cita nominalmente uma sociedade brasileira, ou que se passa em ambiente do SUS, tende a trabalhar com o corte único; enunciado de leitura crítica de artigo, com metodologia detalhada, tende a trabalhar com a escala em faixas.

06

Caso resolvido

Um exame físico foi usado para rastrear câncer de mama em 2.500 mulheres com adenocarcinoma de mama comprovado por biópsia e em 5.000 mulheres-controle, pareadas por raça e idade. O exame físico foi positivo (massa detectada à palpação) em 1.800 das mulheres com câncer e em 800 controles — nenhuma das quais mostrou evidência de câncer na biópsia. Calcule tudo o que a tabela permite e diga, ao final, o que pode e o que não pode ser levado para o consultório.
monte a 2×2
Colunas: biópsia (o padrão de referência). Linhas: exame físico (o teste índice). a = 1.800 verdadeiros-positivos. c = 2.500 − 1.800 = 700 falsos-negativos. b = 800 falsos-positivos. d = 5.000 − 800 = 4.200 verdadeiros-negativos. Margens: 2.500 doentes, 5.000 não-doentes, 2.600 testes positivos, 4.900 testes negativos, N = 7.500.
sensibilidade
a/(a+c) = 1.800/2.500 = 0,72, ou 72%. O exame físico detecta 72% das mulheres que realmente têm o câncer. O complemento importa tanto quanto: 28% — 700 mulheres — recebem um exame normal e saem falsamente tranquilizadas.
especificidade
d/(b+d) = 4.200/5.000 = 0,84, ou 84%. Entre as mulheres sem câncer, 84% recebem exame negativo. As outras 16% — 800 mulheres — são chamadas de volta por um achado que a biópsia não confirma.
VPP e VPN
VPP = a/(a+b) = 1.800/2.600 = 0,69, ou 69%. VPN = d/(c+d) = 4.200/4.900 = 0,86, ou 86%. Note que os denominadores mudaram de direção: agora se divide pelas linhas, não pelas colunas.
acurácia
(a+d)/N = (1.800 + 4.200)/7.500 = 6.000/7.500 = 0,80, ou 80%. Ela caiu entre a sensibilidade (72%) e a especificidade (84%), puxada para o lado da coluna maior — a dos não-doentes, que aqui tem o dobro do tamanho da outra.
verossimilhança
RV+ = 0,72/(1 − 0,84) = 0,72/0,16 = 4,5: um resultado positivo é 4,5 vezes mais provável em quem tem o câncer do que em quem não tem — mudança pequena a moderada, pela faixa de 2 a 5. RV− = (1 − 0,72)/0,84 = 0,28/0,84 = 0,33: um resultado negativo mal reduz a probabilidade, também na faixa de mudança pequena. Razão de chances diagnóstica = 4,5/0,33 = 13,5, que confere com (1.800 × 4.200)/(800 × 700) = 7.560.000/560.000 = 13,5. Índice de Youden = 0,72 + 0,84 − 1 = 0,56.
a pegadinha
A 'prevalência' desta tabela é 2.500/7.500 = 33%. Ela não é a prevalência de câncer de mama em população nenhuma — é uma proporção que o pesquisador criou ao recrutar uma doente para cada duas controles. O desenho é um caso-controle diagnóstico, em que o estado de doença já era conhecido antes de a paciente ser submetida ao teste índice.
o que se leva
Sensibilidade, especificidade e as duas razões de verossimilhança sobrevivem ao desenho e podem ser levadas adiante. O VPP de 69% não pode: numa população real, em que o câncer de mama está muitíssimo abaixo de 33%, ele seria uma fração disso. E há um alerta adicional: comparar doentes com biópsia confirmada contra controles pareados é o cenário clássico do viés de espectro — os dois grupos são extremos, e sensibilidade e especificidade tendem a sair melhores do que sairiam numa série consecutiva de mulheres com queixa mamária, que é onde o exame de fato é usado.
07

Agora feche você

Um programa de rastreamento de câncer de cólon será conduzido em Nottingham, na Inglaterra, testando a população de 50 a 75 anos com o Hemoccult (pesquisa de sangue oculto nas fezes). O teste tem sensibilidade de 70% e especificidade de 75%. A prevalência de câncer de cólon nessa faixa etária é de 12 por 1.000. Calcule o valor preditivo positivo do teste nesse programa — e decida se o programa se justifica com esse número.
escolha o N
Adote uma população de 100.000 pessoas, grande o bastante para que uma prevalência de 12/1.000 (1,2%) caia em número inteiro: 1.200 pessoas têm câncer de cólon e 98.800 não têm.
preencha
Sensibilidade de 70% sobre os 1.200 doentes: a = 840 verdadeiros-positivos e c = 360 falsos-negativos. Especificidade de 75% sobre os 98.800 não-doentes: d = 74.100 verdadeiros-negativos e b = 24.700 falsos-positivos.
VPP
o veredito
08

Onde a banca derruba

  1. 1Dividir pelo denominador da direção errada. É o erro número um do tema, e ele não parece erro: o numerador está certo. Verdadeiro-positivo sobre o total de testes positivos é VPP; verdadeiro-positivo sobre o total de doentes é sensibilidade. Antes de dividir, pergunte se o enunciado está condicionando à doença (coluna) ou ao resultado do teste (linha).
  2. 2Dizer que a sensibilidade caiu porque a prevalência caiu. Atrai porque o número absoluto de casos detectados realmente cai. Mas sensibilidade é uma proporção calculada dentro da coluna dos doentes: se a coluna encolhe, numerador e denominador encolhem juntos e a proporção fica onde estava. Só VPP, VPN e acurácia se mexem quando muda apenas a prevalência.
  3. 3Julgar teste de doença rara pela acurácia. Num cenário com 1% de prevalência, um aparelho que respondesse 'negativo' para todo mundo teria 99% de acurácia e sensibilidade zero. A acurácia mistura as duas colunas com peso proporcional ao tamanho delas, e em doença rara a coluna dos sadios domina o resultado.
  4. 4Confundir 1 − especificidade com falso-negativo. 1 − especificidade é a fração de falsos-POSITIVOS, b/(b+d), e é ela que ocupa o eixo horizontal da curva ROC. A fração de falsos-negativos é 1 − sensibilidade, c/(a+c), e mora no eixo vertical. Trocar as duas inverte a leitura do gráfico inteiro.
  5. 5Tratar teste sensível como teste que confirma. Sensibilidade alta serve ao resultado NEGATIVO: poucos falsos-negativos, então um negativo afasta bem a doença. Especificidade alta serve ao resultado POSITIVO: poucos falsos-positivos, então um positivo confirma bem. A alternativa que diz 'teste altamente sensível, portanto o resultado positivo confirma o diagnóstico' trocou as duas pontas.
  6. 6Levar o VPP de um caso-controle diagnóstico para a clínica. Quando o estudo recruta N doentes e M controles, a prevalência da tabela foi escolhida pelo pesquisador, não medida numa população. Sensibilidade, especificidade e razões de verossimilhança sobrevivem a isso; VPP, VPN e acurácia, não.
  7. 7Ler a área sob a curva como taxa de acerto do teste. A área sob a curva não é 'porcentagem de acertos'. É a probabilidade de que, sorteando um doente e um não-doente, o doente tenha o valor mais alto do teste — e resume a curva inteira, não o desempenho num corte específico. Um teste com área de 0,95 ainda pode ter sensibilidade ruim no corte que o seu serviço adota.
  8. 8Trocar o efeito do arranjo em série pelo do arranjo em paralelo. Paralelo é 'ou' — basta um positivo — e sobe a sensibilidade às custas da especificidade. Série é 'e' — precisa dos dois — e sobe a especificidade às custas da sensibilidade. A confusão aumenta quando o enunciado descreve o arranjo em vez de nomeá-lo: leia o critério de positividade do conjunto, não o nome.
  9. 9Confundir concordância bruta com kappa. No exemplo das lâminas de malária, 88,3% de concordância bruta viraram um kappa de 0,65, porque dois terços daquela concordância eram esperados só pelo acaso. Quanto mais rara a categoria positiva, maior a fatia do acaso e menor o kappa para a mesma concordância bruta.
  10. 10Chamar de viés de incorporação o que é viés de verificação. Verificação (work-up) é quando nem todos vão ao padrão de referência, tipicamente porque ele é invasivo — infla a sensibilidade e derruba a especificidade. Incorporação é quando o teste índice faz parte do próprio padrão de referência — infla as duas. O gatilho no enunciado é diferente: 'apenas os pacientes com teste positivo foram submetidos à biópsia' é verificação; 'o diagnóstico final foi estabelecido por um comitê que teve acesso ao exame em estudo' é incorporação.
Gabarito da questão de abertura
Comentário

Verdadeiros positivos = 90; falsos positivos = 900 − 810 = 90. VPP = VP/(VP+FP) = 90/(90+90) = 90/180 = 50%. 90% é a sensibilidade (90/100), não o VPP. 10% seria a proporção de falsos negativos entre doentes. 81% aproxima a especificidade (810/900 = 90%), mas ainda não é o VPP. 9% não corresponde a nenhum indicador correto. Como a prevalência é baixa e há muitos falsos positivos, o VPP cai para 50%.

09

Recuperação

Responda as 10 — o gabarito e o comentário de cada uma abrem a cada questão ou só no fim, como você preferir.

Sorteando as questões…

Quer treinar mais nesse tema? Estas questões vêm do nosso banco — lá tem milhares, com simulado, maratona e estatística de acerto por área.

Criar conta grátis e continuar →
10

Plano de revisão

em 7 dias

Refaça de memória a tabela 2×2 com as letras a, b, c e d e escreva as cinco fórmulas ao lado da margem certa — as duas de coluna, as duas de linha e a acurácia no canto. Depois pegue um teste com sensibilidade e especificidade de 90% e calcule o valor preditivo positivo em três prevalências: 50% (use 1.000 pessoas), 10% (use 10.000) e 1% (use 100.000). Confira: 90%, 50% e 8,3%. Se algum não bateu, o erro quase certamente está no denominador, não na conta.

em 30 dias

Monte e resolva um problema completo do zero: um teste com sensibilidade de 80% e especificidade de 95% aplicado a 10.000 pessoas numa população com prevalência de 2%. Calcule a, b, c, d, as cinco medidas, RV+ e RV−, e depois refaça o valor preditivo positivo pela rota das chances para conferir que as duas rotas coincidem. Feche respondendo em uma frase cada: por que a acurácia deste teste engana; o que acontece com o valor preditivo positivo se ele passar a ser usado num pronto-socorro onde a prevalência é de 20%; e qual das medidas você levaria de um cenário para o outro. (Confira: a = 160, b = 490, c = 40, d = 9.310; VPP 24,6%, VPN 99,6%, acurácia 94,7%, RV+ 16, RV− 0,21; e no pronto-socorro com 20% de prevalência o VPP sobe para 80%.)

11

Agora atenda

Você sabe decidir com a tomografia na mão. A prova prática, e a vida, pedem outra coisa: chegar lá a partir de um paciente que ainda não tem exame nenhum.

Caso do acervo

Plantão na unidade básica: mulher de 34 anos, sem fatores de risco identificáveis, chega chorando com o resultado de um teste rápido feito numa campanha de rua — reagente. Ela quer saber, agora, se está com a infecção. Assuma o caso: acolha, explique o que um resultado positivo significa numa população de baixa prevalência, conduza o fluxo confirmatório e não prometa o que aquele teste, sozinho, não pode dizer. — você conduz anamnese, exame físico e conduta; o paciente responde em tempo real e o feedback vem no fim.

Sensibilidade, especificidade, valores preditivos e curva ROC – Sensibilidade, especificidade e valores preditivos — Preparatório para provas | OsceLabs