Raciocínio Clínico e Exames › A lógica do diagnóstico
A curva ROC e o que ela não conta
Curva ROC e área sob a curva: o que o resumo de um teste esconde
A curva ROC mede discriminação ao longo de cortes; não informa sozinha calibração, utilidade ou benefício clínico.
O caso
Caso 1. Uma unidade de terapia intensiva decide adotar um modelo que estima a chance de morte a partir dos dados das primeiras 24 horas. O artigo original é sólido: área sob a curva de 0,778 na base em que foi construído. Testado numa segunda base, com 27.821 pacientes de outros hospitais, ele mantém a discriminação — área sob a curva de 0,762. A equipe comemora e começa a usar os números com as famílias.
Meses depois alguém confere: os pacientes a quem o modelo atribuía 60% de chance de morrer estavam morrendo numa proporção muito diferente disso. O modelo continuava colocando os pacientes na ordem certa — os mais graves recebiam números maiores que os menos graves — e, ao mesmo tempo, os números que ele imprimia não correspondiam a risco nenhum. A medida de calibração na validação externa era de 0,17, muito longe do 1 que indicaria acordo entre previsto e observado.
Caso 2. Um ambulatório passa a calcular o risco de doença renal com um modelo publicado, escolhido justamente por ter a melhor discriminação entre dezesseis avaliados — índice de concordância de 0,806 numa coorte com quase meio milhão de pessoas. Só que o modelo superestimava o risco de forma sistemática: pacientes ouviam números altos e assustadores para uma doença que, na frequência real daquele grupo, era bem menos provável.
Pare aqui e faça as perguntas que um aluno de primeiro ano tem todo o direito de fazer:
O modelo mental
A área sob a curva resume a ordenação entre doentes e não doentes. Dois modelos com AUC semelhante podem divergir no corte relevante, e um modelo pode discriminar bem enquanto fornece probabilidades mal calibradas.
O capítulo anterior terminou com uma pergunta em aberto: se cada ponto de corte produz um par diferente de sensibilidade e especificidade, como comparar dois exames sem ficar preso a um corte específico? A resposta é a curva característica de operação do receptor, que a prática chama de curva ROC.
A construção é simples. Percorra todos os cortes possíveis do exame, do mais baixo ao mais alto. Para cada um, calcule o par sensibilidade e especificidade. Marque cada par como um ponto num gráfico: no eixo vertical, a sensibilidade; no horizontal, a fração de sadios erroneamente classificados como positivos. Ligue os pontos — está desenhada a curva. Cada ponto dela é um ponto de corte; a curva inteira é o exame.
A diagonal do gráfico é a referência que importa. Uma curva que segue a diagonal representa um teste que classifica no acaso: a cada ponto, a proporção de doentes capturados é igual à de sadios acusados. Quanto mais a curva se afasta da diagonal em direção ao canto superior esquerdo, mais o exame separa os dois grupos.
A área sob a curva condensa isso num número entre 0,5 e 1. Ela tem uma interpretação intuitiva e exata: é a probabilidade de que, sorteando ao acaso uma pessoa com a doença e uma sem, o valor medido na doente seja maior. Área de 0,5 é acaso puro; 1 é separação perfeita.
Isso já resolve uma dúvida deixada pelo capítulo do limiar. Lá, mudar o corte do dímero-D trocou sensibilidade por especificidade, e as áreas sob a curva foram 0,734 e 0,727, sem diferença significativa. Agora está claro por quê: mover o corte é andar sobre a mesma curva, e a área embaixo dela não muda quando se muda de ponto. A área avalia o exame; ela não escolhe o corte, e um artigo metodológico recente registra exatamente isso — a área é muito relatada e não indica, por si, o melhor limiar para decidir.
Também fica claro o que significa uma área baixa. No estudo com 2.882 idosos após queda, as áreas ficaram entre 0,51 na coluna lombar e 0,62 nos arcos costais. Uma área de 0,51 é a diagonal: aquele achado, naquela população, praticamente não distingue quem fraturou de quem não fraturou — o que combina com a razão de verossimilhança de 1,08 vista antes.
A pergunta central
Uma boa pergunta impede que o capítulo vire lista de definições.
“O desempenho global da curva representa a faixa de risco em que esta decisão realmente acontece?”
A área sob a curva resume a ordenação entre doentes e não doentes. Dois modelos com AUC semelhante podem divergir no corte relevante, e um modelo pode discriminar bem enquanto fornece probabilidades mal calibradas.
“O que é cada ponto da curva?”
Um ponto de corte, com seu par de sensibilidade e especificidade.
“O que a área sob a curva mede?”
A chance de o doente sorteado ter valor maior que o sadio.
“Por que ela não muda ao mudar o corte?”
Mudar de corte é andar sobre a mesma curva.
Aplicação passo a passo
Comece pela hipótese e termine na decisão. Os cálculos abaixo servem para tornar explícito o deslocamento de probabilidade, não para substituir julgamento clínico.
- 1
Entender o problema que a curva resolve
Comparar exames sem ficar preso a um corte único.
Erro comum: Comparar dois exames por cortes diferentes entre si.
- 2
Traduzir a área em palavras
Chance de o doente sorteado ter valor maior que o sadio.
Erro comum: Ler a área como proporção de acertos do exame.
- 3
Confirmar que a área não escolhe o corte
0,734 e 0,727 para dois limiares do mesmo exame.
Erro comum: Usar a área para justificar um ponto de corte específico.
- 4
Separar discriminação de calibração
Ordenar bem não é acertar o valor entregue.
Erro comum: Concluir que boa área implica número confiável.
- 5
Reconhecer a superestimação sistemática
Modelos renais com concordância alta e risco inflado.
Erro comum: Anunciar ao paciente um risco que o modelo exagera.
- 6
Descontar o otimismo da derivação
Área aparente de 0,83 e corrigida de 0,79.
Erro comum: Citar a área aparente como se fosse desempenho real.
- 7
Decidir o uso possível do modelo
Ordenar prioridades enquanto a calibração local não existe.
Erro comum: Abandonar o modelo ou usá-lo cegamente, sem meio-termo.
- 8
Fechar pela pergunta de cabeceira
Qual faixa esta área resume, e o número corresponde ao real?
Erro comum: Adotar modelo pela área e descobrir o resto na prática.
Exemplo resolvido
Volte ao caso e aplique o modelo sem pular da seta do laudo para a conclusão. O ponto de controle é: O desempenho global da curva representa a faixa de risco em que esta decisão realmente acontece?
| Pergunta do caso | Peça que responde | Resposta em uma linha |
|---|---|---|
| O que a área mede? | Discriminação | Chance de o doente sorteado ter valor maior que o sadio |
| Área de 0,80 basta? | Calibração | Não: o valor entregue pode não corresponder a risco real |
| Duas áreas iguais são iguais? | Faixa de operação | Não: as curvas podem se cruzar onde a decisão acontece |
| O modelo é útil? | Benefício líquido | Depende da frequência do desfecho e do que se faz com ele |
| A área publicada é a real? | Otimismo | Na derivação ela é inflada: 0,83 aparente contra 0,79 corrigida |
Duas virtudes independentes de um modelo
| Propriedade | O que significa | Como se mede |
|---|---|---|
| Discriminação | Colocar os doentes acima dos sadios | Área sob a curva de operação do receptor |
| Calibração | O risco previsto bater com o observado | Inclinação, intercepto e razão esperado sobre observado |
| Utilidade clínica | Ganho real frente a tratar todos ou ninguém | Análise de curva de decisão, benefício líquido |
| Desempenho em desfecho raro | Alarmes falsos frente aos verdadeiros | Área sob a curva de precisão e revocação |
- Discriminação viaja melhor que calibração: um modelo importado costuma manter a ordenação e perder o valor absoluto — por isso a recomendação de recalibrar localmente antes de usar.
- Área próxima de 0,50 é a diagonal do acaso; área alta com intervalos amplos nas medidas pontuais ainda descreve um teste incerto em cada ponto de operação.




Limites e armadilhas
- Adotar modelo só pela área sob a curva
- Ela mede ordenação, não o valor entregue ao paciente.
- Usar a área para escolher o ponto de corte
- Ela é a mesma para todos os cortes da curva.
- Comparar dois exames apenas pelas áreas
- Curvas com áreas iguais podem se cruzar onde importa.
- Confundir discriminação com calibração
- Ordenar bem e acertar o número são virtudes distintas.
- Dizer probabilidade de modelo descalibrado
- Com inclinação de 0,17, o número não representa risco.
- Supor que validação externa cobre tudo
- A discriminação atravessou a fronteira; a calibração não.
Regra prática para o atendimento
Feche o raciocínio em voz alta e deixe um plano que outra pessoa consiga revisar.
- 01Exija desempenho no limiar de decisão e verifique calibração; não encerre a análise na AUC.
- 02Entender o problema que a curva resolve
- 03Reconhecer áreas próximas de 0,50
- 04Separar discriminação de calibração
- 05Procurar a análise de curva de decisão
- 06Escolher as palavras com a família
Questões (10)
Ponte para o atendimento
No caso vinculado, formule uma probabilidade pré-teste antes de abrir os exames. Diga quais dados da história e do exame físico sustentam essa faixa e escolha um resultado que realmente possa cruzar um limiar de decisão. Depois atualize a hipótese e explique por que o mesmo laudo teria outro significado em um cenário de menor ou maior risco.
Feche com três caminhos explícitos: o que fazer diante de resultado positivo, negativo e inconclusivo. Inclua preferência do paciente, custo de cada erro e plano de reavaliação.
Revisão espaçada
O que representa cada ponto de uma curva de operação do receptor? Como se traduz em palavras a área sob a curva? Por que um modelo pode ter boa área e ainda assim entregar números de risco que não correspondem à realidade?
Explique os dois casos de abertura por inteiro: por que a unidade de terapia intensiva se enganou ao adotar o modelo pela área, e por que o ambulatório assustava pacientes com números inflados. Inclua na resposta a diferença entre discriminação e calibração e o que significa uma inclinação de calibração de 0,17.
