Análise da consistência de modelos de linguagem na interpretação de casos clínicos

Souto, Juliana Miranda de

Resumo

Este trabalho analisou a consistência de modelos de linguagem de grande escala na interpretação de casos clínicos. O objetivo foi investigar o comportamento dos modelos ChatGPT e DeepSeek ao responder repetidamente aos mesmos casos, utilizando diferentes estratégias de prompt, incluindo zero-shot e few-shot, em formatos estruturados e não estruturados. Para isso, foram utilizadas questões clínicas provenientes do dataset MedQA USMLE, selecionadas e filtradas com foco em diagnóstico. A consistência das respostas foi avaliada com base na estabilidade da hipótese principal, das hipóteses alternativas, do nível de urgência e da estrutura da resposta ao longo de múltiplas execuções. Os resultados indicaram que as estratégias de prompt influenciaram a estabilidade das respostas, sendo observadas maiores médias de consistência geral nas estratégias A e B. Também foi verificado que a hipótese principal e o nível de urgência apresentaram maior estabilidade do que as hipóteses alternativas. O estudo contribui para a compreensão da consistência como uma métrica complementar à acurácia na avaliação de modelos de linguagem em tarefas relacionadas à área da saúde.

Citação

Artigo Completo

Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.