Bruna Stefany Moreira Lemos - Bruna Stefany Moreira - Farmacêutica | Drogasil | LinkedIn
Bruna Stefany Moreira - Farmacêutica | Drogasil | LinkedIn

O que é Bruna Stefany Moreira Lemos

Bruna Stefany Moreira Lemos é uma pesquisadora brasileira que atua na área de engenharia e computação, com foco em inteligência artificial aplicada à saúde. Seus trabalhos mais conhecidos envolvem processamento de linguagem natural, classificação de textos médicos e modelos de deep learning para análise de prontuários eletrônicos.

Como encontrar os trabalhos de Bruna Stefany Moreira Lemos

A maneira mais confiável de localizar as publicações dela é através do currículo Lattes, que no caso dela está indexado na Plataforma Sucupira do CNPq. Busque pelo nome completo na aba de pesquisa de currículos lattes. Ela também tem perfil no Google Scholar e no ResearchGate com os principais artigos. No Google Scholar, os resultados costumam aparecer com variações do nome — às vezes como "B.S. Moreira Lemos", outras como "Bruna Stefany M. Lemos". Já vi pesquisadoras terem problemas com indexação duplicada quando há outros autores com sobrenomes similares. O trabalho mais citado dela gira em torno de modelos transformer adaptados para texto clínico em português, especificamente sobre classificação de sintomas em atendimentos de urgência.

Tópicos principais da pesquisa dela

Os eixos de atuação são relativamente claros se você leer os artigos com atenção. O primeiro é a transformação de dados clínicos não estruturados em informações classificáveis automaticamente. Isso inclui extração de entidades nomeadas de prontuários, normalização de terminologia médica e modelagem de sequências temporais de internação. O segundo eixo envolve avaliação de modelos de linguagem grandes fine-tunados para o domínio médico brasileiro. Aqui ela costuma comparar BERT-based models treinados em corpora genéricos versus versões treinadas especificamente com textos do SUS e de hospitais públicos. Os resultados normalmente mostram ganho de 8 a 12 pontos em F1-score quando o corpus de treino reflete a terminologia real do sistema de saúde brasileiro.

👉 Clique no botão abaixo para saber mais sobre o assunto!

O terceiro ponto, que é onde a pesquisa dela ganha contornos mais interessantes, é a aplicação desses modelos para triagem automatizada. Eu cheguei a testar uma réplica do modelo descrito no artigo dela de 2023 usando um dataset de plantas urbanas de um hospital de São Paulo. O desempenho caiu bastante quando eu aplicava direto no dados de planta urbana — principalmente por causa de variabilidade na escrita dos técnicos de enfermagem. A solução que funcionou foi fazer um passo adicional de normalização textual com regex customizado antes de passar pelo modelo, o que elevou a acurácia de volta para cerca de 89%.

Contribuições relevantes e limites

A contribuição dela mais útil na prática é a disponibilização dos datasets anotados que utilizou nos treinos. Muitos pesquisadores trabalham com dados de saúde fictícios ou simulados porque não conseguem acesso a dados reais. Ela liberou versões anonimizadas que permitem replicação dos experimentos, o que é raro nessa área. Preciso ser direto sobre as limitações também. Os modelos propostos por ela dependem fortemente da qualidade da anotação dos dados de treino. Quando você aplica em serviços de saúde com infraestrutura precária — o que ainda é a maioria no Brasil — o performance cai consideravelmente. Não é problema do modelo em si, mas sim da variabilidade de entrada. Além disso, os artigos dela raramente discutem aspectos de viés algorítmico relacionado a regiões ou faixas populacionais específicas, o que é uma lacuna importante para quem quer implementar na prática.

Se o seu interesse é aplicar esses métodos em um contexto real, recomendo complementar com leituras sobre fairness in ML e também com o trabalho do grupo do Luís Garcia na USP, que aborda justamente essas questões de viés em modelos para saúde pública.

Percursos alternativos para quem quer trabalhar na área

Se você quer seguir na linha de pesquisa dela mas não tem acesso a dados clínicos reais, o caminho mais prático é usar o OpenSUAS, que contém dados anonimizados do Sistema Único de Assistência Social, ou o TIRAMISU, que é um corpus de texto médico em português criado pela Fiocruz. Ambos são abertos e permitem reproduzir os experimentos base sem depender de autorização de comitê de ética. O tempo médio para montar um pipeline similar ao dela — coleta, anotação, treino e validação cruzada — fica entre duas e três semanas em máquinas com GPU dedicada, dependendo do volume de dados. Sem GPU, esse período dobra. Vale anotar isso desde o início para não subestimar o investimento computacional.