EVENTO
Avaliação Centrada em Dados do Conhecimento Biomolecular em Modelos de Linguagem de Grande Porte
Tipo de evento: Defesa de Dissertação de Mestrado
A crescente adoção de Modelos de Linguagem de Grande Porte (LLMs) na ciência em geral, e na bioinformática em particular, coloca questões sobre a confiabilidade do seu conhecimento sobre entidades científicas, particularmente entidades biomoleculares. Em experimentos iniciais nos quais os modelos foram confrontados com enunciados biomédicos, três desafios se mostraram especialmente relevantes: (1) a tendência dos modelos a favorecer entidades mais frequentes na literatura; (2) a possível diferença de comportamento entre arquiteturas densas e arquiteturas baseadas em Mistura de Especialistas (MoE); e (3) a dificuldade metodológica de avaliar respostas envolvendo sinônimos, variantes nomenclaturais e designações proteicas. Este estudo parte desses desafios para investigar em que medida o viés de popularidade presente nos corpora de pré-treinamento afeta a capacidade de diferentes arquiteturas de LLMs de recuperar entidades biomoleculares ao longo de todo o espectro de frequência bibliográfica. Para isso, propõe-se um benchmark estratificado e balanceado, composto por 4.000tarefas de preenchimento de lacunas (cloze tasks) derivadas de abstracts do PubMed, com1.000 tarefas por estrato. As entidades foram particionadas em quatro estratos de popularidade (Q1--Q4), definidos com base no repositório gene2pubmed do NCBI. Quatro modelos foram avaliados em regime zero-shot no supercomputador Santos Dumont (LNCC), permitindo comparar o desempenho de modelos densos e MoE diante da mesma distribuição controlada de entidades. A avaliação exigiu ainda enfrentar o problema da normalização semântica das respostas. Para isso, as saídas dos modelos foram processadas pelo Normalization Engine for Biological Benchmarking (NEBB), um pipeline semântico em três camadas que mapeia sinônimos e designações proteicas a símbolos canônicos do HGNC. Essa etapa mostrou-se indispensável: a normalização resgatou cerca de 30% dos acertos que seriam penalizados por uma correspondência estrita de strings, evidenciando que a avaliação de conhecimento biomolecular em LLMs depende criticamente de mecanismos robustos de normalização de entidades. Os resultados revelam uma degradação severa e transversal da acurácia na cauda longa da distribuição bibliográfica (Q4), com declínios relativos entre 78% e 81% em todas as arquiteturas. O modelo denso Llama 3.3 (70B) obteve a maior acurácia global auditada (37,3%), enquanto a variante MoE apresentou o pior desempenho em todos os estratos, indicando que o roteamento de especialistas, nesse caso, não mitigou o viés de popularidade. Mais do que uma simples lacuna de conhecimento, o viés revelou-se uma força direcional: em 77,6% dos erros, o gene incorretamente predito era mais citado que o gene correto, com razão mediana de 3,7 vezes, chegando a 16,3 vezes na cauda longa. Assim, quando falha, o modelo tende a deslocar ativamente sua predição para o centro da distribuição bibliográfica. Além disso, a forte concentração das falhas 51,2% dos casos não foram recuperados por nenhum dos quatro modelos, valor 2,6 vezes maior do que seria esperado caso os erros fossem independentes sugere que a limitação observada reside menos em escolhas pontuais de engenharia e mais na estrutura dos dados de pré-treinamento. Conclui-se que o viés de popularidade constitui uma limitação estrutural do pré-treinamento auto regressivo, não resolvida pela variante arquitetural MoE baseada em roteamento de especialistas. Para aplicações biomédicas, sua manifestação mais problemática não é a ausência de resposta, mas a produção aparentemente fluente de umaentidade incorreta e mais popular.Evento HíbridoLocal: Auditório do LNCCLink da Transmissão: https://meet.google.com/zwz-cdvb-sit
Data Início: 08/09/2026 Hora: 09:30 Data Fim: 08/09/2026 Hora: 12:00
Local: LNCC - Laboratório Nacional de Computação Ciêntifica - Auditorio B
Aluno: Guilherme Henrique Bittencourt - - LNCC
Orientador: Bernardo Nunes Gonçalves - Laboratório Nacional de Computação Científica - LNCC
Participante Banca Examinadora: Ana Tereza Ribeiro de Vasconcelos - Laboratório Nacional de Computação Científica - LNCC Bernardo Nunes Gonçalves - Laboratório Nacional de Computação Científica - LNCC Sarajane Marques Peres. - Universidade de São Paulo - USP
Suplente Banca Examinadora: Fabio Andre Machado Porto - Laboratório Nacional de Computação Científica - LNCC Fabio Gagliardi Cozman - Universidade de São Paulo - USP


