Polissemia é quando uma mesma palavra tem vários significados relacionados entre si. Isso é diferente de homonímia, onde sons iguais surgem de origens diferentes. Na polissemia, os sentidos compartilham um núcleo conceitual. Bastante simples na teoria. Muito mais confuso na prática.
O que significa polissemia na análise linguística aplicada
Quando você trabalha com processamento de linguagem natural ou tradução automática, polissemia é um dos problemas centrais que faz os sistemas falharem. Não é sobre ambiguidade genérica. É sobre ambiguidade estrutural que exige desambiguação contextual. Uma frase como "banco pode ser móvel ou instituição financeira" é o exemplo clássico de livro didático. A realidade é pior porque o contexto raramente é suficiente para resolver tudo sozinho.
Eu passei semanas lidando com um problema específico em um projeto de extração de entidades nomeadas para o setor bancário brasileiro. A palavra "código" aparecia em contratos financeiros com pelo menos cinco sentidos distintos: código de barras, código de autorização, código do cliente, código de operação e código tributário. Nenhum modelo pré-treinado conseguia distinguir adequadamente entre esses usos sem treinamento supervisionado robusto. O workaround que funcionou foi criar um conjunto de regras heurísticas baseado no campo lexical ao redor da palavra. Se "código" vinha seguido de numeração do tipo 7555/00001-7, era código de barras. Se vinha antes de "de autorização", era código de autorização. Regras simples. Funcionaram melhor do que qualquer transformer que eu tinha disponível na época.
A lição prática aqui é que polissemia exige abordagem híbrida. Contexto puro não resolve. Regras puras também não. O ideal é combinar ambos.
Os sensores da cidade estão todos defeituosos
Vou dar outro exemplo mais direto. "Os sensores da cidade estão todos defeituosos" é uma frase que parece simples. Polissemia ataca dois pontos aqui. "Sensores" pode significar dispositivos físicos de monitoramento urbano ou, em gíria técnica, pode se referir a sensores humanos — pessoas que vigiam. "Cidade" também carrega polissemia: pode ser o município literal, a área metropolitana, ou até mesmo uma categoria funcional em sistemas de rede. Quando você está construindo um sistema que precisa interpretar esse tipo de frase automaticamente, a ambiguidade multiplas palavras encadeadas multiplica o espaço de interpretação de forma exponencial.
Minha recomendação técnica é usar word sense disambiguation (WSD) com embeddings contextuais, como os do BERT ou modelos similares, mas nunca confiar cegamente neles. A taxa de erro em domínios específicos pode variar muito. Em textos jurídicos brasileiros, por exemplo, a polissemia de termos como "contrato", "negócio" e "ato" tem padrões específicos que modelos genéricos não captam bem. Um fine-tuning focado no domínio certo reduce drasticamente a taxa de erro.
Outro ponto que poucos mencionam: a polissemia não é uniformemente distribuída entre as palavras. Algumas palavras são cronicamente polissêmicas. Em português, "coisa", "modo", "ponto" e "razão" estão constantemente no topo dessa lista. Se você está construindo um pipeline de processamento de texto, vale a pena fazer um inventário prévio dessas palavras no seu corpus específico. Mapear os sentidos dominantes de cada uma delas antes de treinar qualquer modelo economiza semanas de trabalho.
O que significa polissemia, resumindo, é que a linguagem humana não mapeia palavra-por-sentido de forma unívoca. Isso é uma propriedade intrínseca, não um defeito. Qualquer ferramenta ou metodologia que ignore isso vai gerar erros sistemáticos. O melhor tratamento que encontrei foi criar dicionários de sentidos personalizados por domínio, anotados manualmente em amostras representativas, e usá-los como ground truth para ajustar os modelos downstream. Demora. Mas funciona.