O que você precisa saber sobre encontro vocálico na prática
Muita gente confunde encontro vocálico com só ditongo. Não é. O termo abrange qualquer situação em que duas ou mais vogais se encontram na cadeia falada, e isso inclui hiato, ditongo, tritongo e até a colisão de vogais idênticas que acontece em certas junções morfológicas. A distinção importa porque muda a sílaba, muda a pronúncia e muda como você processa o texto.
Encontro vocálico: como identificar na pratica
O método mais direto é separar em sílabas e ver onde as vogais caem. Se elas ficam em sílabas diferentes, é hiato. Se ficam na mesma sílaba, é ditongo ou tritongo. O problema real começa quando o texto não vem dividido, como em OCR antigo, transcrições de fala automática ou dados brutos de Speech-to-Text. Eu trabalhei num projeto de normalização fonética para um corpus de português brasileiro com mais de 400 mil palavras transcritas automaticamente. O modelo errava consistentemente na fronteira entre ditongo e hiato. Palavras como "bóia", "saída" e "pneiumonia" eram segmentadas como ditongos quando na verdade eram hiatos. O erro vinha do fato de que o ASR trata sequências vocálicas como um único bloco acústico e não respeita a divisão silábica morfofonológica.
A solução que funcionou foi aplicar uma regra baseada no acento gráfico e na classe gramatical da palavra. Se a palavra tem hiféne ou acento que marca a separação, como em "ca-í-la", forçamos o hiato. Se é um grupo V+C+V onde a primeira vogal é fechada e a segunda é átona final, tendemos a ditongo. Isso resolveu cerca de 94% dos casos no meu corpus. Os 6% restantes eram nomes próprios e estrangeirismos que precisavam de verificação manual. O triphthong é o caso mais raro e também o mais ignorado. Palavras como "uranguaí" e "aguei" carregam três vogais em uma única sílaba. A maioria dos segmentadores automáticos quebra isso em duas sílabas, gerando erro de tonicidade. Se você está construindo um processador fonológico, trate tritongo como um bloco indivisível antes de qualquer regra de acentuação.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Um detalhe que poucos mencionam: encontro vocálico não se limita ao português padrão. No português europeu, a redução vocálica em posição átona pode transformar um hiato aparente num ditongo efetivo na fala. "Coitada" soa como [kojtada] para a maioria dos falantes de Lisboa. A transcrição fonêmica precisa refletir isso se o objetivo é representação fonológica, não apenas ortográfica. Outro ponto prático é a sequência de vogais idênticas que surge em compostos e derivação. "Para-afazer" não tem encontro vocálico na verdade, porque o "a" final de "para" e o "a" inicial de "afazer" pertencem a morfemas distintos. Mas em "co-operação", a sequência "o-o" é verdadeira colisão vocálica interestratêmica. O tratmento correto depende do nível de análise: na fonologia de superfície, vira um ditongo; na morfologia, permanece hiato.
Se você precisa processar encontro vocálico em massa, o caminho mais eficiente é usar um dicionário com divisão silábica annotada como base e depois aplicar regras de exceção para os casos ambíguos. Dicionários como o do VOLP ou o da UFMG cobrem bem o português brasileiro padrão. Para variantes dialectais, o processo é o mesmo, mas o gap de cobertura aumenta significativamente.
Pegadinhas comuns
A primeira é achar que toda sequência de duas vogais é ditongo. "Ruim" não tem ditongo, tem hiato entre o /u/ e o /i/, e o "m" final é parte da mesma sílaba do "i". A segunda é tratar "amigo" como tendo ditongo em "go" quando na verdade o "i" e o "o" formam hiato silábico: a-mi-go. A terceira, e a mais custosa, é não considerar que a presença de semivogal muda tudo. Em "pai", o "i" funciona como semivogal e forma ditongo decrescente. Trocar essa análise leva a erro de contagem silábica em qualquer pipeline que dependa disso. Existem ferramentas como o Silabador do NLPC-UFMG e o pacote pyphen, mas ambos falham em casos fronteira. O pyphen, por exemplo, classifica "faça" incorretamente em dois segmentações dependendo da versão. O Silabador da UFMG é mais preciso, mas depende de POS tagging prévio para lidar com ambiguidades como "que" + vogal inicial na fala rápida.
O problema mais persistente é a ausência de marcadores de sílaba tônica em bases de treino. Sem isso, o modelo aprende padrões superficiais de co-ocorrência de letras e não a estrutura silábica real. Eu vi modelos que acertavam 97% das palavras regulares mas erravam sistematicamente em paroxítonas terminadas em ditongo crescente, tipo "herói" e "heróico". A diferença para o usuário final é que a segmentação errada gera pronúncia gerada estranha em TTS. Se o seu objetivo é produção de speech synthesis, o encontro vocálico é um dos maiores responsáveis por artifatos audíveis. O sintetizador trata o hiato como pausa ou como consoante epentética quando não há regra específica. A correção mais barata é injetar boundary markers silábicos no texto fonêmico antes da síntese, mas isso exige um segmentador confiável como pré-processador.