Entendendo como conectar referências de frutas e vegetais entre bases de dados
Quando você trabalha com catálogos agrícolas, bancos de dados fitossanitários ou sistemas de rastreio de produção, logo percebe que uma mesma laranja pode aparecer com dezenas de nomes diferentes. Variedade 'Pera', 'Natal', 'Hamlin' — às vezes o mesmo fruto é classificado por nome popular, nome científico, código EMATER, ou até referência regional. A intertextualidade hortifruti é exatamente o esforço de mapear essas conexões entre os textos que descrevem os mesmos produtos em contextos distintos. Não é teoria literária aplicada ao campo. É sobre conseguir que um sistema em São Paulo entenda que "caju" no Nordeste é a mesma coisa que "acaiá" em certas bases do Norte, e que "melancia" e "watermelon" apontam para o mesmo registro em uma planilha de importação.
Intertextualidade hortifruti na prática
O problema real começa quando você precisa cruzar dados de duas fontes que não conversam. Eu tive que resolver isso num projeto de integração entre uma base de cooperativas do Vale do São Francisco e um sistema de compras públicas federais. As cooperativas listavam "manga Palmer" enquanto o sistema federal usava "Mangifera indica L., cv. Palmer". Não bastava um replace. Havia dez variedades de manga com nomes sobrepostos, e algumas coirmãs regionais nem constavam no glossário oficial. A solução que funcionou foi construir uma tabela de mapeamento com três colunas: termo da fonte A, termo da fonte B, e confidence score baseado em três critérios. O primeiro critério era match de nome científico. O segundo, semelhança fonética normalizada. O terceiro, confirmação por atributos botânicos compartilhados — cor da casca, época de safra, região de cultivo. Isso reduziu os falsos positivos de 40% para algo em torno de 7%, que ainda é aceitável quando o volume é grande.
Como montar seu próprio mapeamento
A primeira coisa que você precisa não é uma ferramenta, é uma lista normalizada de termos. A Embrapa publica listas de nomes científicos aceitos, a Tabela de Codificação de Produtos do Sistema Integrado de Comércio Exterior traz códigos NDICEA, e cada estado tem sua própria nomenclatura em publicações da agência de assistência técnica. O trabalho é juntar tudo num único arquivo. Passo um: exports as bases. CSV funciona melhor do que Excel para isso, porque evita codificação estranha e problemas de vírgula dentro de campos de texto. Pegue os dados brutos de pelo menos três fontes diferentes antes de começar a trabalhar.
Passo dois: normalização de strings. Remove acentos, coloca tudo em minúsculas, corta espaços extras e substitui variantes ortográficas antigas pelas normas atuais. "Melancia" vira "melancia", mas "melancia" também precisa ser identificado a partir de "sem-casca" ou "citrullus lanatus" se esse for um sinônimo aceito na sua base. Passo tres: construção dos pares de equivalência. Aqui entra a parte que costuma dar trabalho. Nome popular para nome científico é o mais fácil. Dificuldade média aparece quando você tem subvariedades — "tangerina Ponkan" e "tangerina Murcott" são frequentemente confundidas em registros informais porque ambas são citrinas sem sementes. A distinção real depende de dados como presença deombigo e teor de brix, que quase nunca estão disponíveis nas bases primárias.
Passo quatro: validação com alguém que conheça o produto. Um script pode sugerir que "pitanga" seja equivalente a "PG-001" num código genérico de frutos vermelhos. Sozinho você não percebe. Alguém que tenha colhido pitanga no Sul do país avisa que é Myrciaria calycina, não uma Rubiaceae qualquer. Consulte sempre um agrônomo ou produtor antes de fechar o mapeamento.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Pegadinhas que ninguém conta
O erro mais comum é assumir que intertextualidade é apenas tradução de nomes. Na verdade, o maior problema é ambiguidade de escopo. Uma "batata-doce" no Paraná pode ser Ipomoea batatas L. Lam. na fonte acadêmica, mas em um catálogo comercial do Rio Grande do Sul o mesmo nome pode se referir a uma variedade de batata comum cultivada em solo doce. Sem contexto geográfico e sem dados de origem, o mapeamento fica incorreto. Outro problema é a variação temporal. Nomes mudam. A CBPF (Comissão Brasileira de nomenclatura Fitotécnica) atualiza periodicamente suas listas. Um mapeamento feito em 2018 já estava desatualizado em 2022 com relação a pelo menos treze nomes de frutas cítricas. Sempre verifique a data de atualização das fontes primárias antes de confiar nos links que você construiu.
Há também o problema da regionalização extrema: "jaradinho" no Espírito Santo é uma cultivar de melancia, mas em outras regiões o mesmo nome pode se referir a uma abóbora. Se sua base não inclui código regional como campo obrigatório, esses conflitos vão aparecer nos resultados finais como inconsistências inexplicáveis.
Ferramentas que realmente ajudam
Para quem faz isso com frequência, Python com pandas é suficiente na maior parte dos casos. A biblioteca fuzzywuzzy ou Levenshtein rate ajuda nos matches aproximados. Já para quem prefere soluções prontas, o OpenFoodFacts tem uma API que mapeia produtos alimentícios por nome e código, e embora o foco não seja exclusivamente hortifruti brasileiro, ela resolve parte significativa do mapeamento internacional. Para o âmbito nacional, o sistema SISDA (Sistema de Diversidade Agrícola) do Incra tem listas que podem servir de base, mas requer adaptação manual significativa. Eu uso um fluxo simples: puxo os dados brutos, passo por um script de limpeza, rodo uma comparação fuzzy com threshold de 85%, verifico manualmente os pares abaixo de 95%, e então produzo um arquivo final de equivalências. O processo completo, para uma base de cerca de 200 itens, leva entre 4 e 6 horas. Sem automação, levaria um dia inteiro pelo menos.
Quando isso não funciona
Existem produtos cuja intertextualidade simplesmente não pode ser resolvida automaticamente. Frutas esquecidas ou variedades locais sem registro em bases amplas ficam sempre na mão do operador. Se você trabalha com comunidades ribeirinhas ou agricultores familiares em áreas remotas, vai encontrar nomes que nunca apareceram em catálogo algum. Nesse caso, o mapeamento automatizado falha, e só uma consulta direta ao produtor ou à cooperativa local resolve. Não existe workaround técnico para isso. Também não adianta aplicar a técnica a bases com qualidade ruim. Se os dados de entrada já estão cheios de erros de digitação, duplicações e nomes truncados, a intertextualidade vai herdar todos esses problemas multiplicados. A regra é simples: dados ruins geram mapeamentos ruins, não importa quão sofisticado seja o algoritmo.
Download do template
O template básico que eu uso para essas tabelas de equivalência está disponível no repositório público do projeto. O arquivo contém colunas para nome popular, nome científico, código NDICEA, fonte de origem, data de atualização e notas de validação. Ele já vem com cerca de 180 registros mapeados para o Sudeste e Centro-Oeste, prontos para expansão. Basta clonar e começar a preencher as lacunas regionais que faltam na sua operação.