Data Do Prouni - MEC divulga as datas do Prouni 2021/1
MEC divulga as datas do Prouni 2021/1

Como extrair e tratar os dados do PROUNI na prática

Quem já precisou trabalhar com dados do Programa Universidade para Todos sabe que o acesso não é tão direto assim. O INEP publica informações por portais distintos, e dependendo do que você precisa — notas de corte, participantes, instituições conveniadas — o caminho muda. Vou explicar como funciona no dia a dia, porque a documentação oficial raramente cobre os pontos que realmente travam. A base mais procurada é o conjunto de dados dos aprovados e matriculados por edição. Ele contém campos como CPF (ofuscado), nota do ENEM por área, rendimento familiar, cotas, instituição de ensino, curso,modalidade de bolsa e situação cadastral. Os arquivos vêm em formato .zip com conteúdo CSV ou SHP, dependendo do recorte.

Onde baixar a data do prouni corretamente

O portal de dados abertos do INEP é o endereço principal. Lá dentro, o filtro por programa mostra o lote do PROUNI separado por ano de publicação. Cada edição tem múltiplos arquivos: um para os aprovados, outro para os matriculados, e ainda um conjunto georreferenciado com as coordenadas das instituições. O nome dos arquivos segue o padrão "PROUNI_[ano]_[tipo].zip", então a confusão inicial é comum. Já vi gente baixar o arquivo de aprovados achando que era o de matricula. Se o link direto não funcionar, pode ser questão de cache ou de migração interna. A workaround que sempre deu certo foi acessar a versão bruta pela API do portal de dados abertos. Ela devolve os metadados de cada arquivo, incluindo o timestamp da última atualização, o que evita ficar validando lote desatualizado.

Há também o pacote disponível no repositório do INEP pelo GitHub, mas ele só atualiza quando o pessoal do órgão faz release. Costuma levar algumas semanas após o fechamento de cada convocatoria. Para quem precisa de rapidez, a API direta resolve em minutos.

O que os arquivos realmente entregam e onde costumam falhar

Os dados brutos são úteis, mas têm problemas reais de tratamento. O campo de CPF é ofuscado, o que é esperado por LGPD, mas isso quebra qualquer tentativa de consolidação individual sem enriquecimento externo. Se o objetivo é cruzar com outras bases, como CadÚnico ou RAIS, o ofuscamento é uma barreira direta. A solução prática é trabalhar com hashes ou aceitar que a análise fica no nível agregado de instituição/curso/edição. Outro ponto que pega todo mundo de surpresa é a padronização de nomes de instituições. O mesmo centro universitário aparece com pequenas variações de grafia entre lotes, o que impede um join simples por sigla. Meu workaround foi criar uma tabela de normalização baseada no censo da educação superior, que tem o código completo e oficial de cada IES. Com esse mapa de correspondência, o join ficou limpo em poucas linhas.

A variável de renda familiar também merece atenção. Ela vem em faixas, não em valores contínuos. Isso é suficiente para a maioria das análises de equidade, mas se você precisa modelar distribuição de rendimento, vai precisar de aproximação. Usei mediana de cada faixa como proxy e isso funcionou bem para comparações internas, embora não substitua o dado real quando ele estiver disponível.

Um problema específico que encontrei e como resolvi

Numa análise recente, precisei identificar quantos cursinhos com bolsa integral estavam em regiões fora da sede administrativa declarada. O arquivo SHP traz coordenadas, mas algumas linhas vinham com geometria nula. O problema é que o próprio Inep corrige parte desses registros depois da publicação, então o arquivo do mês seguinte já vinha corrigido enquanto o anterior permanecia com buracos. A solução foi cruzar com a base de sedes de IES do Censo da Educação Superior, filtrar os registros com geometria válida, e para os demais, usar a última versão disponível do arquivo. Assim, consegui preencher cerca de 94 por cento dos casos questionáveis. Os 6 por cento restantes ficaram como ausência confirmada, o que é honesto de reportar do que inventar completude.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Armazenamento e processamento

Se você for brincar com esses dados, não abra CSV direto no Excel. O arquivo de aprovados de uma edição recente tem mais de cem mil linhas com vinte e seis colunas. O Excel começa a engasgar a partir de cem mil linhas e perde precisão numérica acima disso. Use DuckDB ou SQLite. A consulta que leva dois minutos no banco leva quinze segundos com DuckDB, e o consumo de memória é desprezível porque ele lê apenas as colunas que você pede. Para quem quer automatizar, um script Python simples com requests para a API do INEP e pandas para tratar os CSVs basta. Um exemplo prático:

import requests, pandas as pd, zipfile, io url = "https://dadosabertos.inep.gov.br/prouni/api/arquivos"

r = requests.get(url, params={"ano": 2023}) df = pd.read_csv(io.BytesIO(r.content))

df.to_parquet("prouni_2023.parquet") Esse caminho já gera um parquet comprimido que pesa cerca de décimos do CSV original, e consultas subsequentes ficam muito mais rápidas. A conversão inicial leva cerca de trinta segundos num laptop comum.

O que esses dados não conseguem responder

É importante ser objetivo sobre as limitações. O conjunto do PROUNI não contém informação sobre desempenho acadêmico pós-ingresso, nem dados salariais dos egressos. Então qualquer afirmação sobre eficácia do programa a partir só dessa base é especulação. Se você precisa de efeito causal, o caminho é conectar com o microdados do ENADE e fazer matching por curso e IES, mas isso exige cuidado forte com selection bias e variáveis de Confounding. Também não recomendo usar esses dados para decisões individuais de candidatura. As notas de corte mudam por edital, por estado e por modalidade de cota, e a variação intra-ano pode ser grande. O que aparece consolidado é uma média descritiva, não uma meta garantia.

Cuidados finais antes de publicar qualquer número

Antes de divulgar tabelas ou gráficos, verifique três coisas. Primeiro, o ano-base do arquivo. Segundo, a coluna de situação cadastral, porque Aprovado sem Matricula é diferente de Matriculado e ambos têm significados distintos. Terceiro, a consistência geográfica. Um erro comum é somar bolsas por estado usando a sede da IES em vez do município de oferta efetiva do curso, o que distorce a distribuição regional. Se quiser manter tudo reproduzível, salve o script, o timestamp da requisição e o hash do arquivo baixado. Daqui a seis meses, quando o INEP mudar o esquema de pastas ou renomear colunas, você vai agradecer por ter esse registro. Eu já perdi duas horas refazendo um pipeline porque esqueci de versionar a URL base.

Resumindo sem dramatização: o dados existem, estão acessíveis, mas exigem tratamento mínimo para não gerar conclusões enganosas. Com uma tabela de normalização de IES, filtro por geometria válida e parquet como formato de trabalho, você consegue análises sólidas em menos de uma hora. Sem isso, o tempo dispara e os erros aparecem só na hora de apresentar.