Projeto Genoma Humano - Mapa Do Projeto Genoma Humano
Mapa Do Projeto Genoma Humano

Como trabalhar com dados do projeto genoma humano na prática

A primeira coisa que todo mundo ignora ao começar a mexer com dados genômicos é o volume. O projeto genoma humano gerou mais de 3 bilhões de pares de bases, e isso não cabe num arquivo de texto comum. Quando eu comecei a lidar com VCFs brutos, meu primeiro problema foi simplesmente abrir um arquivo de 40 GB no R sem o computador travar. A solução não foi mágica: usei o GATK com divisões de regiões e processei por chunks de cromossomo. Levei duas noites no lugar de dois dias. O projeto genoma humano foi oficialmente concluído em 2003, mas o que muita gente não entende é que ele nunca esteve 100% completo. As regiões centroméricas, teloméricas e os repeats satélites ficaram fora do consensus initial por questões técnicas da época. O telômero de repetições emaranhadas era especialmente difícil de montar. Só em 2022, com o trabalho do consórcio T2T (Telomere-to-Telomere), é que sequenciaram aquelas regiões que tinham sido deixadas para trás. Mesmo assim, a versão GRCh38 do projeto genoma humano continua sendo o padrão-ouro para análise clínica e pesquisa.

O que você precisa saber sobre projeto genoma humano para não perder tempo

A referência mais usada é o GRCh38/hg38. Se você estiver rodando pipeline de variante calling e usar hg19 por esquecimento, todas as coordenadas vão bugar. Eu já vi relatório inteiro de variantes ser descartado por causa disso porque ninguém verificou a build na configuração do samtools. A versão do referencial tem que bater em todo step do pipeline — alignment, annotation, variant calling. Se um deles estiver em build diferente, o resultado é lixo. Não tem como fazer pós-processamento para corrigir depois. Outro detalhe que ninguém conta: o GRCh38 ainda contém contigs de substituição e contigs de Unplaced. Se você filtrar apenas os cromossomos principais numerados de 1 a 22 mais X e Y, vai perder dados reais de variantes. Já tuve um caso em que um paciente tinha uma variante patogênica em um scaffold de substituição que foi eliminado pelo filtro padrão do pipeline. A variante só apareceu quando revisei os logs de alignment e percebi que as reads estavam mapeando, mas não estavam sendo reportadas.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Para baixar os dados, o site do NCBI (ftp://ftp.ncbi.nlm.nih.gov/genomes/all/GCF_000001405.40_GRCh38.p14/) tem o arquivo FASTA de referência completo. Os VCFs de variantes populacionais estão no dbSNP e no gnomAD. Se precisar apenas das regiões codificantes para economia de processamento, o exon bed do UCSC Genome Browser resolve — as exons do GENCODE v44 ocupam cerca de 35 MB em formato bed, enquanto o genoma inteiro com repeats anotados passa de 500 MB. Uma limitação séria que muita gente subestima: o projeto genoma humano foi construído a partir de DNA de poucos doadores, predominantemente de ancestralidade europeia. Isso significa quealnmapentos em populações não europeias têm taxa de erro sistematicamente mais alta. Se seu estudo inclui amostras africanas ou indígenas, considere usar um pangenoma de referência como o do consórcio Human Pangenome Reference Consortium, que já tem mais de 350 haplotipos diversificados. A diferença na sensibilidade de chamada de variantes pode ser de 15 a 30% em regiões de alta diversidade.

Se você está montando um pipeline do zero, o caminho mais produtivo hoje é usar o Nextflow com o repositório nf-core, que já inclui passos de QC, alignment com BWA-MEM2, chamado de variantes com GATK HaplotypeCaller, e anotação com VEP. Um pipeline bem configurado roda um sample inteiro em cerca de 4 a 6 horas em um servidor com 32 núcleos e 128 GB RAM. Sem containerização, o tempo sobe para o dobro porque dependências binárias travam a instalação. O problema com containers e imagens Docker de ferramentas genômicas é que elas ficam desatualizadas rápido. O BWA-MEM2, por exemplo, teve uma atualização importante de performance em 2023 que mudou o throughput em 40%. Se você puxar uma imagem oficial do quay.io que foi buildada no ano anterior, vai rodar mais devagar sem perceber. Sempre verifique a tag da imagem e a data de build antes de iniciar um pipeline em produção.

Para quem quer apenas consultar dados sem rodar nada localmente, o UCSC Genome Browser e o Ensembl permitem visualizar variantes, genes e regiões conservadas diretamente no navegador. O gnomAD também tem uma interface de busca que responde em segundos para qualquer variante específica. Nem sempre vale a pena baixar e instalar tudo se o objetivo é apenas validar um achado pontual. Se seu foco é clínico e não acadêmico, lembre-se que a ACMG publicou guidelines atualizadas em 2023 para classificação de variantes. O que era classificado como VUS (Variante de Significado Desconhecido) em 2020 já foi reclassificado como benigno ou patogênico em muitos casos, conforme os bancos de dados cresceram. Consultar a versão mais recente das classificações antes de emitir qualquer laudo faz diferença real no acompanhamento do paciente.