Analisando propostas

Engenheiro de Dados para Arquitetura de Pipeline Etl e Banco de Dados Postgresql de Grande Escala

Publicado em 05 de Junho de 2026 dias na TI e Programação

Sobre este projeto

Aberto

Buscamos um Engenheiro de Dados ou DBA Sênior para arquitetar um pipeline ETL estruturado e um banco de dados relacional robusto, capaz de gerenciar a base de CNPJs da Receita Federal, que contém mais de 60 milhões de registros. O foco principal é estabelecer uma fundação de dados de alta disponibilidade em infraestrutura cloud (Hetzner), garantindo uma conexão fluida com uma plataforma analítica. O escopo macro está definido, mas valorizamos a sua expertise para avaliar o cenário, identificar lacunas técnicas e propor a melhor arquitetura.

O profissional ideal deve possuir domínio e experiência nas seguintes áreas:

*  Arquitetura de bancos de dados relacionais (PostgreSQL) e tuning de performance para tabelas de grande escala.
*  Desenvolvimento de esteiras ETL automatizadas e escaláveis, utilizando linguagens como Python, Pandas ou ferramentas equivalentes.
*  Gerenciamento de servidores Linux (Ubuntu) e configuração de firewalls para garantir acessos remotos seguros.
*  Aplicação de técnicas avançadas para prevenção de vazamento de memória (OOM) na manipulação simultânea de grandes volumes de dados (40GB+).
*  Experiência na aplicação de repositórios consolidados no GitHub para extração de dados governamentais, visando otimização e produtividade.

As diretrizes macros e expectativas de entrega para este projeto incluem:

*  Setup Inicial: Provisionamento completo do servidor, instalação e configuração do PostgreSQL, e blindagem da porta 5432 para segurança.
*  Ingestão de Dados: A injeção dos arquivos deve ser implementada com processamento em blocos (chunks) para evitar sobrecarga e garantir a estabilidade do hardware.
*  Modelagem de Dados: O campo primário deve ser tipado como varchar (cnpj alfanumérico), com índices otimizados para cruzamento geográfico e filtros de cnae.
*  Manutenção e Atualizações: Automação nativa (Cron Job) para baixar as tabelas mensalmente e executar o processo de UPSERT silencioso da base de dados, mantendo-a sempre atualizada.

Categoria TI e Programação
Subcategoria Data Science
Tamanho do projeto Grande

Prazo de Entrega: Não estabelecido

Habilidades necessárias

Outro projetos publicados por L.