Estamos buscando um freelancer experiente para realizar a extração e estruturação de dados de arquivos PDF do Programa Brasileiro de Etiquetagem Veicular (PBE Veicular) do Inmetro. Os PDFs contêm informações sobre a eficiência energética de veículos leves e estão disponíveis no site oficial do Inmetro. O desafio principal reside na variação dos layouts dos PDFs ao longo dos anos, exigindo uma solução robusta para garantir a coleta completa e precisa de todos os dados.
O projeto envolve as seguintes etapas:
1. Acesso e download dos arquivos PDF: Os PDFs devem ser coletados a partir do link fornecido:
https://www.gov.br/inmetro/pt-br/assuntos/avaliacao-da-conformidade/programa-brasileiro-de-etiquetagem/tabelas-de-eficiencia-energetica/veiculos-automotivos-pbe-veicular?b_start:int=0. É Crucial processar todos os documentos, do mais antigo ao mais recente.
2. Extração de dados: Desenvolver e implementar um método eficaz para extrair todas as informações relevantes de cada PDF, considerando as diferentes estruturas de layout que podem existir entre os anos.
3. Normalização e estruturação dos dados: Os dados extraídos devem ser limpos, padronizados e organizados em um formato estruturado. Isso inclui a identificação de colunas consistentes para cada tipo de informação (ex: marca, modelo, ano, consumo, emissões, etc.).
4. Entrega final: O resultado esperado é um conjunto de dados em formato csv ou json, completamente normalizado e pronto para ser importado em um banco de dados postgresql. A integridade e a completude dos dados são de suma importância.
O freelancer deve possuir experiência comprovada em extração de dados de PDFs, tratamento de dados não estruturados e conhecimento em preparação de dados para bancos de dados relacionais. Habilidades em programação (Python, por exemplo) e manipulação de dados são essenciais.
Prazo de Entrega: Não estabelecido