Sobre este projeto
it-programming / data-science-1
Aberto
Se busca un profesional para extraer y organizar el contenido textual de un lote de archivos PDF. La tarea principal es la extracción de datos puros, sin necesidad de limpieza de datos adicional más allá de asegurar la integridad y el orden de cada oración. El objetivo es capturar todo el texto de cada PDF y estructurarlo en un archivo maestro.
Requisitos del Proyecto:
* Abrir cada archivo PDF y extraer todo el texto disponible.
* El texto extraído debe ser colocado en un archivo estructurado, preferiblemente CSV o Excel.
* El archivo de salida debe incluir una columna para el nombre del archivo original y otra para el número de página de donde se extrajo el texto.
* Las tablas e imágenes presentes en los PDF deben ser ignoradas; solo el contenido textual es relevante.
* La mayoría de las páginas son legibles por máquina, pero se anticipa que un pequeño número podría requerir Optical Character Recognition (OCR) ligero para asegurar la extracción completa.
* La precisión es fundamental: cada párrafo debe estar presente en su totalidad, los saltos de línea deben manejarse de manera sensata y no deben introducirse caracteres perdidos o erróneos.
Entregables:
* Un archivo maestro en formato CSV o Excel que contenga todo el texto extraído, el nombre de archivo original y el número de página correspondiente.
* Cualquier script, configuración de herramienta utilizada o notas claras paso a paso que permitan reproducir el proceso de extracción.
* Una muestra rápida de tres archivos procesados para su revisión y aprobación antes de proceder con el conjunto completo de documentos.
Categoria TI e Programação
Subcategoria Data Science
Tamanho do projeto Médio
Prazo de Entrega: Não estabelecido
Habilidades necessárias