Script Python automatizado para extrair e baixar documentos (PDF, DOC, XLS, etc.) de páginas web, com foco em preservar nomes amigáveis e lidar com carregamento dinâmico.
- Nomes Amigáveis: Extrai o contexto do link ou do elemento pai para nomear o arquivo de forma humana.
- Detecção de MIME Type: Garante a extensão correta inspecionando o cabeçalho
Content-Type. - Híbrido (Requests + Playwright): Prioriza downloads diretos em paralelo para velocidade e usa simulação de clique para casos complexos.
- Evasão Anti-Bot: Implementação de
playwright-stealthe comportamento humano para minimizar bloqueios. - Otimização: Agrupa links por URL e gerencia limites de download.
Para facilitar a execução, utilize os scripts de automação que configuram o ambiente e instalam as dependências automaticamente:
chmod +x run.sh
./run.sh "https://site-alvo.com" --limit 5run.bat "https://site-alvo.com" --limit 5-
Python 3.10+:
- Linux/Mac: Geralmente já instalado (
python3 --version). - Windows:
- Baixe em python.org.
- IMPORTANTE: Durante a instalação, marque a caixa "Add Python to PATH".
- Verifique abrindo o Prompt de Comando e digitando
python --version.
- Linux/Mac: Geralmente já instalado (
-
Configuração (Automática via scripts):
- O
run.shourun.batcuidará do resto (ambiente virtual e dependências).
- O
python downloader.py "https://site-alvo.com" [argumentos]url: A URL da página que contém os links para os documentos.--outou-o: Pasta onde os arquivos serão salvos (padrão:downloads).--limitou-l: Limite máximo de arquivos para baixar (ignora arquivos já existentes).--keywordsou-k: Palavras-chave adicionais para busca (ex: "planilha,anexo,vencimentos").
Para detalhes sobre os sites testados, desafios técnicos superados e restrições conhecidas, consulte o arquivo TESTS.md.
Este projeto é de uso livre para fins educacionais e profissionais.