PyPDF Saw Text é uma aplicação desktop escrita em Python que insere a tecnologia OCR (Optical Character Recognition – Reconhecimento Óptico de Caracteres) em documentos no formato PDF. Até o momento apenas o idioma Português (Brasil) é suportao. A ferramenta permite que o usuário selecione uma pasta contendo arquivos PDF e, de forma automatizada, converta todos os documentos encontrados em versões com texto reconhecível. E não há limite predefinido de arquivos: todos os PDFs válidos encontrados na pasta selecionada serão processados sequencialmente.
O PyPDF Saw Text é uma ótima maneira de tornar seus PDFs pesquisáveis sem esforço — tudo isso sem necessidade de instalar tranqueiras ou digitar comandos.
- ✅ Não é necessário ter Python instalado para executar a aplicação. O interpretador está incluso!
⚠️ O Tesseract e Ghostscript já estão embutidos na pastabin/da aplicação.
- Definir pasta de origem dos documentos: Permite escolher a pasta que contém todos os arquivos PDF a serem convertidos, sem limite máximo de documentos;
- Definir pasta de saída dos documentos: Define o local onde os arquivos convertidos serão salvos. Os PDFs manterão os mesmos nomes dos arquivos originais, sem a necessidade de renomeá-los manualmente;
- Acesso ao repositório do desenvolvedor: Um link localizado no rodapé da aplicação direciona diretamente para este repositório;
- Reconhecimento Óptico de Caracteres (OCR): O texto dos documentos será reconhecido em Português (Brasil) utilizando a tecnologia do Tesseract;
- Compressão: O novo PDF tende a ocupar menos espaço em disco. Já que a ferramenta utiliza o Ghostscript para comprimir imagens e dados internos do arquivo, sem alterar seu conteúdo.
- Python 3.13.0: Linguagem de programação utilizada;
- CustomTkinter: Biblioteca que cria a interface gráfica;
- ocrmypdf: Biblioteca que extrai as páginas do PDF como imagens;
- Tesseract OCR: Ferramenta OpenSource que usa OCR para converter as imagens em texto reconhecível;
- Ghostscript: Ferramenta OpenSource para reescrever um novo PDF válido e com tamanho otimizado;
- cx_Freeze: Biblioteca que cria versões executáveis da aplicação para diferentes arquiteturas.
- O projeto utiliza o Python 3.13.0:
- Clone este repositório usando comando abaixo:
git clone https://github.com/alanmugiwara/pypdfsawtext- Navegue até o diretório /src:
cd pypdfsawtext/src- Instale as dependências de Python necessárias para o projeto:
pip install -r requirements.txt- Instale as dependências necessárias para a aplicação:
Ghostscript/GhostPDL 10.05.1
tesseract-ocr/tesseract · v5.5.0.20241111
sudo apt install ghostscript && apt install tesseract-ocr tesseract-ocr-por -y- Execute o Programa:
python main.py- O projeto utiliza o Python 3.13.0:
- Clone este repositório usando comando abaixo:
git clone https://github.com/alanmugiwara/pypdfsawtext- Instale as dependências de Python necessárias para o projeto:
pip install -r requirements.txt- Instale as dependências necessárias para a aplicação:
Ghostscript/GhostPDL 10.05.1
tesseract-ocr/tesseract · v5.5.0.20241111
sudo apt install ghostscript && apt install tesseract-ocr tesseract-ocr-por -y- Navegue até o diretório /src:
cd pypdfsawtext/src- No Windows - Rode o comando abaixo para buildar:
python setup_win.py build_exeWindows 10+ 64 bits
Visual C++ RedistributableMicrosoft Visual C++ Redistributable 2015–2022 (x64)
