Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

6 Commits
 
 
 
 
 
 

Repository files navigation

made With Created Last Commit contributors issues counter repo size files counter Latest Tag downloads counter Maintainability Code Coverage

PyPDF Saw Text

PyPDF Saw Text é uma aplicação desktop escrita em Python que insere a tecnologia OCR (Optical Character Recognition – Reconhecimento Óptico de Caracteres) em documentos no formato PDF. Até o momento apenas o idioma Português (Brasil) é suportao. A ferramenta permite que o usuário selecione uma pasta contendo arquivos PDF e, de forma automatizada, converta todos os documentos encontrados em versões com texto reconhecível. E não há limite predefinido de arquivos: todos os PDFs válidos encontrados na pasta selecionada serão processados sequencialmente.

O PyPDF Saw Text é uma ótima maneira de tornar seus PDFs pesquisáveis sem esforço — tudo isso sem necessidade de instalar tranqueiras ou digitar comandos.

📥 Download

Get it on GitHub
  • Não é necessário ter Python instalado para executar a aplicação. O interpretador está incluso!
  • ⚠️ O Tesseract e Ghostscript já estão embutidos na pasta bin/ da aplicação.

Funcionalidades

  • Definir pasta de origem dos documentos: Permite escolher a pasta que contém todos os arquivos PDF a serem convertidos, sem limite máximo de documentos;
  • Definir pasta de saída dos documentos: Define o local onde os arquivos convertidos serão salvos. Os PDFs manterão os mesmos nomes dos arquivos originais, sem a necessidade de renomeá-los manualmente;
  • Acesso ao repositório do desenvolvedor: Um link localizado no rodapé da aplicação direciona diretamente para este repositório;
  • Reconhecimento Óptico de Caracteres (OCR): O texto dos documentos será reconhecido em Português (Brasil) utilizando a tecnologia do Tesseract;
  • Compressão: O novo PDF tende a ocupar menos espaço em disco. Já que a ferramenta utiliza o Ghostscript para comprimir imagens e dados internos do arquivo, sem alterar seu conteúdo.

Tecnologias Utilizadas

  • Python 3.13.0: Linguagem de programação utilizada;
  • CustomTkinter: Biblioteca que cria a interface gráfica;
  • ocrmypdf: Biblioteca que extrai as páginas do PDF como imagens;
  • Tesseract OCR: Ferramenta OpenSource que usa OCR para converter as imagens em texto reconhecível;
  • Ghostscript: Ferramenta OpenSource para reescrever um novo PDF válido e com tamanho otimizado;
  • cx_Freeze: Biblioteca que cria versões executáveis da aplicação para diferentes arquiteturas.

Demonstração

Demonsraoção

Como Reproduzir e executar?

  1. O projeto utiliza o Python 3.13.0:
  1. Clone este repositório usando comando abaixo:
git clone https://github.com/alanmugiwara/pypdfsawtext
  1. Navegue até o diretório /src:
cd pypdfsawtext/src
  1. Instale as dependências de Python necessárias para o projeto:
pip install -r requirements.txt
  1. Instale as dependências necessárias para a aplicação:

Windows

Ghostscript/GhostPDL 10.05.1
tesseract-ocr/tesseract · v5.5.0.20241111

GNU/Linux (Ubuntu/Debian) e derivados

sudo apt install ghostscript && apt install tesseract-ocr tesseract-ocr-por -y
  1. Execute o Programa:
python main.py

Como fazer o Build?

  1. O projeto utiliza o Python 3.13.0:
  1. Clone este repositório usando comando abaixo:
git clone https://github.com/alanmugiwara/pypdfsawtext
  1. Instale as dependências de Python necessárias para o projeto:
pip install -r requirements.txt
  1. Instale as dependências necessárias para a aplicação:

Para Windows

Ghostscript/GhostPDL 10.05.1
tesseract-ocr/tesseract · v5.5.0.20241111

Para GNU/Linux (Ubuntu/Debian) e derivados

sudo apt install ghostscript && apt install tesseract-ocr tesseract-ocr-por -y
  1. Navegue até o diretório /src:
cd pypdfsawtext/src
  1. No Windows - Rode o comando abaixo para buildar:
python setup_win.py build_exe

Requisitos para rodar o executável

Para Windows

Windows 10+ 64 bits
Visual C++ RedistributableMicrosoft Visual C++ Redistributable 2015–2022 (x64)

About

PyPDF Saw Text é uma ferramenta gráfica e leve escrita em Python que transforma PDFs escaneados em documentos com texto reconhecível e pesquisável.

Topics

Resources

Stars

Watchers

Forks

Releases

Used by

Contributors

Languages