OCR de Imagens e PDF
Extraia texto de fotos, prints e PDFs escaneados. A ferramenta renderiza documentos digitalizados e aplica reconhecimento óptico de caracteres diretamente no seu navegador.
Ferramenta
Reconhecer texto
Como o OCR funciona nesta ferramenta
OCR significa Reconhecimento Óptico de Caracteres. Para imagens, o navegador prepara a imagem e envia os pixels ao Tesseract.js, que executa o mecanismo Tesseract compilado para WebAssembly. Para PDFs escaneados, cada página é primeiro renderizada em uma imagem pelo PDF.js e só então passa pelo OCR.
Você escolhe uma imagem ou PDF no dispositivo.
PDFs são transformados em páginas rasterizadas no navegador.
O Tesseract.js identifica caracteres usando o modelo de idioma escolhido.
O resultado pode ser revisado, copiado ou salvo em TXT.
Quando usar
- PDFs digitalizados sem camada de texto.
- Fotos de documentos e páginas impressas.
- Prints de tela que contêm texto.
- Documentos em português ou inglês.
Quando usar outra ferramenta
Se o PDF já possui texto selecionável, a ferramenta PDF para Texto costuma ser mais rápida e fiel porque extrai diretamente a camada textual, sem reconhecimento visual.
Limitações importantes
- OCR não garante transcrição perfeita. Qualidade baixa, inclinação, sombras, manuscritos e fontes incomuns reduzem a precisão.
- Tabelas, colunas complexas e diagramações podem perder estrutura no texto final.
- A ferramenta limita PDFs a 25 páginas por execução para reduzir uso excessivo de memória no navegador.
- Modelos e bibliotecas do OCR são baixados de serviços de distribuição de código; seus arquivos permanecem no navegador e não são enviados ao servidor do Ferramentas Flash.
- Revise o texto antes de usá-lo em documentos jurídicos, médicos, financeiros ou outros contextos sensíveis.
Perguntas frequentes
OCR funciona em PDF escaneado?
Sim. O PDF.js renderiza cada página como imagem e o Tesseract.js aplica OCR nessa imagem. Essa abordagem é diferente da extração de uma camada de texto já existente.
Meus arquivos são enviados para o servidor?
Não para o servidor do Ferramentas Flash. O processamento do conteúdo ocorre no navegador. O navegador baixa as bibliotecas e os modelos de idioma necessários para executar o OCR.
Funciona com texto manuscrito?
Pode reconhecer alguns manuscritos muito regulares, mas o Tesseract é mais indicado para texto impresso ou digitalizado. Não recomendamos depender dele para caligrafia.
Por que o primeiro OCR demora mais?
Porque o navegador precisa carregar o motor em WebAssembly e os dados do idioma. Esses recursos podem ser armazenados em cache pelo navegador para usos posteriores.
Fontes e referências
- Tesseract.js — documentação oficial — biblioteca JavaScript que executa o mecanismo OCR Tesseract no navegador por WebAssembly.
- Tesseract OCR — User Manual — documentação do mecanismo de reconhecimento de caracteres e orientações de uso.
- Mozilla PDF.js — plataforma utilizada para interpretar e renderizar páginas de arquivos PDF.
- W3C — File API — especificação da API usada pelo navegador para acessar arquivos selecionados pelo usuário.