← Voltar para todas as ferramentas
OCR • processamento no navegador

OCR de Imagens e PDF

Extraia texto de fotos, prints e PDFs escaneados. A ferramenta renderiza documentos digitalizados e aplica reconhecimento óptico de caracteres diretamente no seu navegador.

🔒 Arquivos não são enviados ao nosso servidor 🇧🇷 Português 🇺🇸 Inglês 📄 PDF escaneado

Ferramenta

Reconhecer texto

Processamento local
Arraste uma imagem ou PDF aqui ou clique para selecionar JPEG, PNG, WebP, BMP, AVIF ou PDF • imagens até 20 MB • PDFs até 40 MB
Primeiro uso: o navegador precisa baixar o motor OCR e os dados do idioma. Isso pode levar alguns segundos; depois, o cache do navegador costuma acelerar usos seguintes.

Como o OCR funciona nesta ferramenta

OCR significa Reconhecimento Óptico de Caracteres. Para imagens, o navegador prepara a imagem e envia os pixels ao Tesseract.js, que executa o mecanismo Tesseract compilado para WebAssembly. Para PDFs escaneados, cada página é primeiro renderizada em uma imagem pelo PDF.js e só então passa pelo OCR.

1Arquivo local

Você escolhe uma imagem ou PDF no dispositivo.

2Renderização

PDFs são transformados em páginas rasterizadas no navegador.

3Reconhecimento

O Tesseract.js identifica caracteres usando o modelo de idioma escolhido.

4Texto editável

O resultado pode ser revisado, copiado ou salvo em TXT.

Quando usar

  • PDFs digitalizados sem camada de texto.
  • Fotos de documentos e páginas impressas.
  • Prints de tela que contêm texto.
  • Documentos em português ou inglês.

Quando usar outra ferramenta

Se o PDF já possui texto selecionável, a ferramenta PDF para Texto costuma ser mais rápida e fiel porque extrai diretamente a camada textual, sem reconhecimento visual.

Limitações importantes

Perguntas frequentes

OCR funciona em PDF escaneado?

Sim. O PDF.js renderiza cada página como imagem e o Tesseract.js aplica OCR nessa imagem. Essa abordagem é diferente da extração de uma camada de texto já existente.

Meus arquivos são enviados para o servidor?

Não para o servidor do Ferramentas Flash. O processamento do conteúdo ocorre no navegador. O navegador baixa as bibliotecas e os modelos de idioma necessários para executar o OCR.

Funciona com texto manuscrito?

Pode reconhecer alguns manuscritos muito regulares, mas o Tesseract é mais indicado para texto impresso ou digitalizado. Não recomendamos depender dele para caligrafia.

Por que o primeiro OCR demora mais?

Porque o navegador precisa carregar o motor em WebAssembly e os dados do idioma. Esses recursos podem ser armazenados em cache pelo navegador para usos posteriores.

Fontes e referências