Pular para o conteúdo

Extrair texto de imagem ou PDF (OCR)

Reconheça e copie o texto de fotos, recibos ou documentos digitalizados 100% offline.

Solte uma imagem aqui

ou Escolher arquivo

PNG, JPEG, WebP, GIF ou AVIF · até 50 MB

Como extrair texto de uma imagem ou PDF

O reconhecimento dispara sozinho quando o arquivo entra: escolher a ferramenta com a foto na mão já é o pedido. Entram imagem e PDF, e o texto lido aparece numa caixa editável, com contagem de caracteres, contagem de palavras e a precisão que o próprio reconhecedor reporta.

  1. Solte a foto do documento, o print ou o PDF digitalizado.
  2. Na primeira execução, os dados de idioma são baixados (cerca de 4 MB) e ficam guardados para as próximas.
  3. Escolha o idioma: português, ou português mais inglês para documento misturado.
  4. Corrija o que ficou errado direto na caixa de texto — ela é editável de propósito.
  5. Copie o texto ou baixe como .txt.

O que decide a qualidade do resultado

Resolução, antes de qualquer outra coisa. O reconhecedor precisa de uns 150 pontos por polegada para trabalhar; abaixo disso ele não erra só letras, ele erra a GEOMETRIA — junta linhas, parte palavras e devolve blocos fora de lugar. Uma foto de celular bem enquadrada costuma passar folgado; um print de tela pequena, não.

Depois vêm contraste e enquadramento. Papel branco com texto preto, sem sombra da própria mão em cima, alinhado o mais reto possível. Documento fotografado torto é o caso em que quase todo reconhecedor perde linhas inteiras.

Por fim, o tipo de letra. Impresso é confiável; manuscrito não é, aqui nem nos serviços pagos que anunciam o contrário. Fonte com serifa muito fina e texto sobre imagem de fundo também derrubam a precisão, e é exatamente para isso que o número de precisão aparece na tela: ele diz quando desconfiar.

Quando usar o editor de PDF em vez desta ferramenta

Aqui a saída é texto corrido, para copiar e colar em outro lugar. Se o objetivo é continuar com o DOCUMENTO — corrigir uma palavra e devolver o PDF, ou tornar um digitalizado pesquisável mantendo a aparência da página —, o caminho é o editor de PDF, que faz o reconhecimento por página e redesenha o texto por cima do original.

E se o PDF já for digital (gerado por computador, não escaneado), nenhum reconhecimento é necessário: o texto já está lá como texto, e o PDF para Word extrai tudo sem passar por imagem.

Por que fazer isso no navegador

Reconhecimento de texto é a operação que mais atrai upload de documento sensível: contrato, holerite, laudo, carteira de identidade. Todo serviço online recebe esse arquivo num servidor — e ele é justamente o tipo de arquivo que não deveria sair da sua máquina.

Aqui o reconhecedor inteiro é baixado e roda dentro da aba, em WebAssembly. O medidor no alto da página conta bytes de arquivo saindo e permanece em zero durante a leitura, e depois da primeira visita tudo funciona sem internet.

FAQ & Segurança

Perguntas sobre Extrair texto de imagem ou PDF (OCR)

Como extrair texto de fotos, capturas de tela e documentos escaneados?

Arraste a imagem ou print para a ferramenta: o motor de OCR Tesseract baseado em WebAssembly é carregado na aba, analisa a distribuição geométrica das linhas e caracteres e extrai todo o texto em formato editável, permitindo copiar com um clique ou baixar como arquivo .txt.

O leitor de OCR reconhece caracteres com acentuação e pontuação em português?

Sim. Os dicionários treinados para português (com suporte completo a cedilha, acento agudo, circunflexo, til e crase) e inglês são carregados simultaneamente, garantindo alta precisão no reconhecimento de documentos brasileiros, notas fiscais e contratos bilíngues.

Por que algumas palavras podem ser reconhecidas com erros ou trocar letras?

A precisão do OCR depende diretamente da resolução e do contraste da imagem. Fotos borradas, com baixa iluminação, sombras sobre o papel, ângulos tortos ou resolução abaixo de 150 DPI dificultam a segmentação de caracteres. Garantir um bom enquadramento e iluminação melhora drasticamente a extração.

A ferramenta é capaz de reconhecer e transcrever escrita manual à mão?

O motor é otimizado para caracteres tipográficos e textos impressos. Textos escritos à mão (cursivos ou caligrafia livre) e fontes excessivamente decorativas possuem variações que podem reduzir a taxa de acerto do OCR automático.

Ferramentas relacionadas

Tudo aqui embaixo roda nesta mesma aba, sem upload e sem cadastro.