Como extrair texto de uma imagem ou PDF
O reconhecimento dispara sozinho quando o arquivo entra: escolher a ferramenta com a foto na mão já é o pedido. Entram imagem e PDF, e o texto lido aparece numa caixa editável, com contagem de caracteres, contagem de palavras e a precisão que o próprio reconhecedor reporta.
- Solte a foto do documento, o print ou o PDF digitalizado.
- Na primeira execução, os dados de idioma são baixados (cerca de 4 MB) e ficam guardados para as próximas.
- Escolha o idioma: português, ou português mais inglês para documento misturado.
- Corrija o que ficou errado direto na caixa de texto — ela é editável de propósito.
- Copie o texto ou baixe como .txt.
O que decide a qualidade do resultado
Resolução, antes de qualquer outra coisa. O reconhecedor precisa de uns 150 pontos por polegada para trabalhar; abaixo disso ele não erra só letras, ele erra a GEOMETRIA — junta linhas, parte palavras e devolve blocos fora de lugar. Uma foto de celular bem enquadrada costuma passar folgado; um print de tela pequena, não.
Depois vêm contraste e enquadramento. Papel branco com texto preto, sem sombra da própria mão em cima, alinhado o mais reto possível. Documento fotografado torto é o caso em que quase todo reconhecedor perde linhas inteiras.
Por fim, o tipo de letra. Impresso é confiável; manuscrito não é, aqui nem nos serviços pagos que anunciam o contrário. Fonte com serifa muito fina e texto sobre imagem de fundo também derrubam a precisão, e é exatamente para isso que o número de precisão aparece na tela: ele diz quando desconfiar.
Quando usar o editor de PDF em vez desta ferramenta
Aqui a saída é texto corrido, para copiar e colar em outro lugar. Se o objetivo é continuar com o DOCUMENTO — corrigir uma palavra e devolver o PDF, ou tornar um digitalizado pesquisável mantendo a aparência da página —, o caminho é o editor de PDF, que faz o reconhecimento por página e redesenha o texto por cima do original.
E se o PDF já for digital (gerado por computador, não escaneado), nenhum reconhecimento é necessário: o texto já está lá como texto, e o PDF para Word extrai tudo sem passar por imagem.
Por que fazer isso no navegador
Reconhecimento de texto é a operação que mais atrai upload de documento sensível: contrato, holerite, laudo, carteira de identidade. Todo serviço online recebe esse arquivo num servidor — e ele é justamente o tipo de arquivo que não deveria sair da sua máquina.
Aqui o reconhecedor inteiro é baixado e roda dentro da aba, em WebAssembly. O medidor no alto da página conta bytes de arquivo saindo e permanece em zero durante a leitura, e depois da primeira visita tudo funciona sem internet.