Como funciona
O reconhecimento de texto (OCR — Optical Character Recognition) roda inteiramente no seu navegador usando Tesseract.js, uma versão em WebAssembly do motor de OCR de código aberto Tesseract (o mesmo usado pelo Google em outros produtos). Nenhuma imagem é enviada a servidor — o processamento acontece localmente, o que também significa que funciona com fotos, prints de tela e digitalizações sensíveis sem preocupação de privacidade.
Dicas para melhores resultados
Imagens nítidas, bem iluminadas e com o texto alinhado horizontalmente tendem a dar resultados muito mais precisos. Selecione o idioma correto do texto antes de extrair — isso melhora bastante a precisão do reconhecimento.
Por que a primeira extração demora mais
Na primeira vez, o navegador baixa e inicializa o mecanismo de OCR (alguns megabytes) e os dados do idioma escolhido; extrações seguintes na mesma sessão tendem a ser mais rápidas.
Perguntas frequentes
Minha imagem é enviada para algum servidor?
Não — todo o processamento de OCR acontece localmente no seu navegador, usando WebAssembly. A imagem nunca sai do seu computador.
Quais idiomas são suportados?
Português, inglês e espanhol. Selecione o idioma correto do texto na imagem antes de extrair para obter melhor precisão.
Por que demorou tanto para processar?
O reconhecimento de texto via OCR é uma tarefa pesada computacionalmente, ainda mais rodando no navegador. Imagens grandes ou com muito texto podem levar alguns segundos a mais de um minuto.
Funciona com texto manuscrito?
O Tesseract é otimizado para texto impresso/digitado. Texto manuscrito pode ter uma taxa de acerto bem menor.