Imagem para texto

Extrair texto de uma imagem

Leia as palavras de uma foto, de um print ou de um escaneamento — e receba um texto que você pode selecionar, corrigir e colar.

Extrair texto de uma imagem online

A foto de uma página, o print de uma mensagem, o escaneamento de um recibo: as palavras estão ali, mas você não consegue selecioná-las, porque o arquivo é uma imagem. O reconhecimento óptico de caracteres (OCR) analisa as formas e descobre quais letras elas são, devolvendo um texto editável. Esta ferramenta faz esse reconhecimento com o Tesseract compilado em WebAssembly, inteiramente dentro do seu navegador — a imagem é aberta localmente e nunca é enviada, o que faz diferença com um holerite, um documento de identidade ou um resultado de exame. Há duas configurações de idioma: inglês com francês como secundário, e francês com inglês como secundário; o modelo correspondente, de cinco a quinze megabytes, é baixado no primeiro uso e depois reaproveitado. A precisão depende da imagem: um texto nítido, bem iluminado, fotografado de frente e em resolução razoável é bem lido, enquanto uma foto borrada, tirada de lado e com pouca luz vai gerar erros que você precisará corrigir. Quando pouco ou nada é encontrado, a ferramenta avisa em vez de devolver silêncio.

Como funciona

  1. Escolha a imagem

    Uma foto, um print ou um escaneamento. Ela fica no seu dispositivo — o reconhecimento roda no navegador, não nos nossos servidores.

  2. Escolha o idioma

    Inglês ou francês como principal, o outro como secundário. A primeira execução baixa o modelo, de cinco a quinze megabytes, e as seguintes o reaproveitam.

  3. Leia e corrija o texto

    O texto reconhecido aparece pronto para selecionar e copiar. Confira os trechos em que o OCR tem mais dificuldade: nomes incomuns, números e tudo o que estiver impresso em letra pequena.

Por que usar

A imagem nunca sai do seu dispositivo

O reconhecimento roda no navegador com WebAssembly, então um holerite, um documento de identidade ou um resultado de exame não é enviado a lugar nenhum — nem para nós.

Nada para redigitar

Um código de referência, um endereço ou um parágrafo fotografado de uma tela vira texto para colar, em vez de algo que você copia à mão e erra.

Avisa quando não encontrou nada

Uma imagem sem texto legível gera um aviso claro sugerindo outro idioma ou uma foto mais nítida, em vez de uma caixa vazia que você precisa interpretar.

Perguntas frequentes

A minha imagem é enviada?
Não. O reconhecimento roda inteiramente no seu navegador, com o Tesseract compilado em WebAssembly. A imagem é lida localmente e nunca vai para os nossos servidores, por isso a ferramenta serve para um documento que você prefere não enviar a lugar nenhum.
Quais idiomas são suportados?
Duas configurações: inglês com francês como secundário, e francês com inglês como secundário. Escolha a que corresponde ao idioma predominante da imagem — escolher a errada piora bastante o resultado, principalmente em texto acentuado.
Por que a primeira execução é mais lenta?
Porque o modelo de idioma — de cinco a quinze megabytes — é baixado para o seu navegador no primeiro uso. Ele fica guardado depois, então as extrações seguintes começam na hora.
Qual é a precisão?
Depende da imagem, e a diferença é grande. Texto impresso nítido, bem iluminado, fotografado de frente e em resolução razoável é bem lido. Uma foto borrada, um ângulo inclinado, pouca luz, um fundo carregado ou letra à mão vão gerar erros. Sempre releia os números e os nomes próprios — é onde o OCR mais falha e onde um erro custa mais caro.
Posso usar em um PDF?
Esta ferramenta aceita imagens. Para um PDF escaneado, use a ferramenta de OCR, que trata o documento página por página e adiciona uma camada de texto.
Preciso de uma conta?
Sim. O reconhecimento em si é local, mas a ferramenta fica dentro da área logada. Criar uma conta é grátis.