Como Uma Máquina Aprendeu a Ler a Sua Letra: A Invenção do OCR, de 1914 à Inteligência Artificial

De uma máquina que lia letras e mandava por telégrafo em 1914 aos algoritmos que leem redações escritas à mão: conheça a história do OCR, a invenção que ensinou o computador a ler, e por que a letra cursiva ainda é o maior desafio.
Como Uma Máquina Aprendeu a Ler a Sua Letra: A Invenção do OCR, de 1914 à Inteligência Artificial
Para você, ler esta frase não exige esforço nenhum. Para um computador, foi um dos problemas mais difíceis do século XX. Uma imagem de texto, para a máquina, é só uma grade de pontos claros e escuros. Transformar esses pontos em letras, e as letras em palavras, levou mais de cem anos de invenções, e ainda não está completamente resolvido quando a letra é cursiva.
Essa tecnologia tem nome: OCR, sigla em inglês para reconhecimento óptico de caracteres. Ela está no aplicativo do banco que lê o código de barras de um boleto, no tradutor que traduz uma placa pela câmera e no corretor que lê uma redação escrita à mão a partir de uma foto. Esta é a história de como ela nasceu.
1914: uma máquina que lia e mandava por telégrafo
A primeira máquina de leitura de que se tem registro foi construída em 1914 pelo físico Emanuel Goldberg. Ela lia caracteres impressos e os convertia em código de telégrafo, para que o texto pudesse ser transmitido sem que ninguém precisasse digitá-lo.
Na mesma época, o inglês Edmund Fournier d'Albe criou o optofone, um aparelho portátil que, passado sobre uma página impressa, produzia sons diferentes para cada letra. A ideia era permitir que pessoas cegas "ouvissem" um livro comum, sem precisar de uma versão em braille.
As duas invenções resolviam o mesmo problema por caminhos opostos: uma traduzia letras para uma máquina, a outra traduzia letras para um ouvido humano. Mas ambas só funcionavam com texto impresso, limpo e em fontes conhecidas.
1976: a máquina de leitura para cegos
O salto seguinte veio com o computador. Em 13 de janeiro de 1976, o inventor americano Ray Kurzweil apresentou, ao lado da Federação Nacional dos Cegos dos Estados Unidos, uma máquina capaz de ler em voz alta livros impressos em qualquer fonte.
Isso era novidade. Os sistemas anteriores precisavam ser treinados para uma fonte específica, letra por letra. A máquina de Kurzweil reconhecia formas: em vez de comparar a letra com um molde exato, ela identificava traços, curvas e proporções que fazem um "a" ser um "a", qualquer que seja a fonte.
Essa mudança de pensamento, de comparar moldes para reconhecer padrões, é a ideia que leva diretamente à inteligência artificial de hoje.
1989 a 1998: redes neurais aprendem a ler números escritos à mão
Texto impresso é regular. Letra de mão não é: cada pessoa escreve de um jeito, e a mesma pessoa escreve diferente quando está com pressa. Nenhuma regra escrita por um programador dá conta dessa variedade.
A solução veio dos laboratórios Bell, nos Estados Unidos, onde uma equipe liderada por Yann LeCun desenvolveu, entre 1988 e 1998, uma família de redes neurais chamada LeNet. Em vez de receber regras, a rede recebia milhares de exemplos de números escritos à mão e aprendia sozinha quais formas correspondiam a cada dígito.
O resultado foi tão bom que saiu do laboratório: no fim dos anos 1990, redes desse tipo passaram a ler os números escritos à mão nos CEPs das cartas do correio americano e os valores dos cheques depositados em caixas eletrônicos.
Para treinar e comparar esses sistemas, os pesquisadores montaram o MNIST, um banco com 60 mil imagens de treino e 10 mil de teste de dígitos escritos à mão, cada um numa imagem de 28 por 28 pixels. Metade dos números foi escrita por funcionários do Censo americano e metade por estudantes do ensino médio. Até hoje, o MNIST é o primeiro exercício de quase todo curso de inteligência artificial do mundo.
Por que a letra cursiva ainda é difícil
Reconhecer um dígito isolado é uma coisa. Ler uma frase em letra cursiva é outra, muito mais difícil, por três motivos:
- As letras se emendam. Na cursiva, não há espaço entre uma letra e outra, então a máquina precisa decidir onde termina o "m" e começa o "n" sem nenhuma pista visual clara.
- A mesma forma vale letras diferentes. Um "u" mal fechado vira "a", um "e" sem laço vira "c". Só o contexto da palavra resolve.
- Cada pessoa tem a sua letra. O sistema precisa ter visto letras parecidas com a sua para acertar.
Por isso, os sistemas modernos não leem letra por letra. Eles leem a palavra e a frase, usando o sentido do texto para resolver a dúvida, exatamente como você faz quando lê a letra de um colega: se a palavra no meio de uma frase sobre saúde pública parece "vacima", você lê "vacina" sem perceber.
Da carta ao celular: como a IA lê uma redação
Os modelos de inteligência artificial de hoje juntam as duas coisas: enxergam a imagem e entendem a linguagem. É isso que permite ler uma redação inteira escrita à mão a partir de uma foto de celular.
É o que faz a correção de redação por foto da Neves Scholar: a imagem da folha é transcrita, a plataforma avalia se a caligrafia tem legibilidade alta, média ou baixa e, a partir do texto transcrito, corrige a redação pelas cinco competências do ENEM.
A avaliação da legibilidade tem uma utilidade que vai além da tecnologia. Na redação do ENEM, texto com letra ilegível recebe nota zero quando dois avaliadores não conseguem lê-lo. Se a leitura automática da sua letra sai com legibilidade baixa, é um aviso de que um corretor humano também pode tropeçar. Dá para ajustar a letra antes da prova, e o guia de como treinar redação à mão para o ENEM 2026 mostra como.
O que essa história ensina
A história do OCR é a história de uma mudança de pergunta. Durante décadas, a pergunta foi "quais regras definem uma letra?", e ninguém conseguiu escrever regras suficientes. A resposta veio quando a pergunta mudou para "como aprender com exemplos?".
É a mesma diferença entre decorar fórmulas e entender um assunto. Quem decora regras trava quando aparece um caso que não estava na lista. Quem aprendeu com muitos exemplos reconhece o padrão mesmo quando ele aparece de um jeito novo, e é exatamente isso que o ENEM cobra.
Fontes
- Wikipedia, "Optical character recognition" (consultada em 02/10/2026): Goldberg (1914), o optofone de Fournier d'Albe e a máquina de leitura de Kurzweil (1976).
- Wikipedia, "LeNet" e "MNIST database" (consultadas em 02/10/2026): a família LeNet nos laboratórios Bell (1988 a 1998), o uso em CEPs e cheques e a composição do MNIST.
- Agência Brasil, "Cartilha reúne orientações para a redação do Enem 2026" (setembro de 2026): letra ilegível como motivo de nota zero.