Voltar para todos os artigos
Artigo

Melhores modelos de OCR em 2026: PDFs, tabelas e custo de API

Autor:

Compare Mistral OCR, Google Document AI e PaddleOCR em documentos digitalizados. Separe reconhecimento de texto, recuperação de layout e custo útil.

Uma lupa apoiada em uma folha digitalizada com uma tabela simples

Uma fatura extraída pode conter todos os algarismos e ainda associar um preço ao item errado. O reconhecimento óptico de caracteres, ou OCR, lê texto em uma imagem. Recuperar a ordem e as relações da página é um requisito adicional — e muitas vezes é o que determina se o resultado pode ser usado.

Começaríamos pelo Mistral OCR 4.1 em um teste hospedado de análise de documentos, pelo Google Enterprise Document OCR como referência de reconhecimento de texto e pelo PaddleOCR quando manter o processamento local for um requisito real. Acrescente o Google Layout Parser quando a estrutura do documento importar. O Mistral OCR 3 continua sendo uma comparação mais barata para fluxos existentes. Esta é uma seleção por requisitos de saída, não uma classificação independente de precisão.

As fontes e os preços foram conferidos em 7 de setembro de 2026. Comparamos modelos de OCR e os serviços que os fornecem, identificando quando uma opção nomeada é um processador ou conjunto de ferramentas, e não um modelo para download. Aplicativos de conversa com PDFs e extração de textos já legíveis ficam fora desta comparação.

Escolha a saída antes do modelo

CandidatoO que avaliarDecisão principal
Mistral OCR 4.1Análise de documentos com informações de blocosO resultado preserva as relações de que você precisa?
Mistral OCR 3Endpoint de OCR mais barato ainda disponívelVale mudar uma integração existente pela saída mais recente?
Google Enterprise Document OCRProcessador gerenciado de reconhecimento de textoO texto reconhecido é suficiente?
Google Layout Parser, na mesma página de preçosExtração de estrutura e divisão inicialTítulos e relações de tabela são preservados?
PaddleOCRConjunto de ferramentas de OCR e análise que pode ser implantado localmenteVocê consegue operar e avaliar exatamente o pipeline escolhido?

O guia do processador de OCR da Mistral documenta a extração de blocos para OCR 4 e versões posteriores. Mantenha o ID exato do modelo em seus registros: um alias latest variável é conveniente para descoberta, mas dificulta a reprodução de um teste antigo.

PaddleOCR não é um único modelo intercambiável com uma única pontuação. O repositório oferece componentes de reconhecimento e análise de documentos, incluindo PaddleOCR-VL. Fixe a versão e a configuração implantadas. Um software disponível para download elimina a fatura hospedada por página, não os custos de computação, instalação, atualização ou revisão.

Se um PDF já tiver uma camada de texto correta, examine-a antes de pagar para reconhecer a página novamente. Em um documento digitalizado, faça uma amostra da qualidade real da digitalização. Uma exportação digital limpa e uma fotografia inclinada feita por celular não devem compartilhar uma afirmação de precisão sem diferenciação.

Quanto custariam 10.000 páginas

Estes são exemplos de uso em dólares americanos para 10.000 páginas processadas, antes de impostos, armazenamento, novas tentativas, recursos opcionais ou descontos negociados. A linha de OCR do Google mostra a tarifa paga antes de aplicar qualquer franquia, para que o preço unitário permaneça visível.

Serviço e opção de processamentoPreço listado / 1.000 páginasComponente de uso no exemplo
Google Enterprise Document OCR, faixa paga padrão$1.50$15 antes da franquia
Mistral OCR 3, somente OCR$2$20
Mistral OCR 4.1, somente OCR$4$40
Mistral OCR 4.1, páginas anotadas$5$50
Google Layout Parser$10$100
PaddleOCR, hospedagem própriaCusto da sua infraestruturaMeça o pipeline implantado

O preço padrão atual de OCR do Google inclui as primeiras 1.000 páginas sem cobrança; se toda a franquia estiver disponível, 10.000 páginas custam $13.50 nesse processador. Layout Parser e complementos de OCR são escolhas de cobrança separadas. A tarifa de $1.50 não compra todos os recursos do Document AI.

Da mesma forma, a tarifa somente de OCR da Mistral não é o preço de páginas anotadas. Decida qual saída você consumirá antes de comparar custos. Uma diferença de um dólar entre serviços que processam saídas distintas não é um resultado de eficiência.

Uma tabela exige mais do que caracteres corretos

Use este pequeno pedido de compra inventado para definir a verificação de aceitação:

ItemQuantidadePreço unitárioTotal da linha
Pasta azul12$2.50$30.00
Pasta branca8$3.00$24.00

Imprima ou renderize seu próprio documento de teste e inclua na avaliação uma digitalização e uma foto inclinada. O subtotal esperado é $54.00. Um sistema que devolve todos os seis números, mas troca os preços unitários, não recuperou a tabela corretamente.

Confira pelo menos três aspectos separadamente: o texto; a linha e a coluna a que cada valor pertence; e a ordem de leitura ao redor de títulos, observações e totais. Se o original tiver uma célula vazia, um valor inventado é erro. Se uma nota de rodapé mudar a inclusão do frete, perdê-la pode importar mais do que uma diferença estética de espaçamento.

Não peça a um segundo modelo que corrija silenciosamente o resultado do OCR antes de avaliá-lo. Isso avaliaria um fluxo de OCR seguido de correção. Esse fluxo pode ser útil, mas o uso adicional e as oportunidades de inventar dados precisam continuar visíveis.

Em um lote representativo, inclua tanto documentos comuns quanto os casos difíceis do seu fluxo: digitalizações apagadas, células mescladas, várias colunas, texto girado ou anotações manuscritas. Registre os resultados por tipo de documento. Uma média alta dominada por páginas fáceis pode esconder uma categoria que ainda exige processamento manual.

Use benchmarks para encontrar candidatos e depois examine suas páginas

O OmniDocBench oferece dados e avaliação de análise de documentos em elementos como texto, tabelas, fórmulas e ordem de leitura. Seu valor aqui é separar as tarefas. Confira o lançamento do benchmark, o checkpoint testado e a configuração de avaliação antes de citar uma pontuação.

Não executamos novamente esse benchmark nem testamos todos os endpoints atuais com o exemplo do pedido de compra. O resultado de um modelo em um conjunto público é um motivo para investigá-lo, não uma garantia de que lidará com o layout do seu fornecedor. Resultados informados pelo próprio fornecedor devem continuar identificados como tal.

Na operação, compare o custo de um lote que passe nas suas verificações. Suponha que um serviço hipotético custe $40 para processar 10.000 páginas. Se 200 páginas exigirem dois minutos de correção cada, a um custo presumido de $30 por hora, a revisão acrescenta $200, elevando o custo combinado para $240. Essas suposições sobre erros e trabalho não são medições de nenhum serviço listado.

O exemplo mostra por que uma pequena economia na tarifa por página pode ser menos importante do que um erro recorrente de tabela. Registre o tempo de correção junto às páginas processadas e mantenha as páginas com falha no cálculo do custo.

Depois que texto e layout forem confiáveis, um modelo separado de extração de informações pode mapear o resultado para campos como fornecedor, valor e data de entrega. Mantenha a página original disponível para verificação. Um registro estruturado só é útil se alguém puder rastrear um valor duvidoso até o que o documento realmente diz.

Referências