Cada equipe de IA empresarial acaba enfrentando o mesmo gargalo: obter dados úteis de PDFs. Os documentos são desorganizados, as tabelas são estranhas, os layouts são inconsistentes e as ferramentas que realmente funcionam tendem a cobrar como se soubessem que você está desesperado. A Cohere acredita ter uma oferta melhor.
A empresa lançou o Parse 5 na quinta-feira, um modelo de linguagem visual com 2,3 bilhões de parâmetros projetado para transformar PDFs, apresentações e imagens em Markdown estruturado. O diferencial não é que seja o parser mais preciso do mercado, mas que é suficientemente preciso e suficientemente barato para ser executado em escala.
O que o Parse 5 realmente faz
O Parse 5 (ID do modelo: parse-v5.0) pesa aproximadamente 4,6 GB com uma janela de contexto de 8K. Foi desenvolvido para lidar com os tipos de documentos que causam falhas em pipelines de IA: tabelas complexas, listas aninhadas, formulários, imagens com legendas, layouts em múltiplas colunas e limites de página.
As tabelas são exportadas como HTML. Elementos visuais vêm com caixas delimitadoras. A ordem de leitura é preservada, o que é mais importante do que parece, pois colocar parágrafos na sequência errada pode estragar silenciosamente um sistema de recuperação subsequente.
O modelo suporta nove principais línguas comerciais, o que atende à necessidade de implantações multinacionais em finanças, seguros, direito e áreas científicas. A Cohere também oferece opções de implantação seguras, reconhecendo que empresas desses setores não estão entusiasmadas em enviar documentos sensíveis por meio de APIs de terceiros sem proteções.
Os números que importam
Os preços da API começam em US$ 1,50 por 1.000 páginas. Para organizações que processam documentos em grande volume, o Model Vault da Cohere oferece descontos escalonados de 23% a 61%, dependendo do uso.
Para colocar isso em termos concretos: a Cohere estima que um fluxo de trabalho de 13 milhões de páginas por mês poderia economizar aproximadamente US$ 144 mil ao usar o Model Vault em vez de chamadas diretas à API.
O desempenho atinge 4,5 páginas por segundo em hardware representativo. Essa velocidade coloca-o à frente de algumas alternativas de código aberto.
No benchmark ParseBench da Cohere, o Parse 5 obtém uma média de 79,2. Sua análise de tabelas atinge 87,0 e a fidelidade, ou seja, a precisão com que a saída reflete o documento de origem, alcança 86,6.
Para contexto, o Mistral OCR 4 obtém 74,5 no mesmo benchmark. O LlamaParse Custos Efetivos atinge 78,3. O Parse 5 supera ambos, embora a Cohere reconheça que modelos maiores e mais caros ainda superam-no em precisão bruta.
Onde isso se encaixa na pilha de IA empresarial
Integre cinco plug-ins no ecossistema existente da Cohere e se conecta com o Microsoft Foundry e o AWS SageMaker. Essa interoperabilidade é importante porque a maioria das empresas não está construindo suas pilhas de IA do zero. Elas estão adicionando novas ferramentas à infraestrutura de nuvem existente.
O modelo também é adequado para pipelines de recuperação agente, a arquitetura cada vez mais popular na qual agentes de IA buscam autonomamente em repositórios de documentos para concluir tarefas. Esses fluxos de trabalho tendem a processar grandes volumes de documentos, tornando o custo por página uma variável crítica que pode determinar se um projeto é economicamente viável ou condenado desde o início.
