Chaque équipe d’IA entreprise finit par rencontrer le même goulot d’étranglement : extraire des données utiles à partir de PDF. Les documents sont désorganisés, les tableaux sont bizarres, les mise en page sont incohérentes, et les outils qui fonctionnent vraiment ont tendance à facturer comme s’ils savaient que vous êtes désespéré. Cohere pense avoir une meilleure proposition.
L'entreprise a lancé Parse 5 jeudi, un modèle de langage visuel de 2,3 milliards de paramètres conçu pour transformer des PDF, des diapositives et des images en Markdown structuré. L'argument n'est pas qu'il s'agit du parseur le plus précis du marché, mais qu'il est suffisamment précis tout en étant suffisamment peu coûteux pour être déployé à grande échelle.
Ce que fait réellement Parse 5
Parse 5 (ID du modèle : parse-v5.0) pèse environ 4,6 Go avec une fenêtre de contexte de 8K. Il est conçu pour gérer les types de documents qui bloquent les pipelines d'IA : tableaux complexes, listes imbriquées, formulaires, images avec légendes, mise en page en plusieurs colonnes et limites de page.
Les tableaux sont exportés au format HTML. Les éléments visuels sont accompagnés de boîtes de délimitation. L'ordre de lecture est préservé, ce qui est plus important qu'il n'y paraît, car placer les paragraphes dans le mauvais ordre peut compromettre discrètement un système de récupération en aval.
Le modèle prend en charge neuf langues commerciales majeures, ce qui répond aux besoins des déploiements multinationaux dans les domaines de la finance, de l'assurance, du droit et de la science. Cohere propose également des options de déploiement sécurisées, en reconnaissance du fait que les entreprises de ces secteurs ne sont pas enthousiastes à l'idée d'envoyer des documents sensibles via des API tierces sans protections.
Les chiffres qui comptent
Les tarifs de l'API commencent à 1,50 $ pour 1 000 pages. Pour les organisations traitant un volume important de documents, Model Vault de Cohere propose des réductions échelonnées allant de 23 % à 61 % selon l'utilisation.
Pour le traduire en termes concrets : Cohere estime qu’un flux de travail de 13 millions de pages par mois pourrait permettre d’économiser environ 144 000 $ en utilisant le Model Vault au lieu d’appels API directs.
Le débit s'élève à 4,5 pages par seconde sur un matériel représentatif. Cette vitesse le place au-dessus de certaines alternatives open source.
Sur le benchmark ParseBench de Cohere, Parse 5 obtient une moyenne de 79,2. Sa capacité à extraire les tableaux atteint 87,0, et sa fidélité, c’est-à-dire la précision avec laquelle la sortie reflète le document source, s’élève à 86,6.
Pour contexte, Mistral OCR 4 obtient 74,5 sur le même benchmark. LlamaParse Cost Effective arrive à 78,3. Parse 5 dépasse les deux, bien que Cohere souligne que les modèles plus grands et plus coûteux restent supérieurs en précision brute.
Où cela s'inscrit dans la pile IA entreprisale
Intégrez 5 plugins dans l'écosystème existant de Cohere et connectez-vous à Microsoft Foundry et AWS SageMaker. Cette interopérabilité est cruciale, car la plupart des entreprises ne construisent pas leurs piles IA à partir de zéro. Elles ajoutent de nouveaux outils à leur infrastructure cloud existante.
Le modèle est également optimisé pour les pipelines de récupération agente, l'architecture de plus en plus populaire où des agents IA recherchent automatiquement dans des dépôts de documents pour accomplir des tâches. Ces flux de travail traitent généralement de volumineuses quantités de documents, ce qui fait du coût par page une variable critique pouvant déterminer la viabilité économique d'un projet ou sa défaite dès le départ.
