あらゆる企業のAIチームは、最終的にPDFから有用なデータを抽出するという同じボトルネックに直面します。ドキュメントは整理されておらず、テーブルは奇妙で、レイアウトは一貫性がなく、実際に機能するツールは、あなたが切実に必要としていることを知っているかのように高額な料金を請求します。Cohereは、より良いプランを持っていると考えています。
その企業は木曜日にParse 5をリリースし、これはPDF、スライド、画像を構造化されたMarkdownに変換することを目的とした23億パラメータのビジョン言語モデルである。この製品のアピールポイントは、市場で最も正確なパーサーであるということではなく、十分な精度を維持しながら、スケールして実行するのに十分に安価であるということである。
Parse 5が実際に行うこと
Parse 5(モデルID:parse-v5.0)は約4.6GBのサイズで、8Kのコンテキストウィンドウを備えています。AIパイプラインが対応に苦戦するような、複雑なテーブル、ネストされたリスト、フォーム、キャプション付き画像、マルチカラムレイアウト、ページ境界などのドキュメントを処理するように設計されています。
テーブルはHTMLとしてエクスポートされます。視覚的要素には境界ボックスが付きます。読み取り順序は保持され、これは表面上よりも重要です。段落の順序が誤ると、下流の検索システムに静かに悪影響を及ぼす可能性があるからです。
このモデルは9つの主要な商用言語をサポートしており、金融、保険、法律、科学分野での多国籍展開に必要な要件を満たします。Cohereはまた、セキュアなデプロイメントオプションを提供しており、これらの分野の企業がガードレールなしで第三者のAPIを通じて機密文書を送信することを好まないという現実を反映しています。
重要な数字
APIの料金は1,000ページあたり1.50ドルから開始します。大量のドキュメントを処理する組織向けに、CohereのModel Vaultは利用状況に応じて23%から61%の段階的割引を提供しています。
具体的な数値で言うと、Cohereは、毎月1300万ページのワークフローを直列のAPI呼び出しではなくModel Vaultを使用することで、約14万4千ドルを削減できると推定しています。
代表的なハードウェア上でスループットは1秒あたり4.5ページに達します。この速度は、いくつかのオープンソースの代替案を上回っています。
CohereのParseBenchベンチマークにおいて、Parse 5の平均スコアは79.2です。テーブルのパーススコアは87.0、信頼性(出力がソースドキュメントをどれだけ正確に反映しているか)は86.6です。
参照として、Mistral OCR 4は同じベンチマークで74.5のスコアを記録しています。LlamaParse Cost Effectiveは78.3です。Parse 5は両方を上回っていますが、Cohereは、より大型で高価なモデルが依然として原始的な精度でそれを上回ると明言しています。
この要素がエンタープライズAIスタックのどこに位置するか
Parseの5つのプラグインをCohereの既存のエコシステムにパースし、Microsoft FoundryおよびAWS SageMakerと統合します。この相互運用性が重要なのは、ほとんどの企業がAIスタックをゼロから構築していないからです。彼らは新しいツールを既存のクラウドインフラに追加しているだけです。
このモデルは、AIエージェントがドキュメントリポジトリを自律的に検索してタスクを完了する、ますます人気を博しているエージェント型検索パイプラインにも対応しています。これらのワークフローは膨大な量のドキュメントを処理するため、1ページあたりのコストは、プロジェクトが経済的に実現可能かどうかを左右する重要な変数となります。
