每個企業 AI 團隊最終都會遇到相同的瓶頸:從 PDF 中提取有用的資料。這些文件雜亂無章,表格奇特,版面不一致,而真正有效的工具往往收費高昂,彷彿知道你別無選擇。Cohere 認為自己能提供更好的方案。
公司於週四發布了 Parse 5,這是一個擁有 23 億參數的視覺語言模型,旨在將 PDF、簡報和圖像轉換為結構化的 Markdown。其賣點並非它是市場上最準確的解析器,而是它在足夠準確的同時,成本足夠低,能夠實際大規模運行。
Parse 5 實際上所做的事
Parse 5(模型 ID:parse-v5.0)大小約為 4.6 GB,具備 8K 上下文窗口,專為處理讓 AI 流程卡頓的文件而設計:複雜的表格、嵌套清單、表單、帶標題的圖片、多欄佈局和頁面邊界。
表格會以 HTML 格式匯出。視覺元素附有邊界框。閱讀順序已保留,這一點比表面上看起來更重要,因為段落順序錯誤會悄然破壞下游檢索系統。
該模型支援九種主要商業語言,滿足金融、保險、法律和科學領域跨國部署的需求。Cohere 同時提供安全的部署方案,回應了這些領域的企業不願在缺乏保障的情況下,將敏感文件透過第三方 API 傳送的現實考量。
重要的數字
API 定價從每 1,000 頁 $1.50 起。對於處理大量文件的機構,Cohere 的 Model Vault 提供根據使用量而定的階梯式折扣,範圍從 23% 至 61%。
具體來說:Cohere 評估,每月 1300 萬頁的工作流程,若使用 Model Vault 而非直接透過 API 調用,可節省約 $144K。
在代表性硬體上,吞吐量達到每秒 4.5 頁。此速度使其優於某些開源替代方案。
在 Cohere 的 ParseBench 基準測試中,Parse 5 的平均分為 79.2。其表格解析分數達到 87.0,而忠實度(即輸出準確反映原始文件的程度)為 86.6。
作為參考,Mistral OCR 4 在同一基準測試中得分為 74.5。LlamaParse 成本效益版得分為 78.3。Parse 5 的表現優於兩者,但 Cohere 明確表示,更大、更昂貴的模型在原始準確率上仍優於它。
這在企業 AI 架構中的位置
Parse 5 與 Cohere 現有的生態系統無縫整合,並與 Microsoft Foundry 和 AWS SageMaker 連接。這種互操作性至關重要,因為大多數企業並非從零開始構建其 AI 架構,而是將新工具附加到現有的雲端基礎設施上。
該模型也適用於代理檢索流程,這是一種日益流行的架構,其中 AI 代理可自主搜尋文件庫以完成任務。這些工作流程通常需要處理大量文件,因此每頁成本成為關鍵變數,可能決定專案是否具有經濟可行性或從一開始就失敗。
