Кожна підприємницька команда з ШІ рано чи пізно стикається з тим самим обмеженням: отримання корисних даних з PDF. Документи непорядні, таблиці дивні, макети неоднорідні, а інструменти, які справді працюють, зазвичай стягують плату, ніби знають, що ви відчайдушні. Cohere вважає, що має кращу пропозицію.
Компанія випустила Parse 5 у четвер — візуальну мовну модель з 2,3 мільярдами параметрів, призначену для перетворення PDF, слайдів та зображень у структурований Markdown. Суть пропозиції не в тому, що це найточніший парсер на ринку, а в тому, що він достатньо точний і при цьому досить дешевий, щоб його можна було масштабно використовувати.
Що насправді робить Parse 5
Parse 5 (ідентифікатор моделі: parse-v5.0) має розмір приблизно 4,6 ГБ і вік контексту 8K. Він створений для обробки документів, які зазвичай перешкоджають роботі AI-конвеєрів: складні таблиці, вкладені списки, форми, зображення з підписами, багатоколонкові макети та межі сторінок.
Таблиці експортуються як HTML. Візуальні елементи супроводжуються рамками. Зберігається порядок читання, що має більше значення, ніж здається, бо неправильна послідовність абзаців може тихо зруйнувати систему вилучення даних.
Модель підтримує дев’ять основних комерційних мов, що задовольняє вимоги міжнародних впроваджень у фінансах, страховій сфері, юриспруденції та науковій галузі. Cohere також пропонує безпечні варіанти розгортання, що враховує реальність: підприємства цих секторів не зацікавлені у надсиланні конфіденційних документів через сторонні API без захисних механізмів.
Числа, що мають значення
Ціни на API починаються від $1,50 за 1 000 сторінок. Для організацій, які обробляють великий обсяг документів, Model Vault від Cohere пропонує диференційовані знижки від 23% до 61% залежно від рівня використання.
Щоб виразити це конкретно: Cohere оцінює, що робочий процес з обсягом 13 мільйонів сторінок на місяць може зекономити приблизно 144 тис. доларів США, використовуючи Model Vault замість прямих викликів API.
Пропускна здатність становить 4,5 сторінки за секунду на типовому обладнанні. Ця швидкість перевищує деякі відкриті альтернативи.
На бенчмарку ParseBench від Cohere Parse 5 показує середній результат 79,2. Його розпізнавання таблиць досягає 87,0, а відповідність, тобто точність, з якою вихід відображає вихідний документ, становить 86,6.
Для порівняння, Mistral OCR 4 показує 74,5 за тим самим тестом. LlamaParse Cost Effective має результат 78,3. Parse 5 перевершує обидва, хоча Cohere відкрито зазначає, що більші та дорожчі моделі все ще перевершують його за чистою точністю.
Де це місце в стеку корпоративного штучного інтелекту
Підключіть 5 плагінів до існуючої екосистеми Cohere та інтегруйте з Microsoft Foundry та AWS SageMaker. Ця взаємодія має значення, оскільки більшість підприємств не створюють свої AI-стеки з нуля. Вони додають нові інструменти до існуючої хмарної інфраструктури.
Модель також оптимізована для агентних систем отримання даних — все більш популярної архітектури, де AI-агенти автономно шукають у репозиторіях документів, щоб виконати завдання. Такі робочі процеси зазвичай обробляють величезні обсяги документів, тому вартість за сторінку є критичною змінною, яка може вирішити, чи буде проект економічно доцільним чи зазнає невдачі ще до початку.
