Каждая корпоративная команда ИИ в конечном итоге сталкивается с одной и той же проблемой: получение полезных данных из PDF-файлов. Документы запутанные, таблицы странные, макеты несогласованные, а инструменты, которые действительно работают, часто взимают плату, как будто знают, что вы отчаялись. Cohere считает, что у них есть лучшее предложение.
Компания выпустила Parse 5 в четверг — модель визуального языка с 2,3 миллиардами параметров, предназначенную для преобразования PDF-файлов, слайдов и изображений в структурированный Markdown. Суть предложения не в том, что это самый точный парсер на рынке, а в том, что он достаточно точен и при этом достаточно дешев, чтобы работать в масштабе.
Что на самом деле делает Parse 5
Parse 5 (идентификатор модели: parse-v5.0) имеет размер около 4,6 ГБ и окно контекста 8K. Он создан для обработки документов, вызывающих проблемы у AI-конвейеров: сложных таблиц, вложенных списков, форм, изображений с подписями, многостолбцовых макетов и границ страниц.
Таблицы экспортируются в формате HTML. Визуальные элементы сопровождаются ограничивающими рамками. Порядок чтения сохраняется, что важно больше, чем кажется, поскольку неправильная последовательность абзацев может незаметно нарушить работу последующей системы извлечения данных.
Модель поддерживает девять основных коммерческих языков, что удовлетворяет требованиям для многонациональных развертываний в финансовой, страховой, юридической и научной сферах. Cohere также предлагает варианты безопасного развертывания, что учитывает реальность: предприятия в этих отраслях не стремятся отправлять конфиденциальные документы через сторонние API без защитных механизмов.
Числа, которые имеют значение
Ценообразование API начинается от 1,50 $ за 1 000 страниц. Для организаций, обрабатывающих документы в крупных объемах, Model Vault от Cohere предлагает поэтапные скидки от 23% до 61% в зависимости от уровня использования.
Чтобы выразить это конкретно: Cohere оценивает, что рабочий процесс объемом 13 миллионов страниц в месяц может сэкономить примерно 144 000 долларов, используя Model Vault вместо прямых вызовов API.
Пропускная способность составляет 4,5 страницы в секунду на типовом оборудовании. Эта скорость превышает некоторые альтернативы с открытым исходным кодом.
На бенчмарке ParseBench от Cohere Parse 5 показывает средний результат 79,2. Его способность извлекать таблицы достигает 87,0, а точность, то есть насколько точно выходные данные отражают исходный документ, составляет 86,6.
Для сравнения, Mistral OCR 4 показывает результат 74,5 на том же тесте. LlamaParse Cost Effective набирает 78,3. Parse 5 превосходит оба, однако Cohere открыто заявляет, что более крупные и дорогие модели всё ещё превосходят его по абсолютной точности.
Где это размещается в стеке корпоративного ИИ
Интегрируйте 5 модулей в существующую экосистему Cohere и подключитесь к Microsoft Foundry и AWS SageMaker. Эта совместимость важна, поскольку большинство предприятий не создают свои ИИ-стеки с нуля. Они добавляют новые инструменты к существующей облачной инфраструктуре.
Модель также оптимизирована для агентных систем извлечения данных — всё более популярной архитектуры, в которой ИИ-агенты автономно ищут информацию в репозиториях документов для выполнения задач. Такие рабочие процессы обычно обрабатывают огромные объемы документов, поэтому стоимость за страницу становится критически важным параметром, определяющим, будет ли проект экономически целесообразным или обречен на провал с самого начала.
