Назад в ленту

Cohere Parse 5: быстрый парсер документов для бизнеса по цене кофе

Новый релиз Cohere проигрывает топовым ИИ в точности, но снижает затраты на обработку PDF до смешных копеек.

Корпоративный ИИ давно уперся в скучную, но очень дорогую проблему: чтобы скормить нейросети тысячи PDF-отчетов, сканы счетов и презентации, их нужно сначала разобрать на запчасти. А инструменты для этого либо безбожно ломают таблицы и схемы, либо стоят как крыло от самолета. В четверг Cohere выкатила Parse 5 — модель, которая сознательно отказалась от борьбы за топ-1 в бенчмарках ради радикального снижения цены.

Parse 5 — это визуально-языковая модель (Vision Language Model) на 2.3 миллиарда параметров. На вход она принимает страницу PDF, слайд PowerPoint или обычный JPEG, а на выходе выдает структурированный Markdown. Весь процесс идет за один проход через архитектуру North-Micro-Vision-Instruct, разработанную Cohere Labs. Размер модели в памяти — около 4.6 гигабайт, контекстное окно — 8192 токена.

Архитектура и возможности

Большинство конкурентов до сих пор работают по схеме «OCR плюс отдельная языковая модель»: сначала распознают символы, потом склеивают логику. Cohere свернула этот конвейер в одну VLM, что заметно ускоряет обработку и снижает количество точек отказа.

Модель поддерживает девять языков со стабильной точностью: английский, арабский, французский, немецкий, итальянский, японский, корейский, португалийский и испанский. Для остальных языков заявлена поддержка zero-shot, но с оговоркой про пониженную точность.

Доступны два режима вывода:

  • Default — возвращает чистую Markdown-строку на каждую страницу с сохранением порядка чтения.
  • Blocks — разбивает документ на типизированные элементы, где у каждой таблицы есть собственный HTML-код, координаты рамки (bounding box) и текстовое описание. Этот режим критически важен для RAG-систем, которым нужна трассировка источников.
  • Где запустить и сколько стоит

    Parse 5 уже доступна через Cohere API, платформу Model Vault для защищенного корпоративного инференса, Microsoft Foundry и AWS SageMaker. Цена заявлена очень агрессивная: 1.50 доллара за 1000 обработанных страниц. По данным самой Cohere, при масштабе в 750 миллионов документов в год (типичный объем для крупного финансового холдинга) переход с GPT-5.5 на Parse 5 экономит более 98% бюджета на инференс.

    Бенчмарк ParseBench: честное серебро

    В собственном тесте ParseBench модель набрала 79.2 балла по трем измерениям: таблицы, верность контента и семантическое форматирование. Для понимания расклада приведем оценки конкурентов:

  • GPT-5.5 — 84.4
  • Opus 4.8 — 84.3
  • Gemini 3.5 Flash — 81.8
  • Parse 5 — 79.2
  • LlamaParse Cost Effective — 78.3
  • Mistral OCR 4 — 74.5
  • Databricks AI Parse — 72.4
  • Azure Document Intelligence — 69.3
  • Cohere открыто признает, что не претендует на первое место по чистой точности. Вице-президент по AI Search Нильс Раймерс (Nils Reimers) прямо заявил, что проблема парсинга документов не в распознавании букв, а в сохранении структуры и смысла. Когда на странице перемешаны таблицы, диаграммы, графики и форматирование, большинство инструментов теряют структуру или начинают галлюцинировать контент.

    Из теста намеренно исключены две категории: Layout и Chart. Вместо попыток извлечь сырые данные из графиков, Parse 5 дает их текстовое описание. Разработчики считают, что попытка вытащить цифры из диаграммы часто ведет к потере цвета, типа линии и других визуальных нюансов, что критично для агентских сценариев. Поддержку извлечения данных из графиков завезут в следующей версии.

    Конкурентный ландшафт

    Рынок парсеров сейчас поделен на три лагеря. Универсальные frontier-модели (GPT-5.5, Opus 4.8, Gemini 3.5 Flash) дают топовую точность, но тащат за собой ценник и задержки большой модели на каждую страницу. Специализированные OCR-движки вроде Mistral OCR 4 или LlamaParse держат середину. Облачные документ-сервисы гиперскейлеров (AWS Textract, Google Document AI, Azure Document Intelligence) берут удобством интеграции в экосистему, хотя в тестах Cohere занимают нижние строчки.

    Кевин Петри (Kevin Petrie), вице-президент по исследованиям BARC US, отмечает, что анализ документов является главным сценарием для ИИ в бизнесе. По опросу его компании, 62% организаций уже внедрили такие инструменты, потому что именно в неструктурированных данных лежит проприетарный контекст, нужный для запуска агентских систем.

    Стефани Вальтер (Stephanie Walter) из HyperFRAME Research считает, что Parse 5 удачно занимает нишу между устаревшим OCR и дорогими универсальными моделями. Для корпоративного масштаба важнее предсказуемая цена и приватное развертывание, чем победа в каждом тесте.

    Что важнее: балл или пригодность

    Специалисты сходятся в одном: парсинг — это первый фильтр качества во всем стеке корпоративного ИИ. Если таблицы, заголовки и порядок чтения потеряны на этапе загрузки, никакие более крупные эмбеддинги или мощные LLM не восстановят эту структуру. Поэтому перед закупкой решения стоит гонять парсер не на синтетических тестах, а на собственных самых проблемных документах, замеряя точность ответов агентов на их основе.

    Главный вопрос при выборе парсера давно перестал быть техническим. Звучит он теперь так: «Не «прочитал ли ИИ PDF», а «может ли теперь агент правильно использовать эту информацию». И Cohere Parse 5 здесь предлагает весьма прагматичный ответ: чуть меньше точности в обмен на радикальное снижение стоимости и скорость внедрения в высоконагруженных процессах.

    Будем следить, как модель покажет себя на реальных задачах в РФ и СНГ — особенно интересно, как локализация для русского языка будет работать за пределами заявленных девяти языков.

    Справка по теме (FAQ)
    Чем Cohere Parse 5 отличается от обычного OCR?
    Классический OCR распознает только символы, тогда как Parse 5 — это визуально-языковая модель. Она сохраняет структуру документа: таблицы в HTML, координаты изображений, порядок чтения и описания графиков. Все это обрабатывается за один проход без склейки отдельных конвейеров.
    Какова цена обработки документов через Parse 5?
    Стоимость составляет 1.50 доллара за 1000 страниц при использовании Cohere API. Для крупных корпоративных клиентов с высокими объемами доступна платформа Model Vault с приватным инференсом.
    Какие языки поддерживает Parse 5?
    Стабильная точность заявлена для девяти языков: английского, арабского, французского, немецкого, итальянского, японского, корейского, португальского и испанского. Для других языков доступна поддержка zero-shot, но с возможной пониженной точностью.
    Где доступна модель для запуска?
    Parse 5 можно подключить через Cohere API, защищенную платформу Model Vault, сервис Microsoft Foundry и облачную платформу AWS SageMaker.